Source-linked AI summary

Decomposed Prompting: A Modular Approach for Solving Complex Tasks

Tushar Khot, Harsh Trivedi, Matthew Finlayson, Yao Fu, Kyle Richardson, Peter Clark, Ashish Sabharwal

arXiv:2210.02406v2cs.CL

TL;DR

복잡한 과제에서 많거나 어려운 추론 단계가 필요하면 few-shot prompting은 한계가 있다. Decomposed Prompting은 더 단순한 하위 과제를 별도로 prompting된 handler에 위임하며, 네 가지 과제와 일반화 설정 전반에서 기존 방법을 능가한다.

  • 문제

    과제에 더 많거나 어려운 추론 단계가 필요해지면 few-shot demonstration만으로는 불충분해진다.

  • 방법

    Decomposed Prompting은 더 단순한 하위 과제를 별도로 prompting된 LLM 또는 symbolic·learned function에 위임하는 prompting program을 구축한다.

  • 결과

    Decomposed Prompting은 네 가지 과제와 일반화 설정 전반에서 기존 방법을 능가하며, 별도 prompt가 어려운 하위 과제의 성능을 향상한다.

  • 시사점 및 한계

    Decomposed Prompting은 모듈화되고 독립적으로 최적화된 하위 과제를 통해 복잡한 과제를 해결하는 효과적인 few-shot paradigm이다.

  • 시사점 및 한계

    decomposer는 GPT3-sized model을 사용한다. 더 작은 model은 필요한 structured output을 안정적으로 생성하지 못하기 때문이다.

Abstract

from arXiv · show

Few-shot prompting is a surprisingly powerful way to use Large Language Models (LLMs) to solve various tasks. However, this approach struggles as the task complexity increases or when the individual reasoning steps of the task themselves are hard to learn, especially when embedded in more complex tasks. To address this, we propose Decomposed Prompting, a new approach to solve complex tasks by decomposing them (via prompting) into simpler sub-tasks that can be delegated to a library of prompting-based LLMs dedicated to these sub-tasks. This modular structure allows each prompt to be optimized for its specific sub-task, further decomposed if necessary, and even easily replaced with more effective prompts, trained models, or symbolic functions if desired. We show that the flexibility and modularity of Decomposed Prompting allows it to outperform prior work on few-shot prompting using GPT3. On symbolic reasoning tasks, we can further decompose sub-tasks that are hard for LLMs into even simpler solvable sub-tasks. When the complexity comes from the input length, we can recursively decompose the task into the same task but with smaller inputs. We also evaluate our approach on textual multi-step reasoning tasks: on long-context multi-hop QA task, we can more effectively teach the sub-tasks via our separate sub-tasks prompts; and on open-domain multi-hop QA, we can incorporate a symbolic information retrieval within our decomposition framework, leading to improved performance on both tasks. Datasets, Code and Prompts available at https://github.com/allenai/DecomP.

1 서론

Decomposed Prompting (DECOMP)은 더 간단한 sub-task를 별도로 prompt된 task-specific handler에 위임하여 복잡한 task를 해결하는 어려움을 다룬다. 모듈식 설계는 더 풍부한 sub-task supervision, 재귀적 decomposition, task 간 재사용, 독립적인 debugging 또는 교체를 지원한다.

  • 1 서론: DECOMP는 복잡한 task를 더 간단한 sub-task로 분해하고, 각 sub-task를 해당 sub-task 전용 LLM이 처리하도록 하며, decomposer와 각 handler에 별도로 prompt를 제공한다.decomposer는 sub-task의 순서를 지정하고, 각 sub-task를 해당 handler에 위임한다.
  • 1 서론: few-shot 및 Chain-of-Thought prompting과 달리, DECOMP는 복잡한 task의 완전한 reasoning step을 직접 제공하는 대신 sub-task를 사용해 절차를 기술한다.few-shot prompting은 예시를 제공하는 반면, Chain-of-Thought prompting은 각 답변에 이르는 reasoning step을 기술한다.
  • 1 서론: DECOMP는 decomposer를 최상위 program으로, handler를 더 간단한 function을 구현하는 모듈식·debugging 가능·업그레이드 가능한 구성요소로 간주한다.성능이 낮은 handler는 독립적으로 debugging하거나 대체 prompt, trained model 또는 symbolic function으로 교체할 수 있다.
  • 1 서론: handler는 복잡한 task prompt보다 더 풍부한 example을 받을 수 있고, 필요할 때 재귀적으로 분해될 수 있으며, 여러 task에서 공유될 수 있다.이러한 특성 덕분에 더 간단한 sub-task를 독립적으로 가르치고 다른 task solution의 구성요소로 재사용할 수 있다.
  • 1 서론: 저자들은 GPT3 model을 사용해 8개의 challenging dataset에서 DECOMP를 기존 연구와 비교 평가하고, sub-task를 분리하는 것이 복잡한 task solving을 개선하는지 검증한다.서론에서는 kth-letter extraction과 list reversal을 평가 task의 예시로 강조한다.

2 관련 연구

선행 연구는 few-shot prompting, chain-of-thought reasoning, 그리고 language model 또는 symbolic function의 modular composition을 multi-step task에 적용한다. Decomposed Prompting은 고정된 설계가 아니라 다양하고 재귀적이며 비선형적인 decomposition structure를 지원한다는 점에서 다르다.

  • Multi-Step Reasoning을 위한 Few-shot Prompt: Chain-of-Thought prompting을 통해 중간 추론 단계를 제공함으로써 few-shot prompting을 multi-step reasoning으로 확장했다(Wei et al., 2022; Chowdhery et al., 2022).LLM은 소수의 prompting example만으로도 다양한 NLP task를 학습할 수 있다(Brown et al., 2020).
  • Multi-Step Reasoning을 위한 Few-shot Prompt: 다른 접근법은 여러 LLM을 조합하거나 LLM과 symbolic function을 결합해, 사전에 정의된 decomposition structure를 갖춘 특화 시스템을 구성한다(Press et al., 2022; Parisi et al., 2022; Gao et al., 2022; Schick et al., 2023).
  • Multi-Step Reasoning을 위한 Few-shot Prompt: Least-to-most prompting (Zhou et al., 2023)과 successive prompting (Dua et al., 2022)은 하나의 prompt 또는 model로 sub-question을 생성하고, 다른 prompt 또는 model로 이를 순차적으로 답한다.
  • Multi-Step Reasoning을 위한 Few-shot Prompt: Least-to-most prompting 및 successive prompting과 달리, Decomposed Prompting은 recursion과 기타 비선형 형식을 포함한 다양한 decomposition structure를 지원한다.
  • Multi-Step Reasoning을 위한 Modular Approach: 이 접근법은 question answering 및 관련 task를 위한 neural modular modeling, 특히 decomposition에 learned next-question generation이 포함되는 Text Modular Networks를 기반으로 한다(Khot et al., 2021).

3 DECOMPOSED PROMPTING

DECOMP는 decomposer LLM을 사용해 복잡한 질의를 특화된 하위 작업 함수에 위임하는 prompting program을 구성하고 실행한다. 이 모듈형 프레임워크는 독립적인 prompt 설계, symbolic 또는 learned handler, 계층적·재귀적 decomposition, 외부 API 호출을 지원한다.

  • 3 DECOMPOSED PROMPTING: DECOMP의 decomposer LLM은 더 단순한 하위 질의를 보조 하위 작업 함수로 보내는 prompting program을 생성하며, controller는 종료될 때까지 입력과 출력을 전달한다.이 program은 각 하위 작업 함수 및 질의를 그 답과 짝지은 tuple로 구성되며, 마지막에는 최종 prediction이 온다.
  • 3 DECOMPOSED PROMPTING: 각 하위 작업 handler는 독립적인 in-context prompt, 또 다른 prompting program, 또는 calculator나 특화된 supervised model 같은 symbolic 또는 learned function일 수 있다.decomposer는 최종 answer와 이를 얻는 데 사용한 하위 작업 호출 sequence를 모두 포함한 examples로 학습된다.
  • 3.1 DECOMPOSED PROMPTS: 예시 string task에서 DECOMP는 처리를 word 수집, character 추출, concatenation으로 나누며, 원래 complex-task examples와 독립적으로 유지되는 separate prompts를 사용한다.Figure 2는 decomposer가 questions와 sub-tasks를 지정하는 방식을 보여주며, prompts는 letters 추출이나 delimiter 없이 병합하기 같은 더 일반적인 operation도 표현할 수 있다.
  • 3.1 DECOMPOSED PROMPTS: foreach와 같은 symbolic control structure는 array를 순회하고 앞선 answer를 참조해 decomposition을 지정하는 데 필요한 수작업을 줄인다.동등한 하위 질의를 직접 생성할 수 있으므로 이 helper는 선택 사항이다.
  • 3.2 PROMPT EXECUTION AND INFERENCE: 추론 중 DECOMP는 다음 question과 sub-task를 반복적으로 생성하고, question을 해당 handler로 전달하며, [EOQ] marker가 나타나면 직전 answer를 반환한다.실험에서 inference는 greedy search로 MAP answer를 근사한다.
  • 3.3 DECOMP CAPABILITIES: Hierarchical decomposition은 어려운 하위 작업을 더 단순한 operation으로 다시 나눈다. 예를 들어 직접적인 kth-letter 식별이 어려울 때 string을 letters로 분할하고 kth item을 선택한다.DECOMP는 shared split prompt를 포함해 기존 하위 작업 prompts를 재사용할 수 있다.
  • 3.3 DECOMP CAPABILITIES: Recursive decomposition은 decomposer를 재귀적으로 호출해 동일한 형식의 subproblem을 처리하며, external API calls를 통해 handler가 retrieval을 위해 Elasticsearch나 Google search 같은 system을 사용할 수 있다.이 framework는 list reversal에 recursion을 적용하고 single-hop open-domain question에 retrieval을 통합한다.

4 사례 연구

네 가지 symbolic 및 textual multi-hop reasoning task에서 DECOMP는 어려운 sub-task를 별도 handler에 할당하고 길거나 복잡한 입력을 재귀적으로 분해함으로써 few-shot prompting을 일관되게 개선한다. CoT 및 관련 baseline보다 우수하고, 더 긴 입력이나 보지 못한 composition으로 더 잘 일반화하며, 표적화된 오류 수정과 외부 지식 활용을 지원한다.

  • Letter concatenation: DECOMP는 letter concatenation에서 CoT 및 least-to-most prompting보다 우수하며, 단일 prompt보다 별도의 sub-task prompt가 어려운 연산을 더 효과적으로 학습시킨다.비교에서는 네 개의 100-example dataset을 사용해 보지 못한 letter position, 더 긴 입력, 새로운 delimiter로의 일반화를 평가한다.
  • Letter concatenation: DECOMP는 sequence length가 증가해도 거의 100% accuracy를 유지하는 반면, CoT 기반 접근법은 눈에 띄게 하락하고 performance gap은 확대된다.Figure 7은 서로 다른 input length에서 k=3 letter concatenation의 EM을 보고한다.
  • CommaQA-E: CommaQA-E에서 DECOMP는 decomposition granularity와 evaluation split 전반에서 CoT보다 더 정확하고, 보지 못한 relation composition으로 일반화하며, 더 세분화된 question-specific prompt의 이점을 얻는다.더 세분화된 decomposition은 각 question type에 더 많은 example을 제공해 single-hop question-answering accuracy를 높인다.
  • Open-domain multi-hop QA: Open-domain multi-hop QA에서 Decomp-Ctxt model은 모든 setting에서 No-Ctxt model보다 우수하며, Codex-with-HotpotQA 조건 하나를 제외하면 강력한 NoDecomp-Ctxt retrieval baseline도 능가한다.결과는 세 dataset에 걸친 direct QA prompt를 사용하며, 추가 결과는 appendix에 보고된다.
  • 오류 수정을 위한 CoT post-processing: 표적화된 DECOMP post-processing은 MultiArith에서 answer extraction을 17 points 개선해 78에서 95로 높이며, prompt 선택과 decomposition scheme 전반에서 향상이 일관되게 유지된다.전용 GPT3 answer-extraction handler가 CoT output의 formatting error를 처리한다.

5 결론 … A.2 오픈 도메인 QA를 위한 하이퍼파라미터 튜닝

Decomposed Prompting은 더 단순한 하위 과제를 위한 modular few-shot prompt를 구성해 복잡한 과제를 해결하며, 이를 최적화하거나 재귀적으로 분해하거나 symbolic system으로 대체할 수 있다. 부록에서는 오픈 도메인 QA 말뭉치의 구성 방법과 모델군별 retrieval depth 조정 방법을 설명한다.

  • 5 결론: Decomposed Prompting은 더 단순한 하위 과제를 modular prompting program으로 조합해 복잡한 과제의 해법을 구성한다.각 하위 과제는 고유한 few-shot prompt를 사용하므로 독립적인 최적화와 추가 분해가 가능하다.
  • 5 결론: 이 modular design을 통해 개별 prompt를 독립적으로 최적화하거나 추가로 분해하거나 symbolic system으로 대체할 수 있다.
  • 5 결론: Answer F1은 예측값과 ground-truth answer를 token bag으로 간주하고 precision과 recall을 계산한다.
  • A.1 오픈 도메인 QA를 위한 retrieval corpus: 오픈 도메인 QA에서 HotpotQA는 연결된 Wikipedia corpus를 사용하는 반면, 2WikiMultihopQA와 MuSiQue는 reading-comprehension dataset에서 변환된다.후자의 dataset에서는 train, development, test 질문에 포함된 문단을 결합해 corpus를 구성한다.
  • A.2 오픈 도메인 QA를 위한 하이퍼파라미터 튜닝: Retrieval depth K는 성능을 최대화하도록 dataset별로 100개의 held-out question에 grid search를 적용해 선택한다.NoDecomp-Ctxt와 Decomp-Ctxt는 서로 다른 candidate range를 사용하며, GPT3와 Flan-T5-* model에도 서로 다른 range를 적용한다.
  • A.2 오픈 도메인 QA를 위한 하이퍼파라미터 튜닝: GPT3와 Flan-T5-*에는 서로 다른 retrieval-depth search range가 적용되는데, GPT3가 더 많은 retrieved text를 수용할 수 있기 때문이다.

A.3 추가 결과

MuSiQue, HotpotQA, 2WikiMultihopQA에 대한 추가 결과를 보고한다.

  • MuSiQue 데이터셋에 대한 결과를 Figure 13에 제시한다.
  • HotpotQA 데이터셋에 대한 결과를 Figure 14에 제시한다.
  • 2WikiMultihopQA 데이터셋에 대한 결과를 Figure 15에 제시한다.

A.3.1 MUSIQUE

MuSiQue에서 검색은 No-Ctxt QA보다 성능을 크게 향상시키며, DecomP 기반 Decomp-Ctxt QA는 모든 설정에서 추가적인 향상을 제공한다.

  • A.3.1 MUSIQUE: 검색은 모든 MuSiQue 설정에서 No-Ctxt QA보다 상당한 성능 향상을 가져오며, DecomP 기반 Decomp-Ctxt QA는 추가로 성능을 높인다(Fig. 13).

A.3.2 HOTPOTQA

HotpotQA에서는 retrieval을 도입하면 큰 성능 향상이 나타나지만, DecomP의 개선은 대부분 더 작은 모델에 집중된다.

  • A.3.2 HOTPOTQA: Retrieval은 HotpotQA 결과에서 큰 성능 향상을 가져온다.전체 결과는 Fig. 14에 제시되어 있다.
  • A.3.2 HOTPOTQA: HotpotQA에서 DecomP의 성능 향상은 대부분 더 작은 모델에서 관찰된다.

A.3.3 2WIKIMULTIHOPQA

2WikiMultihopQA에서는 retrieval을 도입하면 큰 향상이 나타나며, DecomP를 추가하면 NoDecomp-Ctxt보다 상당한 향상을 얻는다.

  • A.3.3 2WIKIMULTIHOPQA: Fig. 15에 나타난 것처럼 2WikiMultihopQA에서 retrieval을 도입하면 큰 향상이 나타난다.
  • A.3.3 2WIKIMULTIHOPQA: 이 데이터셋에서 DecomP는 NoDecomp-Ctxt와 비교해 추가로 상당한 향상을 제공한다.

B 수학 QA · C CommAQA에 대한 스케일의 영향 · D 모든 프롬프트에서의 결과

Decomposed Prompting은 chain-of-thought 식별과 답 추출을 분리해 수학 QA를 개선하며, GSM8K와 MultiArith에서 Chain-of-Thought를 능가한다. CommAQA에서는 더 약하고 작은 모델일수록 성능이 하락하지만, 성능이 0에 가까워질 때까지 DECOMP가 CoT보다 앞선다.

  • B 수학 QA: DECOMP는 수학 QA를 chain-of-thought 추론 식별과 그 답 추출로 분리하며, 후자를 두 번째 GPT3 기반 sub-module이 수행한다.이는 “answer is” 다음에 나오는 숫자를 찾는 것과 같이 일반화가 제한적인 패턴에 의존하는 문제를 피한다.
  • B 수학 QA: DECOMP는 GSM8K에서 CoT보다 14 points, MultiArith에서 17 points 향상되어, 수학 QA에서 단순한 decomposition이 가져오는 이득을 보여준다.이 결과는 chain-of-thoughts에서 비추출형 답변 생성에도 적용할 수 있음을 시사한다.
  • C CommAQA에 대한 스케일의 영향: 모델의 크기와 성능이 감소할수록 CommAQA에서 CoT와 DECOMP 모두 성능을 잃는다.비교 대상에는 text-curie-001, text-davinci-001, text-davinci-002가 포함된다.
  • C CommAQA에 대한 스케일의 영향: DECOMP는 더 약한 모델 전반에서 CoT를 계속 능가하지만, curie-001에서는 성능이 0에 가까워진다.이러한 스케일 추세는 Fig. 17에 요약되어 있다.
  • C CommAQA에 대한 스케일의 영향: CommAQA에서는 text-curie-001, text-davinci-001, text-davinci-002를 비교하며, 2048-token context windows로 제한된 모델에는 더 짧은 프롬프트를 사용한다.축소된 프롬프트는 curie-001과 davinci-001의 더 작은 context windows에 맞도록 구성되었다.

D.1 문자 연결의 프롬프트별 결과

공백 구분자를 사용하는 문자 연결에서 DECOMP는 테스트한 모든 N 값과 P1–P3 프롬프트에 걸쳐 chain-of-thought 및 Least-to-Most prompting보다 일관되게 우수한 성능을 보인다. 결과는 서로 다른 프롬프트에서도 안정적으로 유지된다.

  • D.1 문자 연결의 프롬프트별 결과: 결과는 P1, P2, P3 프롬프트 전반에서 안정적이다.
  • D.1 문자 연결의 프롬프트별 결과: 평가에서는 문자 연결에 공백 구분자를 사용하면서 N을 변화시킨다.
  • D.1 문자 연결의 프롬프트별 결과: DECOMP는 테스트한 모든 N 값과 P1, P2, P3 프롬프트에 걸쳐 chain-of-thought 및 Least-to-Most prompting보다 우수한 성능을 보인다.공백 구분자를 사용하는 문자 연결 과제에서 비교 결과를 보고한다.

D.2 COMMAQA의 프롬프트별 결과

CommAQA에서 DECOMP는 평가된 모든 prompt set에서 CoT보다 우수하다.

  • D.2 COMMAQA의 프롬프트별 결과: DECOMP는 CommAQA에서 평가된 각 prompt set에서 CoT보다 우수하다.비교 대상은 Figure 19에 보고된 모든 prompt를 포괄한다.

E 분해 방식의 효과

대안적 분해 방식은 문자 연결과 리스트 뒤집기에서 성능을 유지하거나 향상했지만, 강건성과 GPT3 호출 비용에서 서로 다른 절충을 보였다. 두 대안 모두 CoT보다 우수했다.

  • E 분해 방식의 효과: 대안적 문자 연결 방식은 답변을 반복 처리하는 대신 GPT3를 사용해 하위 질문을 생성했다.이 프롬프트는 단어 분할, 각 마지막 문자 추출, 추출된 문자 병합으로 과제를 분해한다.
  • E 분해 방식의 효과: 하위 질문을 생성하면 잘못된 답변 형식에 대한 강건성이 향상되지만, 리스트 요소의 순서를 바꾸거나 누락하거나 반복할 수 있다.초기 답변이 유효한 배열이 아니더라도 decomposer는 적절한 하위 질문을 생성할 수 있다.
  • E 분해 방식의 효과: 대안적 뒤집기 방식은 머리 부분을 뒤에 붙이기 전에 꼬리 부분을 재귀적으로 뒤집으며, 이진 분할의 O(log(n)) 호출 대신 O(n) 호출이 필요하다.보고된 비교에서는 이진 분할 비용을 O(ln(n))으로, 한 번에 한 요소씩 처리하는 비용을 O(n)으로도 기술한다.
  • E 분해 방식의 효과: 두 대안적 분해 방식은 성능을 유지했으며, 문자 연결 결과는 동일했고 더 긴 입력에서는 뒤집기 성능이 더 우수했다. 두 방식 모두 CoT보다 우수했다.Figure 20은 두 문자 연결 방식의 점수가 동일하다고 보고하며, 더 긴 입력에서 뒤집기 성능이 향상되었음을 보여준다.

F 오류 분석 · F.1 문자 연결 · F.1.1 DECOMP

DECOMP의 문자 연결 오류는 전적으로 하위 작업 실행 중 발생하며, 입력 크기 전반에서 DECOMP는 CoT보다 성능이 높고 일반화도 더 잘된다. 재귀적 tail reversal은 더 긴 리스트에서 안정성을 높이지만 GPT3 호출이 더 많이 필요하다.

  • F.1.1 DECOMP: 리스트의 tail을 재귀적으로 reverse하는 방식은 더 긴 길이에서 더 안정적이지만 GPT3 호출이 더 많이 필요하다.따라서 안정성 향상은 증가한 model-call 비용과 trade-off 관계에 있다.
  • F 오류 분석: 문자 연결에서 관찰된 DECOMP의 모든 오류는 전체 decomposition이 아니라 하위 작업 실행 중 발생한다.오류 분석 결과, 유일한 오류 원인은 하위 작업 실행으로 확인된다.
  • F.1.1 DECOMP: 따라서 DECOMP 분석은 letter extraction과 concatenation을 포함한 modular sub-task 실행 과정으로 실패를 국소화한다.이 사례들은 문자 연결 decomposition 내부에서 서로 다른 failure mode를 보여준다.
  • F.1.1 DECOMP: DECOMP는 입력 단어 수가 달라져도 kth-letter concatenation에서 항상 CoT보다 성능이 높고 CoT보다 더 잘 일반화한다.비교는 세미콜론 delimiter와 다양한 N을 사용한 k=3의 exact-match 결과를 기반으로 한다.
  • F.1 문자 연결: 한 하위 작업 오류는 단어에서 잘못된 문자 위치를 추출하는 데서 발생한다.예시 질의에서 시스템은 정답인 세 번째 문자 n 대신 c를 예측한다.
  • F.1 문자 연결: 두 번째 하위 작업 오류는 추출한 문자들을 잘못 연결하는 데서 발생한다.예측 결과는 필요한 공백을 생략해, 요청된 공백 포함 연결 결과 대신 leoie를 출력한다.

F.1.2 COT W/ ROLLOUT

rollout을 적용한 Chain-of-thought는 각 sub-task를 효과적으로 가르치지 못해 letter concatenation에서 DECOMP보다 오류가 더 빈번하게 발생했다. 오류에는 중간 추론 중 잘못된 문자 추출이 포함됐다.

  • F.1.2 COT W/ ROLLOUT: rollout을 적용한 CoT는 prompting으로 각 sub-task를 효과적으로 가르치지 못해 DECOMP보다 오류가 더 빈번하게 발생했다.오류 분석 결과, CoT는 DECOMP와 유사한 generation error를 냈지만 그 빈도가 더 높았다.
  • F.1.2 COT W/ ROLLOUT: 한 오류에서는 “Sheila”에서 세 번째 문자를 잘못 추출해 정답인 “e” 대신 “i”를 예측했다.중간 추론에서 “Sheila”의 문자 인덱스를 잘못 계산했다.
  • F.1.2 COT W/ ROLLOUT: 또 다른 오류에서는 “Shobha Kailash Nakamura Peter Benitez” 예시에서 잘못된 문자를 추출해 “o i k t n” 대신 “o l k t i”를 예측했다.추론에서 “Benitez”의 세 번째 문자가 아니라 네 번째 문자를 선택했다.

F.2 COMMAQA

CommaQA에서는 오류가 주로 잘못된 single-hop 하위 과제 답변에서 발생한다. 이 오류는 CoT에서 더 빈번한데, CoT는 이 하위 과제를 specialized prompt에 위임할 수 없기 때문이다.

  • F.2 COMMAQA: CommaQA의 오류는 대부분 잘못된 single-hop 하위 과제 답변으로 인해 발생한다.관찰된 모든 오류가 이 유형이었기 때문에, 이 절에서는 예시 하나만 제시한다.
  • F.2 COMMAQA: CoT에서는 single-hop QA 하위 과제를 specialized prompt에 위임할 수 없기 때문에 같은 유형의 오류가 더 빈번하게 발생한다.
  • F.2 COMMAQA: 이 예시에서는 잘못된 하위 질문 답변이 예측된 영화 목록에서 “Polytetrafluoromethane”을 누락시켜 최종 답변에서 “Hydrallium”이 누락되었다.

G TASK PROMPTS

이 부록은 Chain-of-Thought 및 Decomposed Prompting 실험 전반에서 사용된 프롬프트, decomposition operator, 예시 풀이를 명시하며, recursive reversal과 open-domain QA 응용을 포함한다.

  • G TASK PROMPTS: CoT baseline은 동일한 two-step decomposition framework를 사용한다. 먼저 GPT3가 chain of thought를 생성한 뒤, regex-based extractor가 이를 answer로 변환한다.chain of thought는 기본적으로 extractor로 전송되므로 module name은 생략할 수 있다.
  • G TASK PROMPTS: 부록은 project values (foreach)를 answer index를 각 list value로 대체하고, 그 결과로 생성된 모든 question에 답한 뒤 answer를 concatenating하는 것으로 정의한다.Project values flat unique (foreach merge)는 결과를 추가로 flatten하고 unique entity만 유지한다.
  • G.1.1 DECOMPOSED PROMPTING: Decomposed Prompting 예시는 letter-concatenation task를 word extraction, indexed-letter selection, final merging으로 나누어 “a a g”, “A M T”, “b x o”와 같은 output을 생성한다.프롬프트는 split, project values, str position, merge 단계를 사용한다.
  • G.1.1 DECOMPOSED PROMPTING: 부록은 indexed element 선택, list concatenation, word 또는 ordered sequence에서 position 추출을 포함한 elementary operator용 별도 prompt를 제공한다.예시로 position 4에서 “sleep”을 가져오고, “Mathison”의 마지막 글자로 “n”을 추출한다.
  • G.1.2 COT WITH ROLLOUT: CoT with rollout은 answer를 반환하기 전에 동일한 intermediate word, letter-position, concatenation 단계를 명시적으로 언어화하며 “a a g”와 “A M T” 같은 answer를 생성한다.rollout 예시는 각 word의 ordered letter와 선택된 position을 보여준 뒤 최종 concatenation을 수행한다.
  • G.2.1 SPLIT REVERSAL: recursive reversal strategy는 sequence를 절반으로 나누고, 각 절반을 reverse한 뒤, O(log n)의 language-model call을 사용해 이를 concatenating한다.여기서 n은 sequence의 item 수를 의미한다.
  • G.6 OPEN DOMAIN QA: Open-domain QA prompt 예시는 detention, award, relative age에 관한 multi-step question에 대해 “Afghanistan”, “one”, “Jeremy Horn”이라는 decomposed answer를 제시한다.이 예시들은 intermediate retrieval 이후 final answer를 반환하는 prompt format을 보여준다.
Loading 2210.02406v2…