Source-linked AI summary

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe

arXiv:2203.02155v1cs.CLcs.AIcs.LG

TL;DR

언어 모델은 사용자의 의도를 따르지 못하는 경우가 많고, 사실이 아니거나 유해하거나 도움이 되지 않는 출력을 생성할 수 있다. 이 논문은 demonstration과 human preference feedback을 사용해 GPT-3를 fine-tuning하고, InstructGPT의 출력이 GPT-3의 출력보다 선호되며 truthfulness와 toxicity 지표가 개선됨을 보인다.

  • 문제

    언어 모델은 사실을 지어내고 편향되거나 유해한 텍스트를 생성하며 사용자 지시를 따르지 못할 수 있어, 사용자 의도에 맞춘 alignment의 필요성이 제기된다.

  • 방법

    저자들은 human preference를 바탕으로 한 supervised demonstration과 human feedback을 통한 reinforcement learning을 사용해 GPT-3를 fine-tuning한다.

  • 결과

    labeler는 85 ± 3%의 경우에 175B GPT-3 출력보다 175B InstructGPT 출력을 선호하며, InstructGPT는 truthfulness를 개선하고 유해한 출력도 줄인다.

  • 시사점 및 한계

    human preference로 언어 모델을 fine-tuning하면 다양한 과제에서 모델의 행동이 유의하게 개선되지만, 추가적인 안전성과 신뢰성 개선은 여전히 필요하다.

  • 시사점 및 한계

    모델은 완전히 aligned하지도, 완전히 safe하지도 않으며, 여전히 유해하거나 편향된 출력을 생성하고 사실을 지어내며, 명시적인 prompting 없이도 성적 또는 폭력적 콘텐츠를 생성한다.

Abstract

from arXiv · show

Making language models bigger does not inherently make them better at following a user's intent. For example, large language models can generate outputs that are untruthful, toxic, or simply not helpful to the user. In other words, these models are not aligned with their users. In this paper, we show an avenue for aligning language models with user intent on a wide range of tasks by fine-tuning with human feedback. Starting with a set of labeler-written prompts and prompts submitted through the OpenAI API, we collect a dataset of labeler demonstrations of the desired model behavior, which we use to fine-tune GPT-3 using supervised learning. We then collect a dataset of rankings of model outputs, which we use to further fine-tune this supervised model using reinforcement learning from human feedback. We call the resulting models InstructGPT. In human evaluations on our prompt distribution, outputs from the 1.3B parameter InstructGPT model are preferred to outputs from the 175B GPT-3, despite having 100x fewer parameters. Moreover, InstructGPT models show improvements in truthfulness and reductions in toxic output generation while having minimal performance regressions on public NLP datasets. Even though InstructGPT still makes simple mistakes, our results show that fine-tuning with human feedback is a promising direction for aligning language models with human intent.

1 서론

이 논문은 human feedback을 활용해 GPT-3를 fine-tuning함으로써 next-token prediction과 유용하고 안전한 instruction following 사이의 misalignment를 다룬다. InstructGPT는 human-rated helpfulness, truthfulness, toxicity 지표를 개선하면서도 한계와 일부 task-performance trade-off를 보인다.

  • 이 방법은 supervised fine-tuning, ranked outputs를 이용한 reward-model training, PPO reinforcement learning으로 구성되며, human preferences를 reward signal로 사용한다.이 연구는 40명의 계약자를 고용해 데이터를 라벨링하고, 주로 held-out customer prompts에 대한 labeler ratings를 통해 모델을 평가했다.
  • 1.3B InstructGPT outputs는 175B GPT-3 outputs보다 선호되었으며, few-shot-prompted GPT-3와 비교해도 parameter 수가 100배 이상 적었다.두 모델은 GPT-3 architecture를 공유하며 human data에 대한 fine-tuning에서 차이를 보인다.
  • InstructGPT는 정중하게 프롬프트했을 때 GPT-3보다 TruthfulQA에서 진실하고 유익한 답변을 약 두 배 더 자주 생성했으며, 유해한 출력은 약 25% 적게 생성했다.Winogender나 CrowSPairs에서는 GPT-3보다 유의미한 개선을 보이지 않아, 이에 상응하는 편향 개선도 없었음을 시사한다.
  • RLHF fine-tuning은 일부 public NLP datasets에서 성능 저하를 일으켰지만, PPO와 pretraining-distribution updates를 혼합하면 labeler preference scores를 저해하지 않으면서 이를 크게 줄일 수 있었다.성능 저하는 SQuAD, DROP, HellaSwag, WMT 2015 French-to-English translation에서 나타났다.
  • InstructGPT에 대한 선호는 training labelers에 대한 선호와 거의 같은 비율로 held-out labelers에게도 일반화되었지만, 더 폭넓은 user disagreement는 아직 충분히 연구되지 않았다.저자들은 RLHF distribution을 넘어서는 qualitative instruction-following도 보고했으며, 여기에는 code summarization, code questions, 때로는 other languages가 포함된다.
  • 이러한 개선에도 불구하고 InstructGPT는 여전히 지시를 따르지 못하거나, 사실을 날조하거나, 지나치게 유보적인 태도를 보이거나, false premises를 놓칠 수 있으므로 safety and reliability remain open problems.이 논문은 특히 deployed applications에서 next-token prediction이 사용자의 지시를 유용하고 안전하게 따르는 목표와 misaligned되어 있다고 설명한다.

2 관련 연구

이 논문은 human feedback을 활용한 reinforcement learning, alignment, instruction following, 그리고 language-model harm을 평가하고 완화하는 방법에 관한 선행 연구를 기반으로 한다. 본 연구의 기여는 광범위한 language task 분포에 걸쳐 language model을 정렬하기 위해 RLHF를 적용하는 데 있다.

  • alignment와 human feedback 기반 learning 연구: 이 연구는 광범위한 language task 분포에 걸쳐 language model을 정렬하는 데 reinforcement learning from human feedback을 직접 적용한다.RLHF는 이전에 simulated robot, Atari game, language-model text summarization에 사용되었다.
  • alignment와 human feedback 기반 learning 연구: 선행 alignment 연구는 harmful content와 misspecified objective를 편법적으로 최적화하는 현상을 통해 misalignment를 규정하는 한편, language assistant와 alignment baseline을 연구한다.language model이 aligned되었다는 것이 무엇을 의미하는지에 관한 더 광범위한 질문도 최근 주목받고 있다.
  • instruction을 따르도록 language model 학습하기: 이 논문은 language model의 cross-task generalization과 simulated environment에서의 navigation을 아우르는 instruction-following research와 관련된다.Cross-task 연구에서는 다양한 public NLP dataset에 대한 instruction과 함께 model을 fine-tune하고, 서로 다른 task에서 이를 평가한다.
  • language model의 harm 평가: 선행 연구는 biased output과 private-data leakage를 포함한 배포 위험을 문서화했으며, 이는 language-model behavior를 수정하려는 노력을 촉진했다.이러한 위험은 여러 연구에서 광범위하게 문서화되었다.
  • harm을 완화하기 위한 language model behavior 수정: 기존의 완화 전략에는 value-targeted fine-tuning과 연구자가 작성한 trigger phrase를 사용해 pretraining data를 filtering하는 방법이 포함된다.Value-targeted fine-tuning은 question-answering task에서 지정된 value에 대한 adherence를 향상한다.

3 방법 및 실험 세부사항

이 방법은 labeler demonstration에 대한 supervised fine-tuning, 선호 비교를 이용한 reward modeling, 그리고 학습된 reward를 기준으로 한 PPO 최적화를 결합한다. 학습에는 labeler와 초기 API 사용자가 제시한 다양한 prompt가 사용되며, human evaluation에서는 truthfulness와 harmlessness를 중점적으로 평가한다.

  • 3.1 방법 개요: 세 단계 pipeline은 사전 학습된 GPT-3 model을 demonstration으로 fine-tuning하고, 선호된 output으로 reward model을 학습하며, PPO로 policy를 최적화한다.reward model은 PPO에 scalar reward를 제공하며, comparison-data 수집과 policy 최적화는 반복 수행할 수 있다.
  • 3.2 Prompt 분포: dataset은 labeler가 작성한 prompt와 generation, question answering, dialog, summarization, extraction 및 기타 task를 포괄하는 초기 InstructGPT API prompt를 결합한다.SFT dataset에는 약 13k개의 training prompt가, RM dataset에는 33k개의 training prompt가 포함되며, 전체 dataset의 96% 이상이 English다.
  • 3.2 Prompt 분포: labeler는 직접적인 instruction, few-shot example 또는 암시적 continuation으로부터 user intent를 추론하고, SFT와 reward-model training을 위한 demonstration과 ranking을 생성한다.별도의 unlabeled PPO dataset은 RLHF fine-tuning을 위한 prompt를 제공한다.
  • 3.4 Human evaluation: alignment 기준이 충돌할 때 학습은 helpfulness를 우선하지만, 최종 evaluation에서는 labeler에게 truthfulness와 harmlessness를 우선하도록 요청한다.Truthfulness는 closed-domain task에서의 hallucination 경향과 TruthfulQA (Lin et al., 2021) 성능으로 측정한다.
  • 3.3 Reinforcement learning: RL environment는 customer prompt를 sample하고, reward model로 response를 score하며, reward의 과도한 최적화를 완화하기 위해 SFT model을 기준으로 per-token KL penalty를 추가한다.environment는 각 prompt-response episode가 reward를 생성한 뒤 종료되는 bandit setting이다.

4 결과

API 프롬프트 전반에서 InstructGPT 출력은 GPT-3보다 선호되었고 지시를 더 잘 따랐으며, 진실성도 향상되고 조건부로 유해성도 감소했다. 이러한 향상은 학습에서 제외된 labeler와 일부 분포 외 과제로 일반화되었지만, 공개 데이터셋 성능과 몇 가지 행동적 한계는 여전히 남았다.

  • API 프롬프트 분포: 모든 모델 크기에서 labeler는 GPT-3보다 InstructGPT를 유의하게 선호했으며, prompting, supervised fine-tuning, PPO를 거치면서 연속적인 향상이 나타났다.학습에서 제외된 labeler도 유사한 선호를 보였고, 모든 InstructGPT 모델은 GPT-3 baseline을 크게 앞섰다. 이는 모델이 학습 labeler의 선호에 단순히 과적합한 것이 아님을 시사한다.
  • API 프롬프트 분포: InstructGPT 출력은 GPT-3보다 더 적절했고, 명시적 제약을 더 자주 따랐으며, 지시를 덜 자주 위반했고, 폐쇄형 도메인 과제에서 환각도 더 적었다.이러한 구체적인 향상은 전반적으로 우호적인 평가와 함께 보고되었으며, 사용자 의도에 대한 모델의 정렬이 더 강함을 뒷받침한다.
  • 공개 NLP 데이터셋: 78 ±4% 및 79 ± 4%: 175B InstructGPT 출력은 각각 FLAN 및 T0 출력보다 선호되었다.FLAN 및 T0으로 fine-tuning한 GPT-3 모델은 GPT-3을 앞섰고 prompting한 GPT-3과 비슷한 성능을 보였지만, 비교한 공개 데이터셋에서는 SFT baseline보다 성능이 낮았다.
  • 진실성, 유해성, bias: PPO 모델은 GPT-3보다 작지만 유의한 진실성 향상을 보였으며 환각도 줄었다. 반면 유해성 향상은 작고 프롬프트에 의존했으며 bias로까지 확장되지는 않았다.존중을 요구하는 프롬프트에서는 InstructGPT가 GPT-3보다 덜 유해했지만, 해당 프롬프트가 없으면 그 이점은 사라졌고, 명시적으로 유해한 프롬프트를 사용하면 InstructGPT가 더 유해해졌다.
  • 정성적 결과: InstructGPT는 fine-tuning 데이터에 이러한 사례가 거의 없었음에도 비영어 지시를 따르고 코드 요약과 질의응답을 수행하는 정성적 능력을 보였다.175B PPO-ptx 모델은 코드 질문에 안정적으로 답하고 다른 언어의 지시를 따랐지만, 영어로 응답하는 경우가 많았고 GPT-3보다 적은 prompting만 필요로 했다.
  • 정성적 결과: InstructGPT는 여전히 false premise를 받아들이거나 과도하게 유보적인 태도를 보이는 등 단순한 실수를 했으며, 저자들은 이러한 행동을 제한적인 학습 예시와 reward-model 인센티브의 결과로 보았다.저자들은 adversarial data가 두 행동을 모두 줄일 수 있다고 제안했다. 또한 PPO 학습은 절차를 수정하지 않는 한 여러 공개 NLP 데이터셋에서 alignment tax를 초래했다.

5 논의

논의에서는 반복적 alignment를 경험적 근거에 기반한 접근법으로 제시하는 한편, 그 결과로 얻은 시스템이 인류 일반의 선호가 아니라 특정 labeler, 연구자, 고객을 반영한다는 점을 강조한다. 또한 잔존하는 유해 행동과 성능 저하 완화의 불완전성을 비롯해 방법론과 모델의 중요한 한계를 조명한다.

  • 5 논의: 반복적 alignment는 현재 시스템에서 무엇이 작동하고 실패하는지에 대한 경험적 피드백을 제공하지만, 초인적 시스템에 고유한 문제를 직접 다루지는 않는다.이 접근법은 아직 존재하지 않는 시스템을 추상적으로 alignment하는 대신 기존 AI 시스템을 개선하는 데 초점을 둔다.
  • 5.1 누구에 맞춰 alignment하는가?: alignment 과정은 보편적으로 옳은 선호가 아니라 특정 인간 참조 집단과 애플리케이션을 대상으로 한다. 데이터가 labeler, 연구자, API 고객을 반영하기 때문이다.labeler는 대부분 미국 또는 동남아시아의 영어 사용인이었고, labeler 간 일치도는 약 73%였다. 고객 역시 잠재적 사용자 전체나 영향을 받는 집단을 대표하지 않았다.
  • 5.2 방법론: 가치 판단이 contractor의 정체성과 신념에 좌우되는 데다 대부분의 비교를 단 한 명의 contractor만 labeling했기 때문에, alignment 데이터와 방법론에는 여전히 한계가 있다.여러 label을 사용하면 불일치를 드러낼 수 있으며, 출력이 소수 집단에 불균형적으로 영향을 미칠 때 labeler 선호를 평균내는 것은 바람직하지 않을 수 있다.
  • 5.3 모델: 모델은 완전히 aligned되지도, 완전히 안전하지도 않다. 유해하거나 편향되거나 조작된 내용, 성적 콘텐츠 또는 폭력적 콘텐츠를 생성할 수 있으며 유해한 지시를 따를 수도 있다.최대한 편향되도록 지시했을 때 InstructGPT는 동일한 크기의 GPT-3 모델보다 더 많은 유해한 출력을 생성했다.
  • 5.3 모델: RLHF에 pretraining 데이터를 포함해도 성능 저하를 완전히 제거하지 못하며, 바람직하지 않은 행동이 pretraining 데이터에 포함되어 있을 때 그러한 행동을 증가시킬 수 있다.논의에서는 추가 연구 방향으로 pretraining 혼합 데이터에서 유해한 콘텐츠를 필터링하거나 데이터를 다른 방식으로 수정할 것을 제안한다.

A 추가 프롬프트 데이터 세부사항 … B.2 라벨링 지침

부록에서는 InstructGPT 프롬프트 데이터를 부트스트랩하고 다양화하며 분할·라벨링한 방법을 설명한다. 여기에는 첫 번째 모델을 위한 계약자 작성 프롬프트와 동의가 확보된 API Playground 프롬프트가 포함된다. 또한 라벨러 선정 기준과 변화해 온 지침, 특히 학습과 최종 평가에서 부여한 우선순위의 차이를 기록한다.

  • A.1 라벨러 작성 프롬프트: 라벨러들은 첫 번째 instruction-following 모델을 부트스트랩하기 위해 plain 및 few-shot prompts를 만들었고, 익명화된 애플리케이션 설명은 해당 모델의 supervised-learning 학습을 지원했다.그 결과 모델은 2021년 초 API beta에 배포되었다.
  • A.2 API 사용자 프롬프트: API 프롬프트는 OpenAI Playground에서 이전 InstructGPT 모델을 사용한 사용자들로부터 수집되었으며, informed-consent alerts 덕분에 production 고객보다 데이터 수집이 수월했다.프롬프트는 휴리스틱하게 중복 제거되었고, 조직당 대략 200개로 제한되었으며, training·validation·test set에서 사용 사례를 분리하도록 조직 ID를 기준으로 분할되었다.
  • A.2.1 InstructGPT 분포의 예시 사용자 프롬프트: API 프롬프트 분포는 ten use cases를 포괄한 반면, GPT-3 프롬프트는 대체로 instruction-style이 덜하고 더 명시적으로 지시되었으며 사용자 의도가 모호한 경우도 있었다.범주는 generation, open QA, closed QA, brainstorming, chat, rewriting, summarization, classification, extraction, other였다.
  • A.2.2 GPT-3 분포의 예시 사용자 프롬프트: 예시 GPT-3 프롬프트에는 continuation-style generation, classification templates, conversational setups, question answering, summarization prompts가 포함된다.이 예시들은 instruction-oriented API 분포와 대비되지만 정량적 비교를 확립하지는 않는다.
  • A.3 Dataset sizes: SFT에는 고객 프롬프트보다 훨씬 많은 라벨러 작성 프롬프트가 포함되었다. few-shot instructions를 재사용해 여러 datapoints를 합성적으로 구성했기 때문이다. 반면 RM training에서는 각 프롬프트를 4–9 outputs에 대한 순위로 확장하고 훨씬 더 많은 ranked pairs를 생성했다.ranked pairs의 수는 prompts의 수보다 한 자릿수 큰 규모였다.
  • A.4 Data diversity: 수집된 데이터는 다양한 범주와 사용 사례를 포괄했으며, 110k datapoints 중 약 96%가 English로 분류되었고 소수는 적어도 20개의 다른 언어에 걸쳐 있었다.프롬프트와 demonstration의 길이, 고객별 기여 수, 범주별 길이가 기술통계로 보고되었다.
  • B.1 라벨러 선정: 라벨러는 민감한 발화 플래그 지정과 순위 매기기에서의 일치도, 민감한 demonstration의 품질, 민감한 주제와 문화 집단을 얼마나 포괄한다고 스스로 평가하는지를 기준으로 심사되었다.선정에는 75% agreement와 6/7 demonstration score라는 완화된 cutoff가 사용되었으며, 자기평가 기준에는 주관적 판단이 함께 적용되었다.
  • B.2 라벨링 지침: 라벨링 지침은 피드백과 metadata 변화에 따라 발전했으며, training labelers는 helpfulness를 우선시한 반면 final evaluators는 truthfulness와 harmlessness를 우선시했다.저자들은 모델이 때때로 helpfulness보다 truthfulness와 harmlessness를 우선하도록 학습시키는 한 가지 방법으로 refusals를 제시한다.

B.3 레이블러 인구통계 데이터 … C 추가 모델 세부사항

부록에서는 레이블러의 특성을 설명하고, 평가 지침과 인터페이스를 기록하며, 핵심 모델 학습 구현 세부사항을 명시한다. 레이블러는 대체로 젊고 특정 지역에 집중되어 있었으며, 업무에 만족했고, 구조화된 점수화 및 순위화 절차를 사용해 출력을 평가했다.

  • B.3 레이블러 인구통계 데이터: API-prompt 평가에서는 명시적 지시 또는 바람직한 행동의 예시로 표현된 과제에 대해 출력물을 평가하도록 레이블러에게 지시했다.제공된 발췌문은 직접적인 과제 설명과 예시 기반 과제 명세를 모두 보여준다.
  • B.3 레이블러 인구통계 데이터: Toxicity 평가에서는 잠재적으로 불쾌하거나 노골적인 문장 접두사를 모델이 정중하고 그럴듯하며 비유해한 방식으로 이어 쓰는지를 판단하도록 레이블러에게 요청했다.RealToxicityPrompts 지침은 유해한 입력에 대해서도 비유해한 생성을 평가하는 과제로 명시했다.
  • B.3 레이블러 인구통계 데이터: 19명의 설문 참여자 응답에 따르면, 레이블러는 대체로 젊고 성별 균형이 있었으며 주로 미국 또는 동남아시아 출신이었다.칠십오 퍼센트는 35세 미만이었다.
  • B.4 레이블러 만족도 설문: 설문에 참여한 19명의 레이블러는 대체로 업무를 즐겼고, 보수가 공정하다고 평가했으며, 연구자들의 도움과 소통을 중요하게 여겼지만 일부는 업무가 반복적이라고 느꼈다.다른 레이블러들은 업무가 충분히 다양하고 흥미롭다고 보았다.
  • B.5 웹 인터페이스: 레이블링 인터페이스는 각 프롬프트에 대해 1–7 전반적 품질 Likert 점수와 메타데이터 레이블을 모든 출력물의 순위와 결합했으며, 품질이 유사한 출력물에는 동률을 부여하도록 권장했다.레이블러와 연구자는 동일한 인터페이스를 사용했다.
  • C 추가 모델 세부사항: 모든 모델은 GPT-3 아키텍처를 사용했으며, reward model과 value function에서는 원래의 unembedding layer를 scalar-output projection layer로 대체했다.모델은 fp16 가중치와 activation, fp32 master weights, Brown et al. (2020)의 byte-pair encoding, 2k-token context length를 사용했다.
  • C 추가 모델 세부사항: 모든 모델은 β1 = 0.9 및 β2 = 0.95를 사용하는 Adam으로 학습했다.

C.1 SFT 학습 세부사항

SFT 모델은 모델 크기에 따라 구분된 고정 최적화 설정으로 학습했으며, learning rate와 epoch 수는 geometric search로 선택했다. 최종 모델은 validation loss보다 인간 선호도를 더 잘 예측한 RM score를 사용해 선정했다.

  • C.1 SFT 학습 세부사항: SFT 학습에는 16 epochs, 0.2의 residual dropout, warmup 없이 10%까지 감소하는 cosine learning-rate decay, 그리고 모델 크기별 learning rate와 batch size를 사용했다.1.3B 및 6B 모델은 learning rate 9.65e-6과 batch size 32를 사용했고, 175B 모델은 5.03e-6과 batch size 8을 사용했다.
  • C.1 SFT 학습 세부사항: Learning rate는 1.3B 및 6B 모델에서 7개 후보, 175B 모델에서 5개 후보를 대상으로 geometric search를 수행해 선택했다.학습 epoch 수도 geometric search를 사용해 조정했다.
  • C.1 SFT 학습 세부사항: 최종 SFT 모델은 validation loss보다 인간 선호 결과를 더 잘 예측한 RM score를 사용해 선정했다.

C.2 RM 학습 세부사항 … C.5 FLAN 및 T0 모델

학습 파이프라인은 PPO policy 규모 전반에서 안정적인 6B reward model과 value function을 사용했으며, supervised 초기화, pretraining-data mixing, 통제된 FLAN/T0 checkpoint 선택을 적용했다. 이러한 선택은 compute, 비교 가능성, RLHF 안정성, public NLP 성능 보존 사이의 균형을 맞췄다.

  • C.2 RM 학습 세부사항: 단일 6B reward model은 learning rate 전반에서 안정적이고 computationally cheaper했으며 PPO 결과도 동등하게 우수했기 때문에 모든 규모의 PPO policy를 구동했다.더 큰 175B reward model은 더 낮은 validation loss를 달성할 수 있었지만 안정성이 낮았고 PPO compute 요구량을 크게 늘렸다.
  • C.2 RM 학습 세부사항: 최종 reward model은 public NLP datasets에 fine-tuning한 6B GPT-3 model에서 초기화했으며, learning rate 9e-6으로 한 epoch 동안 학습했다.GPT-3 또는 supervised fine-tuning models에서 초기화해도 유사한 결과를 얻었다.
  • C.3 RLHF 초기화 models의 세부사항: RLHF models은 pretrained GPT-3에서 초기화하고 supervised fine-tuning을 두 epoch 수행했으며, PPO training에 도움이 되었기 때문에 10% pretraining data를 혼합했다.Cosine decay를 사용했으며, batch size는 1.3B 및 6B models에서 32, 175B model에서 8이었다.
  • C.4 RLHF 학습 세부사항: 모든 RL policies는 약 31k개의 고유한 filtered prompts에서 256k episodes 동안 학습했으며, β = 0.02인 KL reward regularization과 고정된 PPO batch 및 minibatch sizes를 사용했다.RL policies는 pretraining mix를 포함한 supervised models에서 초기화했으며, 이 모델이 KL reward도 계산했다.
  • C.4 RLHF 학습 세부사항: 모든 policy 규모에 동일한 6B reward model과 value function을 사용함으로써 policy-size 비교가 쉬워졌으며, value-function learning rates는 9e-6 또는 5e-6이었다.9e-6 rate는 1.3B 및 6B policies에, 5e-6은 175B policy에 적용했다.
  • C.4 RLHF 학습 세부사항: Pretraining-gradient mixing은 RL episodes보다 여덟 배 많은 pretraining examples를 사용해 SQuADv2 및 DROP에서의 RLHF regressions를 완화했다.각 minibatch에서 PPO와 pretraining gradients를 연속적인 steps로 계산하고 함께 누적했다.
  • C.5 FLAN 및 T0 models: FLAN 및 T0 baselines는 175B GPT-3를 fine-tuning해 생성했으며, T0는 FLAN의 training-data scale에 맞추기 위해 1 million datapoints로 subsample했다.T0++ dataset을 사용했으며, training epochs는 repeats 없이 datapoints를 통과했다.
  • C.5 FLAN 및 T0 models: Reward-model scoring으로 reward saturation 이후, training settings를 비교해 FLAN 및 T0 checkpoints를 선택했으며, 여기에는 learning rate 4e-6에서의 FLAN 896k-example checkpoint가 포함된다.T0에서는 896k examples 이후 4e-6, batch-size-128 experiment에서 얻은 checkpoint를 선택했으며, FLAN reward는 약 400k examples 이후 포화되었다(Figure 13).

D 자동 평가 세부 사항 … E 추가 결과

이 논문은 표준화된 프롬프트와 디코딩 절차를 사용해 편향, 독성, 진실성, 추론, 분류, 번역, 요약에 걸친 폭넓은 벤치마크에서 모델을 평가한다. 추가 zero-shot 결과에서는 공개 NLP 데이터셋에서 175B PPO 모델의 성능 저하가 나타나며, fine-tuning 중 pretraining 데이터로 업데이트하면 이를 완화할 수 있음을 보인다.

  • D 자동 평가 세부 사항: 평가는 Winogender, CrowS-Pairs, RealToxicityPrompts, TruthfulQA, DROP, QuAC, SquadV2, Hellaswag, SST, RTE, WSC, WMT 15 Fr →En, CNN/Daily Mail Summarization을 포괄한다.이 벤치마크들은 편향, 독성, 진실성, 질의응답, 추론, 감성, 자연어 추론, 상호참조, 번역, 요약을 다룬다.
  • D 자동 평가 세부 사항: 모델은 task prompt, context, sampled 또는 multiple-choice completion을 사용해 평가되며, temperature T = 0 sampling은 첫 번째 newline에서 중단하고 multiple-choice 선택은 T = 1에서 log-probability를 기반으로 수행한다.평가 프레임워크는 모델 출력을 생성하는 방식과 answer choice를 선택하는 방식을 표준화한다.
  • D.1 독성 및 편향 평가 세부 사항: 편향 및 독성 평가는 basic, respectful, and biased instructions를 비교해 prompting이 모델 행동에 미치는 영향을 검증한다.respectful prompt는 정중하고 존중하며 편향되지 않은 completion을 요청하는 반면, biased prompt는 최대한 편향되고 공격적인 completion을 요청한다.
  • D.1 독성 및 편향 평가 세부 사항: 편향 과제 성능은 평균 choice entropy로 요약하며, higher entropy는 이진 선택지 사이에서 불확실성이 크거나 선호가 약함을 의미한다.Entropy는 bit 단위로 측정하며, 이진 선택에서는 최댓값이 1이다. 확률은 모델이 부여한 completion probability에 비례하도록 계산한다.
  • D.2 각 eval dataset의 prompt 구조와 평가 feature: 데이터셋별 평가 세부 사항은 각 자동 benchmark의 prompting 구조, validation example 수, 성능 metric을 정의하며, QuAC와 SquadV2에는 variable-length question-answer 형식도 포함한다.이 절은 benchmark 모음 전반의 task example과 feature description을 제시하며, 앞선 context에서 답하거나 정보가 불충분할 때 abstain하도록 하는 지침도 포함한다.
  • E 추가 결과: 175B PPO 모델은 공개 NLP 데이터셋에서 zero-shot 성능 저하를 일관되게 보이며, fine-tuning 중 pretraining 데이터에 대한 업데이트를 추가하면 performance regressions가 완화된다.Few-shot 성능은 별도로 보고하며, 사용된 software package가 translation error bar를 보고하지 않기 때문에 번역 error bar는 제공되지 않는다.

E.1 공개 NLP 데이터셋에서의 성능 · E.2 레이블러 집합 간 Reward model 일반화

공개 데이터셋 평가에서 pretraining mix가 없는 PPO는 많은 과제, 특히 few-shot에서 성능이 퇴행하는 반면, PPO-ptx는 이러한 퇴행을 완화한다. Reward model의 과적합은 보류된 레이블러 그룹을 대상으로 한 5-fold cross-validation을 통해 평가한다.

  • E.1 공개 NLP 데이터셋에서의 성능: PPO-ptx는 여러 공개 NLP 데이터셋에서 pretraining mix가 없는 PPO에서 나타난 퇴행, 특히 few-shot 평가에서의 퇴행을 완화한다.few-shot 비교는 Figure 29에 제시하고, zero-shot 성능은 Figure 28에 별도로 제시한다.
  • E.1 공개 NLP 데이터셋에서의 성능: 평가에서는 bias, toxicity, truthfulness와 다양한 자연어 능력을 종합적으로 측정한다.결과는 Table 14에 보고한다.
  • E.1 공개 NLP 데이터셋에서의 성능: 다양한 공개 NLP 데이터셋에서 모델의 Zero-shot 성능을 보고한다.zero-shot 결과는 Figure 28에 제시한다.
  • E.1 공개 NLP 데이터셋에서의 성능: pretraining mix가 없는 PPO는 많은 공개 NLP 데이터셋에서, 특히 few-shot 설정에서 성능 퇴행을 보인다.이러한 퇴행은 PPO-ptx 결과와 대비되는 동기를 제공한다.
  • E.1 공개 NLP 데이터셋에서의 성능: 다양한 공개 NLP 데이터셋에서 모델의 Few-shot 성능을 보고한다.few-shot 결과는 Figure 29에 제시하며, Figure 28에서 zero-shot 성능과 비교한다.
  • E.2 레이블러 집합 간 Reward model 일반화: Reward model의 일반화는 레이블러 하위 집합으로 학습하고 held-out labelers를 대상으로 평가하여 검증한다.비교 데이터는 학습 데이터 양이 대략 동일한 5개 그룹으로 분할한 뒤, 4개 그룹으로 학습하고 1개 그룹으로 검증하는 6B reward model의 5-fold cross-validation을 수행한다.

E.3 모델 규모에 따른 메타데이터 결과 · E.4 Likert 점수 · E.5 편향 측정

부록에서는 모델 유형과 규모별 메타데이터 평가, 모델별 Likert 점수, Winogender와 CrowS-Pairs에서의 편향 결과를 보고한다. Likert 결과는 대체로 선호도 결과를 따르지만, InstructGPT는 편향 데이터셋에서 GPT-3보다 유의미하게 개선되지 않는다.

  • E.3 모델 규모에 따른 메타데이터 결과: Figure 30은 메타데이터 결과가 모델 규모에 따라 어떻게 달라지는지 살펴본다.
  • E.3 모델 규모에 따른 메타데이터 결과: Figure 30에는 모델 유형과 모델 규모에 따른 메타데이터 평가 점수가 제시된다.
  • E.4 Likert 점수: Figure 31에는 프롬프트 분포에서 각 모델의 Likert 점수가 보고된다.
  • E.4 Likert 점수: Likert 점수 결과는 Section 4.1에 보고된 선호도 결과를 대체로 따른다.
  • E.5 편향 측정: Winogender와 CrowS-Pairs 데이터셋의 편향 결과는 Figure 32에 제시된다.
  • E.5 편향 측정: InstructGPT는 Winogender와 CrowS-Pairs 데이터셋에서 GPT-3보다 유의미한 개선을 보이지 않는다.

E.6 공개 NLP 데이터셋의 회귀 수정 … E.10 입력 toxicity에 따른 RealToxicityPrompts 결과

실험 결과, reward, initialization, stability, toxicity evaluation 간 균형을 유지하면서 공개 NLP 성능을 회복하거나 보존하는 학습 선택지가 확인된다. 특히 pretraining-data mixing과 정교하게 조정된 coefficient가 중요하며, 과도하게 긴 학습과 높은 learning rate는 regression이나 divergence를 유발할 수 있다.

  • E.6 공개 NLP 데이터셋의 회귀 수정: pretraining loss coefficient를 최소 20으로 설정하면 1.3B 모델에서 공개 NLP task의 regression이 회복되며, task에 따라 민감도가 다르고 validation reward는 감소한다.Figure 33은 validation-reward regression을 크게 유발하지 않으면서 DROP과 SQuAD의 개선을 보여준다.
  • E.6 공개 NLP 데이터셋의 회귀 수정: KL reward coefficient만 증가시키는 것으로는 DROP과 SQuAD의 regression이 완전히 완화되지 않으며, coefficient를 2.0, 즉 baseline의 100배까지 높여도 마찬가지다.실험에서는 pretraining loss coefficient를 0으로 설정하고, pretrained GPT model을 KL reward model로 사용한다.
  • E.6 공개 NLP 데이터셋의 회귀 수정: 256k보다 512k episode 동안 학습하면 DROP과 SQuADv2 성능이 처음에는 GPT-3 baseline을 웃돌다가 이후 baseline보다 약간 낮아진다.이 패턴은 세 개의 random seed에 걸친 pretraining mix를 사용한 1.3B model의 default PPO training에서 나타난다.
  • E.7 최적 KL reward coefficient: KL reward coefficient가 0과 2일 때 human Likert 성능은 낮으며, 최적값은 0.01–0.02 부근이다.실험에서는 pretraining data mix를 사용한 PPO training을 수행한다.
  • E.8 PPO init model: 테스트한 PPO initialization variant 중에서는 10% pretraining mix를 사용한 설정이 두드러지지만, 전반적으로 PPO 성능은 테스트한 선택지에 거의 민감하지 않다.선택된 initialization은 10% pretraining mix로 human demonstration에 대해 두 epoch 동안 학습한다.
  • E.9 PPO model의 learning rate optimization: pretraining mix가 없는 PPO에서는 learning rate가 8.05e-6보다 높으면 diverge하는 반면, mix를 사용한 PPO는 learning rate 변화에 덜 민감해 보인다.1.3B와 6B model에는 2.55e-6부터 2.55e-5까지의 learning rate를 스캔했고, 175B 실험에서는 2.55e-6과 3.74e-6을 사용했다.
  • E.10 입력 toxicity에 따른 RealToxicityPrompts 결과: RealToxicityPrompts의 output toxicity는 input-prompt toxicity와 높은 상관을 보이므로, evaluation에서는 prompt-toxicity level 전반에 걸쳐 거의 균일하도록 5000개 prompt를 샘플링한다.unsafe regime에서의 behavior를 더 잘 포착하기 위해 Perspective API로 toxicity를 측정한다.

E.11 추가 ablation

추가 ablation에서 pretraining data ratio, training duration, batch-size 선택이 pretraining data mix를 적용한 PPO에 실질적인 영향을 미치는 반면, toxicity는 instruction condition에 크게 좌우되는 것으로 나타났다. 최종 모델은 size 32가 약간 더 우수했음에도 GPU utilization 개선을 위해 minibatch size 64를 사용했다.

  • E.11 추가 ablation: pretraining data ratio of 4는 preliminary evidence에서 human Likert scores가 향상되었음에도 training 중 pretraining distribution의 log probability loss가 증가하는 경우가 많았다.비교에서는 pretraining loss coefficient를 고정한 채 pretraining data의 양을 달리했다.
  • E.11 추가 ablation: 1.3B model에서는 256k episodes를 넘어 training하는 것이 pretraining data mix를 적용한 PPO에 도움이 되지 않았다.더 많은 unique prompts와 larger models가 이 결론을 바꿀지는 여전히 미해결 문제다.
  • E.11 추가 ablation: batch size of 512가 human evaluations에서 가장 우수한 성능을 보인 반면, minibatch size 32는 64보다 약간 더 우수했다.그럼에도 최종 모델은 GPU utilization이 더 우수했기 때문에 minibatch size 64를 사용했다.
  • E.11 추가 ablation: PPO instruction-following models는 respectful하도록 지시받은 경우에만 non-instruction-following models보다 일반적으로 less toxic output을 생성했다.biased하도록 지시받으면 동일한 모델이 input prompt toxicity가 낮을 때에도 매우 toxic한 content를 일관되게 생성했다.
  • E.11 추가 ablation: RealToxicityPrompts analyses에서는 PPO-ptx와 SFT에 대해 continuity, relative toxicity ratings, 그리고 175B GPT-3에 대한 win rates도 보고했다.이 analyses는 Figures 40 and 41에 요약되어 있다.

F 모델 샘플

175B InstructGPT의 샘플은 여러 언어와 과제 유형에 걸친 지시 따르기를 보여주는 동시에, 스웨덴어 프롬프트에 주로 영어로 출력하거나 코드를 불완전하게 설명하는 등의 한계도 보여준다. 추가 예시는 잠재적으로 유해한 요청과 다양한 라벨러 작성 과제를 다룬다.

  • 안전성과 코드: 샘플은 InstructGPT가 잠재적으로 유해한 요청에 응답하고 코드를 설명하는 모습을 보여주지만, 코드 설명은 여전히 완벽하지 않다.유해한 프롬프트 예시는 사용자에게 유용하도록 하는 데 중점을 둔 학습을 반영하며, 코드 예시는 불완전하지만 관련된 능력을 보여준다.
  • 다양한 과제 샘플: 무작위로 선정한 다섯 개의 라벨러 작성 프롬프트는 다양한 과제를 포괄하며, 비교를 위해 모델 샘플과 사람이 작성한 시연 예시를 함께 제시한다.프롬프트에는 어휘 사용, 질의응답, 레시피 기반 장보기 목록, 설명 요청이 포함되며, completion은 임의로 선별되지 않았다.
  • 다국어 지시 따르기: InstructGPT는 때때로 다른 언어의 지시를 따르며, 프랑스어 시간 여행 이야기를 생성하고 스웨덴어 지시를 따르면서 대부분 영어로 작성한다.프랑스어 예시는 전체가 제시되는 반면, 스웨덴어 샘플은 상당한 영어 출력을 포함한 지시 준수를 보여준다.
Loading 2203.02155v1…