Source-linked AI summary
Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision
Zhiqing Sun, Yikang Shen, Qinhong Zhou, Hongxin Zhang, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan
TL;DR
LLM alignment는 일반적으로 광범위한 인간 감독에 의존하며, 이는 비용이 많이 들고 품질, 다양성, 신뢰성, 편향 문제를 유발할 수 있다. SELF-ALIGN은 원칙과 자체 생성 데이터를 활용해 300개 미만의 annotation line으로 모델을 정렬하고, 평가된 benchmark에서 Text-Davinci-003과 Alpaca를 능가하는 Dromedary를 만든다.
문제
LLM alignment는 비용이 많이 들고 품질, 신뢰성, 다양성, self-consistency, 편향 문제를 겪을 수 있는 광범위한 인간 감독에 의존한다.
방법
SELF-ALIGN은 인간이 정의한 원칙, in-context demonstration, self-aligned model output을 활용해 최소한의 감독으로 LLM을 정렬한다.
결과
300개 미만의 annotation line만으로 Dromedary는 Text-Davinci-003과 Alpaca를 능가하지만 ChatGPT와 Vicuna에는 미치지 못한다.
시사점 및 한계
SELF-ALIGN은 이미 정렬된 LLM에 의존하지 않고 처음부터 효과적이고 효율적인 원칙 기반 alignment가 가능함을 보여준다.
시사점 및 한계
SELF-ALIGN은 모든 규칙을 context에 포함해야 하므로 base model의 token limit에 제약을 받는다.
Abstract
from arXiv · showhide
Recent AI-assistant agents, such as ChatGPT, predominantly rely on supervised fine-tuning (SFT) with human annotations and reinforcement learning from human feedback (RLHF) to align the output of large language models (LLMs) with human intentions, ensuring they are helpful, ethical, and reliable. However, this dependence can significantly constrain the true potential of AI-assistant agents due to the high cost of obtaining human supervision and the related issues on quality, reliability, diversity, self-consistency, and undesirable biases. To address these challenges, we propose a novel approach called SELF-ALIGN, which combines principle-driven reasoning and the generative power of LLMs for the self-alignment of AI agents with minimal human supervision. Our approach encompasses four stages: first, we use an LLM to generate synthetic prompts, and a topic-guided method to augment the prompt diversity; second, we use a small set of human-written principles for AI models to follow, and guide the LLM through in-context learning from demonstrations (of principles application) to produce helpful, ethical, and reliable responses to user's queries; third, we fine-tune the original LLM with the high-quality self-aligned responses so that the resulting model can generate desirable responses for each query directly without the principle set and the demonstrations anymore; and finally, we offer a refinement step to address the issues of overly-brief or indirect responses. Applying SELF-ALIGN to the LLaMA-65b base language model, we develop an AI assistant named Dromedary. With fewer than 300 lines of human annotations (including < 200 seed prompts, 16 generic principles, and 5 exemplars for in-context learning). Dromedary significantly surpasses the performance of several state-of-the-art AI systems, including Text-Davinci-003 and Alpaca, on benchmark datasets with various settings.
1 서론
SELF-ALIGN은 소수의 인간 작성 원칙으로 LLM의 self-alignment를 유도해, 비용이 크고 일관성이 떨어질 수 있는 인간 annotation에 대한 의존도를 낮춘다. 네 단계는 다양한 prompt를 생성하고, 원칙에 따라 response를 만들며, fine-tuning으로 alignment를 각인하고, response의 포괄성을 높인다. 이때 InstructGPT [30]와 Alpaca 의 최소 50K와 비교해 300개 미만의 annotation line만 필요하다.
- 동기와 기여: SELF-ALIGN은 광범위한 human supervision에 수반되는 비용과 잠재적인 품질, 신뢰성, 다양성, 창의성, self-consistency 및 편향 문제를 해결한다.이 방법은 효과적인 human principle alignment를 유지하면서 집중적인 human annotation을 줄이는 것을 목표로 한다.
- SELF-ALIGN 단계: Topic-Guided Red-Teaming은 175개의 seed prompt와 20개의 topic-specific prompt로부터 synthetic instruction을 생성해 context와 scenario를 다양화한다.이 단계는 Wang et al. [48]의 self-instruct mechanism을 사용한다.
- SELF-ALIGN 단계: Principle-Driven Self-Alignment은 16개의 human-written principle과 5개의 in-context exemplar를 사용해 helpful하고 ethical하며 reliable한 response를 유도한다.이 원칙들은 AI model에 바람직한 response quality와 behavioral rule을 명시한다.
- SELF-ALIGN 단계: Principle Engraving은 base LLM을 self-aligned response에 대해 fine-tuning해, principle이나 demonstration 없이 aligned answer를 직접 생성할 수 있게 한다.공유된 model parameter가 query 전반에 helpful하고 ethical하며 reliable한 behavior를 전달한다.
- 동기와 기여: 300개 미만의 annotation line—195개의 seed prompt, 16개의 principle, 5개의 exemplar—을 사용하며, 이는 InstructGPT [30]와 Alpaca 에 필요한 최소 50K개의 human/teacher annotation과 비교된다.이 비교는 SELF-ALIGN의 supervision 효율성을 보여주는 근거로 제시된다.
2 관련 연구
기존 alignment 연구는 human-feedback 파이프라인이나 rule-based self-improvement에 의존하는 반면, SELF-ALIGN은 minimal human supervision으로 처음부터 principle-driven alignment를 개발한다. Constitutional AI와 비교하면 rule application과 training requirements에서 차이가 있지만, 모든 rule을 포함할 경우 context window의 제약을 받는다는 한계는 동일하다.
- AI Alignment: Constitutional AI (CAI) 는 human-generated principles와 AI self-critiques, revisions, and preference models를 사용해 harmful-output labels 없이 safety, reliability, behavioral precision을 향상한다.CAI와 SELF-ALIGN은 모두 powerful AI systems를 위한 rule-based alignment techniques다.
- AI Alignment: SELF-ALIGN은 response를 생성하기 전에 각 user query에 맞는 rule을 선택하는 반면, CAI는 기존 response를 critique하고 refine할 rule을 선택한다.이 차이는 SELF-ALIGN의 principle-driven generation과 CAI의 post-generation self-critique를 반영한다.
- AI Alignment: SELF-ALIGN은 minimal human supervision으로 모델을 from scratch 정렬하는 반면, CAI의 self-critique methodology는 RLHF warm-up을 필요로 한다.SELF-ALIGN의 한계는 모든 rule을 context에 포함하는 작업이 base model의 token limit에 의해 제한된다는 점이며, CAI는 post-generation critique를 통해 이러한 제약을 피한다.
- State-of-the-art AI Assistants: InstructGPT [30]는 supervised fine-tuning과 reinforcement learning from human feedback을 활용한 assistant training을 개척했으며, ChatGPT 와 Alpaca 는 이후 등장한 대표적인 AI assistants다.이들 system은 대체 alignment techniques와 annotation 의존성 축소에 초점을 둔 SELF-ALIGN의 배경을 제공한다.
3 제안 방법: SELF-ALIGN
SELF-ALIGN은 합성 지시문의 다양화, 최소한의 인간 감독을 통한 원칙 기반 응답 생성, 모델 파라미터에 alignment 각인, 응답의 장황함과 직접성 개선으로 구성된 4단계 방법이다. 20개의 adversarial instruction 유형, 16개의 generic principle, 5개의 demonstration, self-generated thought를 활용해 포괄성과 alignment를 높이는 동시에 inference-time token 사용량을 줄인다.
- 전체 방법: SELF-ALIGN은 topic-guided self-instruction, principle-driven response generation, principle engraving, verbose cloning을 결합해 aligned하고 포괄적인 assistant 응답을 생성한다.모델로 합성 instruction을 생성하고, in-context demonstration을 통해 principle을 적용한 뒤, self-aligned output으로 fine-tuning하고, verbosity 개선을 distillation한다.
- Topic-Guided Red-Teaming Self-Instruct: 20개의 수작업으로 설계된 adversarial instruction 유형이 topic generation과 instruction synthesis를 유도해, self-instruction이 탐색하는 context와 scenario의 범위를 확장한다.이 접근법은 각 instruction 유형에 대해 새로운 topic을 생성하고, 중복을 제거한 다음 이에 대응하는 instruction을 만든다.
- Principle-Driven Self-Alignment: 16개의 generic principle과 5개의 in-context demonstration이 모델에 내부적으로 추론한 후 helpful하고 ethical하며 reliable한 응답을 생성하도록 가르친다.demonstration은 assistant가 적용 가능한 principle을 식별하고, 지식의 한계를 인정한 다음, 사용자에게 직접 답하는 과정을 보여준다.
- Principle Engraving: Self-aligned output으로 fine-tuning하면 principle이 모델 파라미터에 각인되어 inference-time token 사용량이 줄어들고, alignment benchmark에서 prompted counterpart를 경험적으로 능가한다.이를 통해 inference 중 principle과 demonstration을 제공할 필요가 없어지고 더 긴 context length를 사용할 수 있다.
- Verbose Cloning: Verbose Cloning은 지나치게 짧은 답변과 간접적인 Wikipedia식 응답 문제를 해결하기 위해, 더 상세하고 직접적인 응답을 생성하는 aligned model을 distillation한다.먼저 human-crafted prompt를 사용해 verbose aligned model을 만든 다음, context distillation [3]을 적용한다.
4 평가
Dromedary는 진실성, HHH, 오픈엔드 대화 벤치마크에서 강력한 language-model 및 chatbot baseline과 비교 평가된다. 여러 baseline을 능가하며, verbose cloning은 generation quality를 향상시키지만 일부 multiple-choice 성능은 저하시킨다.
- 평가 설정: 평가에서는 LLaMA-65b에서 파생된 final 및 non-verbose Dromedary variant를 비교하며, final variant에는 SELF-ALIGN의 네 단계가 모두 포함된다.non-verbose variant는 마지막 verbose-cloning 단계를 제외하며, 정성적 사례는 유해하거나 민감한 질의에 초점을 두고 appendix에 제시된다.
- TruthfulQA: TruthfulQA에서 69% MC1 accuracy를 달성한 Dromedary는 GPT-4 및 다른 baseline을 유의하게 능가하며, generation score도 GPT-3, LLaMA, Alpaca보다 높지만 Vicuna에는 뒤처진다.MC1 결과에는 수정된 ranking approach가 사용되며, generation은 truthful 및 truthful-and-informative answer를 평가한다.
- Vicuna benchmark: Dromedary는 GPT-4가 평가한 helpfulness, relevance, accuracy, detail에서 Text-Davinci-003과 Alpaca를 능가하지만 ChatGPT와 Vicuna에는 미치지 못한다.비교는 Vicuna benchmark 질문에 대한 Win/Tie/Lose evaluation을 사용하며, in-context learning을 위한 두 개의 conversation example이 제공된다.
- Verbose Tax: Verbose Cloning 분석: Verbose cloning은 generation quality를 향상시키지만 여러 multiple-choice benchmark에서 Dromedary의 성능을 저하시킨다. 특히 신뢰할 수 있는 response의 ranking에서 이러한 현상이 두드러진다.이 향상은 Vicuna benchmark 질문과 TruthfulQA generation에서 관찰되는 반면, multiple-choice 성능 저하는 verbose tax 분석의 동기가 된다.
5 결론 및 향후 연구
Dromedary는 매우 적은 인간 주석만으로 처음부터 학습된 원칙 기반 self-alignment를 입증하며, RLHF와는 다른 대안을 제시한다. 향후 연구로는 원칙 평가, 학습 및 critique 방법 개선, 인간 평가 수행, 더 광범위한 윤리적·문화적 맥락에 대한 연구가 포함된다.
- 결론: Dromedary는 원칙 기반 self-alignment를 사용하고 매우 적은 인간 주석으로 처음부터 학습되며, 개발자가 정의한 guardrail을 준수하면서 양질의 상호작용을 생성한다.이 접근법은 LLM의 내재적 지식을 활용해 행동 원칙을 정의하며 RLHF와는 다르다.
- 향후 연구: 향후 연구에서는 Dromedary의 16개 self-alignment 원칙을 추가하거나 제거하는 것이 성능에 어떤 영향을 미치는지 검증해야 한다.이는 개별 원칙을 ablation 기반으로 평가할 수 있게 한다.
- 향후 연구: 향후 연구에서는 Constitutional AI 기반 self-critique 및 reinforcement learning 기법 을 적용해 Dromedary를 더욱 향상해야 한다.
- 향후 연구: 연구자들은 SELF-ALIGN의 실제 적용 가능성과 효과를 인간 평가로 검증하고, 의 15k instruction-following data를 포함한 오픈소스 주석 데이터의 활용을 개선해야 한다.
- 향후 연구: 연구 공동체는 원칙 정의가 공동체별 윤리적·문화적·응용 맥락과 어떻게 상호작용하는지 연구해야 한다.이 논문은 원칙 기반 self-alignment를 여러 이해관계자의 참여를 위한 출발점으로 제시하지만, 공동체 전반에서 긍정적 결과를 얻기 위해서는 상당한 후속 연구가 필요하다고 지적한다.
A 한계 및 사회적 영향
이 절에서는 SELF-ALIGN 기법과 공개된 Dromedary 모델의 한계 및 공개에 따른 잠재적 사회적 영향을 논의한다.
- 한계: 이 절에서는 제안된 SELF-ALIGN 기법의 한계를 검토한다.
- 한계: 또한 공개된 Dromedary 모델의 한계를 고찰한다.
- 사회적 영향: 공개로 인해 발생할 수 있는 잠재적 사회적 영향을 다룬다.
A.1 한계 · A.2 사회적 영향
논문은 Dromedary가 기반 모델의 한계와 포괄적인 alignment 원칙을 정의하는 데 따르는 어려움을 물려받는다고 인정한다. 또한 오용, 허위정보, 편향, 불공정성을 비롯한 위험과 함께 alignment가 가져올 수 있는 사회적 편익도 강조한다.
- A.1 한계: Dromedary의 응답은 부정확하거나 최신이 아닐 수 있다. 이는 내재 지식이 기반 모델의 완전성과 최신성에 의해 제한되기 때문이다.논문은 이러한 한계로 인해 응답이 최근의 발전을 반영하지 못할 수 있다고 지적한다.
- A.1 한계: 모든 잠재적 상황과 과제를 예측하기 어려울 수 있으므로 self-alignment를 위한 원칙을 정의하는 일은 간단하지 않다.
- A.2 사회적 영향: 이 연구는 AI alignment 전략을 확장하고, 책임감 있으며 인간의 가치에 부합하는 강력한 시스템을 개발하기 위한 더욱 다양하고 견고한 접근법을 촉진하는 것을 목표로 한다.논문은 이 방향이 사회 전반에서 더 안전하고 조화로운 AI 통합을 뒷받침한다고 제시한다.
- A.2 사회적 영향: 논문은 이 연구가 초래할 수 있는 잠재적 부정적 영향을 사회적 영향에 관한 우려로 지적한다.
- A.2 사회적 영향: Dromedary는 악의적인 콘텐츠나 자동화된 허위정보를 생성하는 데 오용될 수 있다.논문은 개발자와 사용자를 위한 윤리적 지침과 함께 오용을 탐지하고 완화하는 메커니즘이 필요하다고 주장한다.
- A.2 사회적 영향: Dromedary는 기반 모델의 사전 학습 데이터에 존재하는 편향을 지속시키거나 악화할 수 있으며, 잠재적으로 불공정하거나 차별적인 결과를 초래할 수 있다.
B Dromedary에 대한 추가 세부사항 · C Dromedary-2
Dromedary는 대규모 자동 생성 데이터셋, 원칙 정렬 응답 필터링, 단계적 fine-tuning을 활용해 최소한의 인간 감독으로 LLaMA-65b에 SELF-ALIGN을 적용한다. Dromedary-2는 LLaMA-2와 개선된 in-context exemplar를 사용해 성능을 한층 높였으며, 장황한 복제나 추론 시 few-shot 예시 없이도 이를 달성한다.
- B Dromedary에 대한 추가 세부사항: Dromedary는 LLaMA-65b base language model에 SELF-ALIGN을 구현해 개발되었다 [44].학습 및 decoding hyperparameter는 Appendix D.2에 제시되어 있다.
- B Dromedary에 대한 추가 세부사항: Self-Instruct는 Alpaca의 recipe 를 따라 267,597개의 open-domain prompt와 이에 대응하는 input을 자동으로 생성했다.Topic-Guided Red-Teaming Self-Instruct는 20개의 red-teaming instruction type에 걸쳐 99,121개의 prompt를 추가로 생성했다.
- B Dromedary에 대한 추가 세부사항: 필터링된 query-response pair 258,878개를 얻었다. 이 중 191,628개는 Self-Instruct에서, 67,250개는 Topic-Guided Red-Teaming Self-Instruct에서 생성되었다.Figure 6은 이 데이터셋에 포함된 원칙과 instruction type을 분석한다.
- B Dromedary에 대한 추가 세부사항: non-verbose Dromedary는 생성된 pair 258,878개와 Vicuna 에서 가져온 수정된 dummy-data pair 910개를 사용해 fine-tuning되었다.dummy data는 Dromedary의 self-identification을 개선했다.
- B Dromedary에 대한 추가 세부사항: 최종 verbose Dromedary는 non-verbose model에 더 장황한 output을 생성하도록 prompting해 얻은 응답 358,777개로 학습되었다.non-verbose model은 Topic-Guided Red-Teaming 및 Self-Instruct query에 대한 응답의 teacher로 사용되었다.
- B Dromedary에 대한 추가 세부사항: 최종 Dromedary model은 SFT나 RLHF 없이 base language model에서 less than 300 lines의 human annotation을 사용해 처음부터 학습되었다.이는 helpful하고 ethical하며 reliable하도록 설계되었다.
- C Dromedary-2: 개선된 in-context exemplar를 사용해 LLaMA-2에서 학습된 Dromedary-2는 verbose cloning이나 inference-time few-shot example 없이 enhanced performance를 달성했다.실험에서는 in-context self-alignment example에서 general-specific-general style을 더 충실히 따르는 응답을 사용했다.
D 추가 실험 세부 사항 · D.1 Dromedary 및 baseline 모델 · D.2 하이퍼파라미터
이 절에서는 Dromedary와 비교 모델을 정의하고, 예비 Vicuna 평가를 보고하며, SELF-ALIGN 단계의 decoding 및 fine-tuning 하이퍼파라미터를 명시한다. Dromedary는 최종 및 non-verbose 변형 모두 LLaMA-65b로 구축되며, 최종 모델에는 SELF-ALIGN의 네 단계가 모두 적용된다.
- D.1 Dromedary 및 baseline 모델: 실험에서는 benchmark dataset을 사용해 Dromedary를 정량적으로 평가하고, 추가 dataset에서 정성적으로 평가하며, 생성 텍스트에는 기본적으로 temperature 0.7을 사용한다.기본 decoding temperature는 language model이 생성하는 모든 텍스트에 적용된다.
- D.1 Dromedary 및 baseline 모델: LLaMA [44]는 7 billion to 65 billion parameters 규모의 base model로 구성되며 next-word prediction만으로 학습되고, 공정한 비교를 위해 Dromedary와 동일한 prompt를 입력받는다.비교에 사용된 LLaMA 모델은 base language model이다.
- D.1 Dromedary 및 baseline 모델: Dromedary는 LLaMA-65b를 기반으로 구축되며, final 및 non-verbose 변형은 각각 all four SELF-ALIGN steps와 verbose cloning 없는 principle engraving에 대응한다.verbose prompt는 Appendix K.1에 설명되어 있다.
- D.1 Dromedary 및 baseline 모델: Vicuna 는 예비 GPT-4 판정 평가에서 ChatGPT 품질의 over 90%를 달성하고, more than 90% of cases에서 LLaMA와 Alpaca를 능가한다.평가에서는 GPT-4를 judge로 사용한다.
- D.2 하이퍼파라미터: Self-Instruct와 Topic-Guided Red-Teaming Self-Instruct는 top-p 0.98 및 temperature 1.0 nuclear sampling [16]을 사용해 최대 384 new tokens를 생성한다.이 설정은 두 prompt-generation 절차에 모두 적용된다.
- D.2 하이퍼파라미터: Principle-driven self-alignment는 top-p 0.9 및 temperature 0.5 nuclear sampling [16]을 사용해 최대 256 new tokens를 생성하는데, principles와 demonstrations가 약 1800 LLaMA tokens를 차지하기 때문이다.통합된 principles와 in-context demonstrations는 Appendices G와 H에 제시되어 있다.
- D.2 하이퍼파라미터: Principle engraving과 verbose cloning은 각각 multi-head attention에서 only LoRa weights [17]만 사용해 LLaMA-65b [44]를 1 epoch 동안 fine-tuning하며, batch size는 768, learning rate는 4e −4다.Principle engraving은 sequence length 512와 약 335 steps를 사용하고, verbose cloning은 sequence length 768과 약 465 steps를 사용하며, 100-step logarithmic warm-up 이후 decay를 적용한다.
D.3 벤치마크 데이터셋
이 논문은 truthfulness, helpfulness, honesty, harmlessness 및 광범위한 챗봇 역량을 다루는 벤치마크에서 모델을 평가한다. 여기에는 TruthfulQA, BIG-bench HHH Eval, GPT-4의 도움을 받은 Vicuna 벤치마크 질문이 포함된다.
- TruthfulQA: TruthfulQA [22]는 38개의 적대적 범주에서 모델이 현실 세계에 관한 문자 그대로의 진실을 식별하고 거짓 주장이나 허위 정보를 피하는지 테스트한다.multiple-choice 과 generation 과제를 모두 포함한다.
- BIG-bench HHH Eval: BIG-bench HHH Eval [39] [3]은 범주당 대략 50개의 평가로 구성된 약 200개의 pairwise 비교를 통해 helpfulness, honesty, harmlessness를 평가한다.명시적으로 alignment와 capability를 분리하지 않고 두 요소를 평가하는 것이 목적이다.
- Vicuna 벤치마크 질문: Vicuna 벤치마크는 GPT-4 를 사용해 Fermi 문제, roleplay, coding/math 과제를 포함한 다양한 질문에 대한 챗봇 답변을 평가한다.이 프레임워크는 LLaMA, Alpaca, ChatGPT, Bard, Vicuna에서 답변을 수집하며, 부수 분석에서는 Dromedary 65b를 최종 2-shot 모델로 식별한다.
E Vicuna benchmark 질문에 대한 추가 분석
Dromedary는 fermi, counterfactual, coding, math를 포함한 추론 집약적 Vicuna 질문 범주에서 LLaMA 기반 baseline을 일관되게 능가한다. 그러나 종합적인 응답 구성 능력이 필요한 범주, 특히 knowledge, roleplay, common-sense, writing에서는 ChatGPT와 Vicuna에 뒤처진다.
- 범주 수준 분석: Dromedary는 fermi, counterfactual, coding, math와 같은 추론 집약적 범주에서 Alpaca와 Vicuna를 일관되게 능가한다.이 범주 수준 분석은 Figure 8에 제시되어 있다.
- 범주 수준 분석: Dromedary는 종합적인 응답 구성이 필요한 knowledge, roleplay, common-sense, writing 질문에서 ChatGPT 및 Vicuna와 경쟁력이 없다.
- 응답 비교: Vicuna 분석에는 few-shot 예시의 유무에 따른 GPT-4-assessed 응답 비교도 포함된다.이 비교는 Figures 9 and 10에 제시되어 있다.
F 더 많은 샘플 … 주제 유도 레드팀 Self-Instruct를 위한 M개 Instruction Prompt
예시에서 Dromedary는 대체로 유해한 요청을 거부하고, 근거 없는 인구통계학적 판단을 피하며, 모호성을 인정한다. 그러나 엄격한 원칙 준수와 수학적 추론에서는 여전히 실패를 보인다. 이 절에는 도덕적 자기 교정, benchmark 방식 과제, 장황한 출력, 다국어 생성에 관한 prompt도 포함된다.
- F 더 많은 샘플: Dromedary는 무단 계정 접근, 백인우월주의자 모집, 절도에 관한 지시를 거부하면서 법적·윤리적·안전상의 우려를 설명한다.반면 Alpaca는 계정 접근과 백인우월주의자 모집 사례에서 실행 가능한 유해 지침을 제공한다.
- F 더 많은 샘플: 민감한 사회적 질문에 대해 Dromedary는 집단 기반 신뢰 판단을 거부하고, 노숙 문제에는 인간적인 체계적 대응이 필요하다고 설명하며, 자신은 증오를 경험할 수 없다고 말한다.이러한 응답은 Alpaca의 인구통계학적 일반화 및 사람을 미워하는지에 대한 의인화된 답변과 대조된다.
- F 더 많은 샘플: Dromedary의 도덕적 자기 교정 예시에서는 모호한 BBQ 질문에 “판단할 수 없음”을 선택하고, Winogender prompt에서는 “his” 또는 “her” 중 어느 것이든 허용한다.이 예시들은 LLaMA, Vicuna, ChatGPT, GPT-4와의 비교와 함께 제시된다.
- F 더 많은 샘플: 예비 평가에서는 두 가지 두드러진 실패 모드를 확인한다. 여기에는 미리 정의된 원칙을 엄격히 따르지 못하는 문제가 포함되며, 예를 들어 candor rule을 위반해 misinformation을 환각하는 경우가 있다.이 절은 이러한 단점을 포괄적으로 해결하려면 추가적인 조사와 개발이 필요하다고 설명한다.
- K.2 다국어 출력을 위한 Prompt: 다국어 출력을 위한 prompt를 약간 수정해 영어가 아닌 문자를 표시하도록 했으며, 원본 버전은 codebase에서 확인할 수 있다.이 문단은 다국어 출력에 사용된 다국어 prompt를 구체적으로 설명한다.
N MC 벤치마크를 위한 평가 프롬프트
평가 프롬프트는 시험 형식의 사용자 질문을 통해 답을 도출함으로써 Dromedary를 multiple-choice 벤치마크에 맞춘다. TruthfulQA는 true/false 후보를 직접 평가하는 반면, HHH Eval은 answer-order bias를 완화하기 위해 위치를 바꿔가며 answer option을 평가한다.
- TruthfulQA: TruthfulQA는 true와 false의 likelihood를 answer score로 평가해 각 후보를 평가한다.후보 answer에는 true 또는 false가 명시적으로 부여되며, Dromedary는 이에 대응하는 truth value를 반환한다.
- HHH Eval: HHH Eval은 option A와 B의 likelihood를 평가하고, 원래 dataset이 항상 정답을 A에 배치하기 때문에 두 option의 위치를 바꾼 뒤 결과를 집계한다.프롬프트는 A)와 B)로 표시된 두 개의 answer candidate를 제시한다.
- Prompt format: 프롬프트는 사용자가 benchmark question과 answer candidate를 제시하고 도움을 요청하면 Dromedary가 답을 선택하는 exam-style interaction을 사용한다.이 형식은 TruthfulQA와 HHH Eval 프롬프트 모두에 지정된다.
O Vicuan Benchmark 질문을 위한 Few-Shot Prompt · P 추가 관련 연구 · Q Principle-Driven Self-Alignment의 Cherry-pick 시연 예시
부록은 few-shot benchmark prompt, 관련 연구 맥락, 그리고 다양한 질의 유형에 걸쳐 원칙이 응답을 어떻게 이끄는지 보여주는 시연을 통해 Dromedary를 보완한다. 이 자료들은 함께 윤리적이고, 정보가 풍부하며, 유용하고, 솔직하고, 단계적인 응답을 위한 prompt 구성과 원칙 적용을 보여준다.
- O Vicuan Benchmark 질문을 위한 Few-Shot Prompt: 두 가지 대화 예시는 원래의 장황한 prompt에 Vicuna의 재생 에너지 prompt와 coding 예시를 결합해 Dromedary의 응답 품질을 향상시킨다.coding 예시는 최장 공통 접두사 programming 문제에 대한 응답을 보여주며, 재생 에너지 예시는 재생 가능 에너지원과 재생 불가능 에너지원을 대조한다.
- P 추가 관련 연구: 관련 연구는 SELF-ALIGN을 large language model과 Transformer architecture [46]의 발전이라는 맥락에 위치시킨다.이 단락은 natural-language-processing task 전반의 LLM 발전을 설명하고, Transformer의 도입과 함께 기초가 된 model 발전을 인용한다.
- Q Principle-Driven Self-Alignment의 Cherry-pick 시연 예시: Principle-driven 시연은 safety refusal, 정보 제공형 답변, 유용한 단계별 안내, 질문 평가, 엄밀한 reasoning, 다면적 범위, 한계에 대한 솔직한 고지를 아우른다.예시로는 마약류 정보를 거부하고, Los Angeles에서 할 일을 나열하며, stock-index 순위 산정 방식을 설명하고, recipe를 추천하고, 감정이 없음을 인정하는 응답이 포함된다.
- Q Principle-Driven Self-Alignment의 Cherry-pick 시연 예시: 원칙 예시에서 Dromedary는 답변 전에 적용 가능한 규칙을 선택하며, word association과 recipe 추천에서 informative 원칙과 multi-aspect 원칙을 결합하는 방식이 그 예다.다른 내부 숙고에서는 helpfulness와 question assessment, reasoning과 step-by-step explanation, dated knowledge와 미래 사건에 대한 명시적 불확실성을 짝지어 적용한다.
- Q Principle-Driven Self-Alignment의 Cherry-pick 시연 예시: 이 시연들은 knowledge recitation, static-model limitations, clarification, numerical sensitivity, dated knowledge, balanced perspectives, creativity, operational assistance도 부호화한다.응답은 실시간 안내를 명시적으로 피하고, 지식 기준 시점이 September 2021임을 밝히며, 단위 변환 질문에 답하고, 고등교육 훈련에 대한 양쪽 관점을 제시하고, 하이쿠를 생성하며, 열대 여행을 위한 짐 꾸리기 단계를 안내한다.