Source-linked AI summary
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng, Radha Poovendran, Yejin Choi, Bill Yuchen Lin
TL;DR
Open-weight aligned LLM은 alignment data가 공개되지 않는 경우가 많고, 기존 synthetic-data 방법은 확장성 문제에 직면한다. MAGPIE는 aligned model의 template에서 instruction을 직접 추출하며, MAGPIE로 alignment된 model은 instruction-following benchmark에서 공식 aligned model과 비슷하거나 더 높은 성능을 달성한다.
문제
Open-weight aligned LLM은 alignment data를 비공개로 유지하는 경우가 많고, 기존 synthetic-data 방법은 prompt engineering과 seed question에 의존해 확장 가능한 고품질·다양한 instruction data 생성을 제한한다.
방법
MAGPIE는 query 이전의 template만으로 aligned LLM을 prompting해 prompt engineering이나 seed question 없이 다양한 instruction과 response를 self-synthesize한다.
결과
MAGPIE-aligned model은 instruction-following benchmark에서 공식 aligned model과 비슷하거나 더 높은 성능을 달성한다. AlpacaEval 2에서는 Llama-3-8B-Instruct를 상대로 LC가 50%를 초과한다.
시사점 및 한계
MAGPIE는 aligned LLM이 predefined template에서 직접 유용한 instruction data를 self-synthesize할 수 있음을 보여주며, prompt engineering이나 seed question 없이 확장 가능한 alignment-data construction을 뒷받침한다.
시사점 및 한계
MAGPIE-aligned LLM은 math 및 reasoning benchmark에서 성능이 저하되며, specialized reasoning dataset을 사용했음에도 공식 model보다 여전히 뒤처진다.
Abstract
from arXiv · showhide
High-quality instruction data is critical for aligning large language models (LLMs). Although some models, such as Llama-3-Instruct, have open weights, their alignment data remain private, which hinders the democratization of AI. High human labor costs and a limited, predefined scope for prompting prevent existing open-source data creation methods from scaling effectively, potentially limiting the diversity and quality of public alignment datasets. Is it possible to synthesize high-quality instruction data at scale by extracting it directly from an aligned LLM? We present a self-synthesis method for generating large-scale alignment data named Magpie. Our key observation is that aligned LLMs like Llama-3-Instruct can generate a user query when we input only the left-side templates up to the position reserved for user messages, thanks to their auto-regressive nature. We use this method to prompt Llama-3-Instruct and generate 4 million instructions along with their corresponding responses. We perform a comprehensive analysis of the extracted data and select 300K high-quality instances. To compare Magpie data with other public instruction datasets, we fine-tune Llama-3-8B-Base with each dataset and evaluate the performance of the fine-tuned models. Our results indicate that in some tasks, models fine-tuned with Magpie perform comparably to the official Llama-3-8B-Instruct, despite the latter being enhanced with 10 million data points through supervised fine-tuning (SFT) and subsequent feedback learning. We also show that using Magpie solely for SFT can surpass the performance of previous public datasets utilized for both SFT and preference optimization, such as direct preference optimization with UltraFeedback. This advantage is evident on alignment benchmarks such as AlpacaEval, ArenaHard, and WildBench.
1 서론
MAGPIE는 pre-query template만 prompting해 prompt engineering, seed question, 인간 개입, production-LLM API 접근 없이 aligned LLM에서 직접 다양하고 고품질인 instruction data를 합성한다. MAGPIE 기반 모델은 기존 public-data 접근법을 능가하며 AlpacaEval 2에서 강력한 결과를 달성한다. 여기에는 official Llama-3-8B-Instruct를 능가하는 결과와, preference optimization 확장을 적용했을 때 GPT-4-Turbo(1106)를 능가하는 결과가 포함된다.
- 동기: Instruction-tuning의 성공은 고품질 데이터에 달려 있다. 고품질 데이터가 LLM이 training에 없던 task를 포함해 다양한 task에서 instruction을 따르도록 하기 때문이다.인간이 curated한 데이터는 시간과 노동이 많이 들며, synthetic-data 방법도 여전히 prompt engineering, seed 선택, diversity 문제에 직면한다.
- 방법: MAGPIE는 aligned LLM에 pre-query template만 입력하고 autoregressive generation 능력을 활용해 고품질의 다양한 user query를 생성한다.이 방법은 수작업으로 작성한 prompt나 seed question에 의존하는 대신 Llama-3-Instruct와 같은 aligned model에서 instruction을 직접 추출한다.
- 방법: 기존 synthetic-data 방법과 달리 MAGPIE는 prompt engineering이나 seed question에 의존하지 않으며, multi-turn, preference optimization, domain-specific data로 확장할 수 있다.기존 접근법은 dataset 규모가 커질수록 diversity가 감소할 수 있지만, MAGPIE는 aligned LLM에서 scalable self-synthesis가 가능하도록 설계되었다.
- 리소스: MAGPIE-Air와 MAGPIE-Pro는 각각 206 및 614 GPU hours를 사용해 생성되었으며, 인간 개입이나 production LLM API 접근은 없었다.생성된 dataset은 종합적으로 분석되어 practitioner가 fine-tuning 목적에 맞는 instance를 필터링할 수 있다.
- 실증 결과: MAGPIE-aligned model은 AlpacaEval 2에서 official Llama-3-8B-Instruct를 능가하며, MAGPIE 확장과 preference optimization을 결합하면 GPT-4-Turbo(1106)를 능가할 수 있다.MAGPIE는 DPO와 같은 preference optimization 방법과 결합했을 때에도 최상의 결과를 낸다.
2 MAGPIE: 확장 가능한 alignment data 합성 방법
MAGPIE는 open-weight aligned LLM에 pre-query template부터 instruction을 생성하도록 prompting한 뒤, 이에 대응하는 response를 생성해 alignment data를 합성한다. 이 방법은 model-specific, filtered, multi-turn, preference-optimization, domain-specific, multilingual dataset을 지원한다.
- MAGPIE 개요: MAGPIE는 두 단계로 alignment data를 생성한다. 먼저 정교하게 설계한 pre-query template에서 instruction을 유도한 다음, aligned LLM에 prompting해 이에 대응하는 response를 생성한다.결과 dataset은 생성된 instruction과 response에 instruction-provider와 follower 역할을 결합한다.
- MAGPIE의 적용 가능성: MAGPIE는 Llama-3, Llama-3.1, Qwen2, Gemma-2, Phi-3를 포함한 open-weight model에 적용할 수 있다.이 방법은 이러한 state-of-the-art model family 전반에 쉽게 배포할 수 있다고 설명된다.
- Dataset Filtering: 사용자는 customizable metric과 off-the-shelf configuration으로 MAGPIE의 raw generation을 filter해 목적에 맞는 instruction data를 선택할 수 있다.이 방법은 사용할 수 있는 8개 metric과 6개 off-the-shelf filter configuration을 제공한다.
- Multi-Turn Instruction Dataset 생성: MAGPIE는 각 이전 대화 뒤에 pre-query template을 추가해 multi-turn instruction dataset으로 확장할 수 있지만, 8B model은 간혹 user role을 잃을 수 있다.첫 번째 turn은 표준 instruction 및 response-generation 단계를 따르고, 이후 turn은 이전 prompt에서 이어진다.
- 확장: MAGPIE는 반복적인 response sampling, task selection, 맞춤형 system prompt를 통해 preference-optimization data와 제어된 domain-specific 또는 multilingual generation도 지원한다.DeepSeek-Coder-V2와 Qwen2-Math-7B-Instruct 같은 specialized model은 domain-specific capability를 추가로 제공할 수 있다.
3 데이터셋 분석
MAGPIE는 폭넓고 대체로 고품질이며 안전한 instruction dataset을 생성하고, 다양한 task를 포괄한다. 완전 자동화된 pipeline은 사람의 개입이나 고급 상용 API에 대한 접근 없이 수백만 개 example로 확장된다.
- 속성: Instruction의 Task Categories: MAGPIE-Pro는 다양한 instruction 주제를 포괄하며, information seeking이 가장 큰 비중을 차지하고 creative writing, advice seeking, planning, math가 그 뒤를 잇는다.category 분포는 Llama-3-8B-Instruct로 MAGPIE-Pro에 annotation을 수행해 산출했다.
- 속성: Instruction의 Quality: MAGPIE-Air와 MAGPIE-Pro는 모두 고품질이며, 대부분의 instruction이 average 이상으로 평가된다.Quality는 very poor부터 excellent까지 5개 category에 걸쳐 Llama-3-8B-Instruct로 평가했으며, 분포는 Figure 3-(a)에 제시했다.
- 속성: Instruction의 Difficulty: 두 dataset의 difficulty 분포는 유사하지만, MAGPIE-Pro에는 더 challenging한 instruction도 일부 포함된다.Difficulty는 very easy부터 very hard까지 평가했으며, 분포는 Figure 3-(b)에 제시했다.
- Safety 분석: MAGPIE-Air와 MAGPIE-Pro는 모두 대체로 안전하며, harmful한 instruction이나 response를 포함할 가능성이 있는 example은 1% 미만이다.Safety는 Llama-Guard-2를 사용해 분석했다.
- Generation Efficiency: MAGPIE의 완전 자동화된 pipeline은 사람의 개입이나 고급 상용 API에 대한 접근 없이 3M MAGPIE-Air example과 1M MAGPIE-Pro example을 생성했다.Instruction과 response를 생성하는 데 MAGPIE-Air는 각각 1.55시간과 50시간, MAGPIE-Pro는 각각 3.5시간과 150시간이 소요됐다.
4 성능 분석
MAGPIE가 생성한 instruction data는 instruction-following benchmark 전반에서 공개 baseline을 일관되게 능가하며, 훨씬 적은 data로도 공식 aligned model의 성능에 도달하거나 이를 넘어선다. 이러한 향상은 Llama와 Qwen backbone 모두에 전이되지만, reasoning instruction이 부족하게 포함되어 있어 reasoning 성능에는 추가 data가 필요하다.
- 평가 benchmark: 평가에는 AlpacaEval 2와 Arena-Hard가 사용되며, GPT 기반 평가는 각각 대표 instruction 805개와 난도 높은 query 500개를 포함한다.두 benchmark 모두 GPT evaluator를 사용해 instruction-following response를 평가하며, 보고되는 metric은 win rate와 length-controlled win rate다.
- MAGPIE dataset은 SFT만으로 baseline을 능가한다: MAGPIE fine-tuning은 AlpacaEval 2의 두 metric 모두에서 baseline SFT dataset을 능가하며, WildBench task category 전반에서도 일관되게 우수한 성능을 보인다.Table 1은 Llama-3 비교 결과를 보고하고, Figure 5는 WildBench category별 MAGPIE-Pro와 baseline의 성능을 세분화해 보여준다.
- MAGPIE가 생성한 data로 alignment된 model은 공식 aligned model과 비슷하거나 더 높은 성능을 달성한다: MAGPIE로 학습한 Llama-3-8B는 AlpacaEval 2와 Arena-Hard에서 공식 Llama-3-8B-Instruct model을 능가하며, AlpacaEval 2에서는 GPT-4-Turbo(1106)도 넘어선다.MAGPIE alignment process에는 최대 400K data만 사용되는 반면, 공식 aligned model에는 10M이 넘는 sample이 사용된다.
- MAGPIE는 다른 backbone model의 성능도 향상할 수 있다: Qwen2-1.5B, Qwen1.5-4B, Qwen1.5-7B에서 MAGPIE fine-tuning은 supervised fine-tuning과 preference tuning을 모두 거쳐 학습된 공식 model을 능가한다.Table 2는 MAGPIE-Pro-300K-Filtered와 공식 instruction-tuned model을 사용해 Qwen model을 평가한다.
- 추가 benchmark에서의 MAGPIE 성능: MAGPIE-Air와 MAGPIE-Pro는 Huggingface Open LLM Leaderboard task를 통해 MMLU, ARC Challenge, HellaSwag, TruthfulQA, WinoGrande, GSM8K에서 평가된다.평가는 general knowledge와 reasoning 중심 benchmark를 모두 포함한다.
- 추가 benchmark에서의 MAGPIE 성능: reasoning instruction이 부족하기 때문에 reasoning task에서 MAGPIE 성능이 저하될 수 있으므로, 150K math, code, reasoning booster dataset을 추가한다.이 booster를 MAGPIE-Pro-300K-Filtered와 결합해 MAGPIE-Pro-Mix-Filtered를 만들며, 결과는 Table 3에 보고된다.
5 관련 연구
기존 alignment 연구는 instruction tuning과 preference tuning을 사용하며, 성능은 instruction-data quality에 크게 좌우된다. 기존 alignment-data construction 방법은 인간 상호작용, synthetic generation, data transformation 또는 이들의 혼합에 의존하는 한편, 관련 연구는 language model이 memorized training data를 유출할 수도 있음을 보여준다.
- LLM 정렬: Instruction tuning과 preference tuning은 LLM 응답을 인간의 가치에 맞추는 데 널리 사용되며, instruction-tuning 성능은 instruction-data quality에 크게 의존한다.Instruction tuning은 single-turn 또는 multi-turn instruction과 원하는 응답으로 model을 fine-tune하는 반면, preference tuning은 RLHF 또는 preference optimization을 사용한다.
- Alignment Dataset Construction: 기존 alignment dataset은 LLM과의 human interactions 또는 synthetic instruction generation을 통해 구축된다.기존 연구는 human–LLM interactions를 수집했지만, instruction을 수작업으로 작성하는 일은 시간과 노동이 많이 들며 toxic content를 유발할 수 있다.
- Alignment Dataset Construction: 기존 data를 변환하고 high-quality instruction data를 결합하거나 선택하는 방법은 추가적인 construction strategy를 제공하지만, limited task variety는 실제 환경에서의 일반화를 저해할 수 있다.Mixture dataset은 instruction data를 결합하거나 선택하는 반면, transformed dataset은 NLP-task coverage의 제약을 그대로 가질 수 있다.
- Training Data Extraction: Training-data extraction 연구는 language model이 training example을 memorization할 수 있음을 보여주며, 이에 따라 malicious user가 private information을 extract할 가능성이 있다.기존 연구는 BERT, GPT-2, ChatGPT에서 private-data extraction이 가능함을 입증했다.
6 한계, 논의 및 윤리적 고려사항
MAGPIE-aligned LLM은 instruction-following benchmark에서 강력한 성능을 보이지만, math 및 reasoning에서는 official model보다 뒤처진다. Raw MAGPIE data에는 유해한 instruction이나 response가 포함될 수 있으나, 실증 평가에 따르면 이러한 instance는 1% 미만이다.
- 한계와 논의: MAGPIE-aligned LLM은 instruction-following 성능이 강력하지만, official Llama-3-8B-Instruct에 비해 수학 및 추론 벤치마크에서 성능이 저하된다.특화된 booster reasoning dataset은 성능 격차를 줄이지만 제거하지는 못한다.
- 한계와 논의: 특화된 booster reasoning dataset을 사용하더라도 MAGPIE-aligned model은 official model과 비교해 reasoning task에서 성능 격차를 유지한다.
- 사회적 영향과 잠재적 유해 결과: Raw MAGPIE data에는 instruction tuning에 사용될 때 안전하지 않은 행동을 유발할 수 있는 유해한 instruction이나 response가 포함될 수 있다.실증 평가에 따르면 유해한 data instance는 1% 미만이다.
7 결론
MAGPIE는 대규모 언어 모델을 fine-tuning하기 위한 instruction data를 합성하는 확장 가능한 방법이다. open-weight LLM의 instruction template과 autoregressive generation을 사용해 instruction과 이에 대응하는 response를 생성한다.
- MAGPIE는 대규모 언어 모델 fine-tuning을 위한 instruction data 합성의 확장 가능한 방법을 제공한다.
- MAGPIE는 open-weight LLM의 사전 정의된 instruction template을 활용하고, 모델이 instruction provider 역할만 하도록 prompt를 구성한다.
- autoregressive generation에 의해 prompt된 LLM은 정교한 instruction을 생성한다.
- 그다음 MAGPIE는 생성된 instruction을 LLM에 다시 전달해 이에 대응하는 response를 생성한다.
A MAGPIE가 생성한 instruction dataset과 다른 instruction dataset의 통계
MAGPIE는 여러 최신 open-weight model family에 걸쳐 다양하고 고품질인 instruction–response dataset을 생성할 수 있다. 이 dataset family는 11.4 million개를 초과하는 instance로 구성되어 있어, 인간이 작성한 질문이나 복잡한 다단계 pipeline 없이 여기서 설명하는 alignment dataset 중 가장 크다.
- Model coverage: MAGPIE dataset은 Llama-3, Llama-3.1, Qwen2, Gemma-2, Phi-3 open-weight model family에서 생성할 수 있다.이 방법은 이러한 최신 model family 전반에 즉시 적용할 수 있는 것으로 제시된다.
- Dataset scale: MAGPIE dataset family는 11.4 million개를 초과하는 다양하고 고품질인 instruction과 이에 대응하는 response를 포함한다.이 dataset들은 최신 open-source model에서 생성된다.
- Comparison scope: MAGPIE는 인간이 작성한 질문과 복잡한 다단계 pipeline을 배제하는 가장 큰 alignment dataset으로 설명된다.Table 4는 tiktoken library로 token을 계산하여 MAGPIE family의 통계를 다른 instruction dataset과 비교한다.
B MAGPIELM … D.2 추가 안전성 분석
이 논문은 MAGPIE를 MAGPIELM으로 확장하고, 설정 가능한 filtering과 dataset 분석을 제공하며, 잠재적으로 유해한 query는 최소한으로 포함하면서 폭넓은 coverage를 확보한다. MAGPIELM은 여러 alignment benchmark에서 비슷한 규모의 baseline을 크게 앞선다.
- B MAGPIELM: MAGPIELM은 Alpaca Eval 2, Arena Hard, Wildbench 전반에서 비슷한 규모의 baseline을 크게 앞선다.Figure 6은 비슷한 규모의 baseline과 비교한 MAGPIELM-4B-Chat 및 MAGPIELM-8B-Chat의 결과를 보고한다.
- B MAGPIELM: MAGPIELM은 SFT에 550K instructions를, DPO에 200K를 사용하며, 다양한 category에 걸친 response는 Gemma-2-9b-it가 생성한다.두 dataset 모두 MAGPIE 계열에서 high-quality instructions를 선택한다.
- C FILTER SETUPS: MAGPIE filtering은 dataset customization을 위해 input length, output length, task category, input quality, input difficulty를 노출한다.논문은 바로 사용할 수 있는 filter configuration도 제공하며, output length는 마지막에 적용되어 가장 긴 response k개를 선택한다. 실험에서는 τ1 = −12 및 τ2 = 0으로 설정했다.
- D MORE DATASET ANALYSIS: 추가 dataset 분석은 instruction 및 response length를 보고하며, MAGPIE-Air의 공통 root verb와 noun object는 diverse topic coverage를 보여준다.이 통계는 Figure 7에 제시되어 있으며, root-verb visualization에는 MAGPIE-Air dataset이 사용된다.
- D.1 DATASET COVERAGE 및 ATTRIBUTE에 대한 추가 분석.: MAGPIE-Pro의 t-SNE coverage는 Alpaca, Evol Instruct, UltraChat을 포괄하며, 더 넓거나 더 다양한 topic coverage를 시사한다.비교에서는 각 dataset에서 instructions 10,000개를 무작위로 sampling한다.
- D.1 DATASET COVERAGE 및 ATTRIBUTE에 대한 추가 분석.: MAGPIE-Pro와 MAGPIE-Air는 task-category distribution이 대체로 유사하지만, MAGPIE-Pro에는 creative-writing task가 더 많다.distribution은 Llama-3-Instruct가 부여한 label로 표시된다.
- D.2 추가 안전성 분석: 잠재적으로 유해한 query는 MAGPIE-Air와 MAGPIE-Pro 모두에서 1% 미만을 차지하며, unsafe response는 주로 specialized advice와 관련된다.specialized-advice category에는 잠재적으로 위험한 financial, medical, legal guidance와 위험한 activity 또는 object가 안전하다는 주장이 포함된다.
D.3 생성 설정에 대한 Ablation 분석 · D.4 Annotation 모델의 영향
Ablation 결과, decoding 선택은 instruction quality와 difficulty·diversity 사이의 trade-off를 만들며, system prompt는 대체로 quality를 낮춘다. MAGPIE-Air의 quality와 difficulty는 annotator 전반에서 높게 유지되며, Qwen-2-7B-Instruct로 평가했을 때 Llama-3-8B-Instruct의 원래 ratings를 넘어선다.
- D.3 생성 설정에 대한 Ablation 분석: Decoding ablation은 Average Quality Score, Average Difficulty Score, Average Minimum Neighbor Distance를 사용해 instruction quality, difficulty, diversity를 평가한다.Quality와 difficulty ratings는 1에서 5까지의 척도를 사용하며, 각각 매우 낮음에서 우수함, 매우 쉬움에서 매우 어려움을 나타낸다.
- D.3 생성 설정에 대한 Ablation 분석: Temperature와 top-p가 높아지면 instruction quality가 소폭 낮아질 수 있지만 difficulty가 증가하고 diversity가 크게 향상된다.이 연구는 MAGPIE Step 1에서 temperature를 1, 1.1, 1.2로, top-p를 1, 0.995, 0.99로 변화시킨다.
- D.3 생성 설정에 대한 Ablation 분석: 선호되는 decoding hyperparameter는 quality, difficulty, diversity를 균형 있게 조정해 요구사항에 맞춰야 한다.관찰된 trade-off는 더 높은 difficulty와 diversity를 선호하는 설정이 전체 quality를 낮출 수 있음을 의미한다.
- D.3 생성 설정에 대한 Ablation 분석: MAGPIE Step 1에서 system prompt를 사용하면 사용하지 않을 때보다 생성된 instruction의 전체 quality가 대체로 낮아진다.Llama-3에는 공식 system prompt가 없으므로 비교에는 Vicuna의 default prompt를 사용한다.
- D.4 Annotation 모델의 영향: Annotator-model identity가 evaluation에 영향을 미치는지 검증하기 위해 Qwen-2-7B-Instruct를 사용해 MAGPIE-Air의 quality와 difficulty를 annotation했다.이 실험은 LLM이 때때로 자체 response를 선호할 수 있다는 가능성을 다룬다.
- D.4 Annotation 모델의 영향: Qwen-2-7B-Instruct ratings는 MAGPIE-Air가 높은 quality와 difficulty를 유지하며, 원래 Llama-3-8B-Instruct annotations를 넘어선다는 것을 보여주고, annotator 간 robustness를 나타낸다.가능한 self-preference 효과를 평가하기 위해 annotator는 Llama-3 family 외부에서 선택했다.
E 상세 실험 설정 … F.4 필터 설계에 대한 Ablation Analysis
실험 결과, MAGPIE는 multi-turn 데이터, 더 크고 품질이 높은 filtered dataset, seed-free diversity의 이점을 얻는 반면, 성능은 filter design과 decoding 선택에 따라 달라진다. 평가는 generation, fine-tuning, preference tuning, benchmark에 대해 지정된 greedy-decoding 설정을 사용한다.
- E 상세 실험 설정: Figure 13은 instruction quality와 difficulty를 평가하기 위한 서로 다른 annotator를 비교한다.
- E.1 MAGPIE-AIR 및 MAGPIE-PRO 생성을 위한 실험 설정: Step 1 decoding parameter는 instruction quality, difficulty, diversity에 유의미한 영향을 미치므로, MAGPIE-Air와 MAGPIE-Pro는 이러한 속성의 균형을 맞추기 위해 다양한 configuration을 사용한다.configuration은 Table 7에 제시되어 있다.
- E.1 MAGPIE-AIR 및 MAGPIE-PRO 생성을 위한 실험 설정: MAGPIE-Air와 MAGPIE-Pro의 response는 greedy decoding으로 생성한다. 가장 높은 확률의 단어가 model의 training data에서 유래할 가능성이 더 높기 때문이다.
- E.2 Instruction Tuning 및 Preference Tuning을 위한 실험 설정: 실험에서는 supervised fine-tuning과 DPO hyper-parameter를 지정하며, SFT에는 Axolotl을, preference tuning에는 Alignment Handbook을 사용한다.평가에서는 Arena-Hard와 WildBench에 greedy decoding을 사용하고, AlpacaEval 2에는 RP = 1.2인 greedy decoding을 사용한다.
- F.1 MAGPIE-MT의 성능: Multi-turn MAGPIE-Air-MT와 MAGPIE-Pro-MT는 single-turn counterpart보다 성능을 향상시키며, 특히 Arena-Hard에서 두드러진다.모든 model은 Llama-8B base model에서 instruction-tuning된다.
- F.2 LLAMA-3-8B-INSTRUCT를 사용한 MAGPIE와 SELF-INSTRUCT 비교: MAGPIE는 모든 benchmark에서 Self-Instruct를 유의미하게 능가하며, seed question 없이 다양하고 높은 품질의 instruction을 생성할 수 있음을 보여준다.비교에는 Llama-3-8B-Instruct가 생성한 100K dataset을 사용하고, Llama-8B base model을 fine-tuning한다.
- F.3 Data Quantity와 Quality에 대한 Ablation Analysis: Dataset size를 늘리면 instruction-following 성능이 향상되며, MAGPIE-Pro-300K-Filtered는 같거나 더 큰 size의 dataset을 능가한다.MAGPIE-Pro는 Llama-3-70B-Instruct가 생성한다.
- F.4 Filter Design에 대한 Ablation Analysis: 서로 다른 MAGPIE-Pro filtering strategy는 benchmark마다 최적이므로, supervised-fine-tuning 성능에서 일관되게 최고를 내는 단일 filter는 없다.Filter-design 비교는 Llama-8B base model을 사용해 Table 13에 보고되어 있다.
F.5 응답 생성기에 대한 Ablation 분석 … H MAGPIE 예시
MAGPIE는 응답 생성기를 교체해도 효과적이며, 300K 예시만 사용해도 10M이 넘는 샘플로 학습된 Llama-3-8B-Instruct에 대해 경쟁력 있는 신뢰성을 보인다. 또한 논문은 MAGPIE를 확장하고 평가하기 위한 prompt template을 제시하며, 광범위하고 다국어이며 도메인 특화된 instruction 생성을 예시로 보여준다.
- F.5 응답 생성기에 대한 ABLATION 분석: 약간의 성능 저하에도 불구하고, MAGPIE의 응답 생성기로 사용된 Qwen-2-7B-Instruct는 GPT-4 기반 변형을 포함한 모든 baseline을 능가한다.이는 MAGPIE가 특정 응답 생성기에 거의 의존하지 않으며 instruction의 품질과 다양성이 높다는 것을 시사한다.
- F.6 MAGPIE-aligned 모델의 TRUSTWORTHINESS: 10M이 넘는 샘플 대비 300K 샘플을 사용한 MAGPIE는 safety와 fairness에서는 Llama-3-8B-Instruct에 근소하게 뒤처지지만, ethics, privacy, robustness에서는 이를 능가한다.비교에는 safety, fairness, ethics, privacy, robustness를 평가하는 TrustLLM benchmark가 사용된다.
- G.1 MAGPIE 확장을 위한 PROMPT TEMPLATE: MAGPIE-MT와 통제된 instruction task는 첫 번째 turn의 instruction 및 response placeholder와 도메인 특화 system prompt를 사용하는 prompt template으로 생성된다.이 template은 mathematics, coding, translation, multilingual task에 대한 제어를 예시로 보여준다.
- G.2 평가를 위한 PROMPT TEMPLATE: 평가용 prompt template은 입력 instruction으로부터 task category, instruction quality, difficulty를 생성한다.이 template은 Figures 16–18에 제시된다.
- H MAGPIE 예시: MAGPIE는 DeepSeek-Coder-V2 (Zhu et al., 2024)와 Qwen2-Math-7B-Instruct (Yang et al., 2024)를 사용해 도메인 특화 instruction도 생성한다.예시에는 크기가 조정된 직사각형의 geometry 문제와 넓이 비교가 포함된다.
- H MAGPIE 예시: MAGPIE는 영어를 넘어 Qwen2-72B-Instruct를 사용한 multilingual dataset으로 확장되며, 중국어, 스페인어, 이탈리아어, 포르투갈어 예시를 포함한다.예시는 bitwise programming, customer-satisfaction analysis, phrase interpretation, creative dialogue를 다룬다.