Source-linked AI summary
LLaMA: Open and Efficient Foundation Language Models
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, Guillaume Lample
TL;DR
언어 모델을 대규모로 서비스하려면 추론 효율성이 중요하므로, 일반적으로 사용되는 것보다 더 많은 token으로 학습한 모델이 필요하다. LLaMA는 공개적으로 이용 가능한 데이터를 사용해 7B부터 65B parameter까지의 모델을 만들며, LLaMA-13B는 대부분의 benchmark에서 GPT-3를 능가하고 LLaMA-65B는 대표 모델들과 경쟁력 있는 성능을 보인다.
문제
기존 scaling-law 목표는 학습 compute를 강조하면서 추론 예산을 간과하므로, 서로 다른 추론 비용에서 성능을 최적화한 모델이 필요하다.
방법
LLaMA는 일반적으로 사용되는 것보다 더 많은 token으로 7B–65B parameter 언어 모델을 학습하며, 전적으로 공개적으로 이용 가능한 데이터에 의존한다.
결과
LLaMA-13B는 10× 더 작음에도 불구하고 대부분의 benchmark에서 GPT-3를 능가하며, LLaMA-65B는 Chinchilla-70B 및 PaLM-540B와 경쟁력 있는 성능을 보인다.
시사점 및 한계
공개된 모델은 open research를 지원하고 대규모 언어 모델의 접근성을 높일 수 있으며, LLaMA-13B는 단일 GPU에서 실행할 수 있다.
시사점 및 한계
toxicity 및 bias 평가는 이러한 모델과 관련된 위험을 충분히 이해하기에는 충분하지 않다.
Abstract
from arXiv · showhide
We introduce LLaMA, a collection of foundation language models ranging from 7B to 65B parameters. We train our models on trillions of tokens, and show that it is possible to train state-of-the-art models using publicly available datasets exclusively, without resorting to proprietary and inaccessible datasets. In particular, LLaMA-13B outperforms GPT-3 (175B) on most benchmarks, and LLaMA-65B is competitive with the best models, Chinchilla-70B and PaLM-540B. We release all our models to the research community.
1 서론
LLaMA는 더 많은 토큰으로 7B–65B 언어 모델을 학습해 다양한 inference budget에서 성능을 최적화하며, 공개적으로 이용 가능한 데이터만으로 경쟁력 있는 결과를 달성한다. LLaMA-13B는 10× 더 작은 규모임에도 대부분의 benchmark에서 GPT-3를 능가해 LLM 연구에 대한 접근성 확대 가능성을 뒷받침한다.
- Inference를 고려한 scaling: 7B 모델은 1T tokens를 넘어선 뒤에도 계속 개선되어, 10B 모델을 200B tokens로 학습하라는 권고에 의문을 제기하고 scaling 결정에서 inference cost의 중요성을 강조한다.목표 성능 수준이 정해졌을 때는 더 큰 모델의 학습 비용이 더 저렴하더라도, 더 작은 모델을 더 오래 학습하는 편이 궁극적으로 serving 비용이 저렴할 수 있다.
- 기여: LLaMA-13B는 10× 더 작은 규모임에도 대부분의 benchmark에서 GPT-3를 능가하며, 모델군은 경쟁력 있는 성능을 보이는 7B부터 65B parameters까지 아우른다.모델들은 일반적으로 사용되는 양보다 더 많은 토큰으로 학습해 다양한 inference budget에서 강력한 성능을 달성하도록 설계되었다.
- 데이터와 개방성: LLaMA는 Chinchilla, PaLM, GPT-3와 달리 publicly available data만 사용하므로 모델을 open-sourcing하는 데 적합하다.기존 모델은 이용할 수 없거나 문서화되지 않은 데이터에 의존하는 경우가 많다. OPT, GPT-NeoX, BLOOM, GLM은 예외로 언급되지만, 어느 모델도 PaLM-62B 또는 Chinchilla와 경쟁력 있다고 기술되지는 않는다.
- 논문의 범위: 이 논문은 transformer architecture 수정과 학습 방법을 제시하고, standard benchmark에서 다른 LLM과 비교해 모델을 평가하며, 모델에 encode된 biases and toxicity를 조사한다.Responsible-AI 평가는 biases와 toxicity에 초점을 둔 최신 benchmark를 사용한다.
2 접근법
LLaMA는 Chinchilla에서 영감을 받은 scaling, 현대적 architecture 수정, efficiency 최적화를 활용해 다양한 공개 dataset으로 transformer model을 학습한다. 1.4T-token corpus에는 deduplication과 quality filtering을 적용하며, 65B model은 2048 A100 GPU에서 약 21일 동안 학습한다.
- Training data: CommonCrawl이 mixture의 67%를, C4가 15%를 차지하며, preprocessing 과정에서 deduplication, language identification, quality filtering을 적용한다.탐색적 실험에서 다양하게 전처리된 CommonCrawl dataset이 성능을 향상하는 것으로 나타났기 때문에 C4를 포함했다.
- Training data: Training corpus에는 대략 1.4T tokens가 포함되며, 대부분의 token은 한 번만 보고 Wikipedia와 Books에는 약 두 epoch를 적용한다.Dataset은 web text, code, encyclopedic, book, scientific, question-answering domain에 걸친 공개 source를 결합한다.
- Architecture: Model은 pre-normalization과 RMSNorm, SwiGLU activation, rotary positional embeddings를 사용하는 transformer architecture를 적용하며, absolute positional embeddings는 사용하지 않는다.이러한 변경은 training stability 또는 performance improvement와 관련되며 Vaswani et al. (2017), Zhang and Sennrich (2019), Shazeer (2020), Su et al. (2021)의 선행 연구를 따른다.
- Optimization: Training에는 β1 = 0.9, β2 = 0.95인 AdamW를 사용하고, maximum learning rate의 10%까지 cosine decay를 적용하며, weight decay는 0.1, gradient clipping은 1.0, warmup steps는 2,000으로 설정한다.Learning rate와 batch size는 model size에 따라 달라진다.
- Efficiency: Efficient causal attention, activation checkpointing, manual transformer backward function, model 및 sequence parallelism, GPU communication과 computation의 overlapping을 통해 training memory와 runtime을 줄인다.Attention implementation은 attention weight 저장과 causally masked key/query score 계산을 피한다.
- Efficiency: 380 tokens/sec/GPU를 통해 80GB RAM을 탑재한 2048 A100 GPU에서 65B-parameter model을 1.4T tokens에 대해 약 21일 동안 학습할 수 있다.모든 model은 batch size 4M tokens를 사용하며, 33B 및 65B model은 1.4T tokens로, 더 작은 model은 1.0T tokens로 학습한다.
3 주요 결과
20개의 zero-shot 및 few-shot benchmark 전반에서 LLaMA 모델은 많은 과제에서 훨씬 더 큰 general model의 성능을 능가하거나 맞먹지만, MMLU에서는 뒤처지고 benchmark별로 상이한 training dynamics를 보인다.
- 상식 추론: LLaMA-65B는 BoolQ를 제외한 보고된 모든 common-sense benchmark에서 Chinchilla-70B를 능가하며, BoolQ와 WinoGrande를 제외한 모든 benchmark에서 PaLM-540B를 앞선다. LLaMA-13B는 10× 더 작음에도 대부분의 benchmark에서 GPT-3를 능가한다.
- Closed-book 질의응답: LLaMA-65B는 closed-book zero-shot 설정의 NaturalQuestions와 TriviaQA에서 state-of-the-art 성능을 달성한다.두 benchmark 모두 supporting document에 접근하지 않고 exact-match 성능을 보고한다.
- 수학적 추론: LLaMA-65B는 mathematical data로 fine-tuning하지 않았음에도 GSM8k에서 Minerva-62B를 능가한다.
- Code generation: 유사한 parameter 수에서 LLaMA는 code generation의 general model을 능가한다. LLaMA-13B 이상 모델은 LaMDA-137B를 앞서며, LLaMA-65B는 PaLM-62B를 앞선다.이 비교에서는 HumanEval과 MBPP의 pass@1을 사용하며, 모델은 code에 특화해 fine-tuning되지 않았다.
- MMLU와 training dynamics: MMLU에서 LLaMA-65B는 평균적으로, 그리고 대부분의 domain에서 Chinchilla-70B와 PaLM-540B보다 몇 percentage point 뒤처진다.Training 중에는 SIQA에서 높은 variance가 나타나고 WinoGrande에서 correlation이 약한 경우를 제외하면 성능이 일반적으로 perplexity와 함께 향상된다.
4 지시문 미세조정
간단한 지시문 미세조정만으로도 LLaMA-65B의 MMLU 성능과 지시 따르기 능력이 빠르게 향상된다. 그 결과 생성된 LLaMA-I (65B)는 MMLU에서 68.9%를 달성하며, 접근법이 단순함에도 중간 규모의 기존 지시문 미세조정 모델을 능가한다.
- 4 지시문 미세조정: 매우 적은 양의 지시문 미세조정만으로도 LLaMA-65B의 MMLU 성능이 향상되고 지시를 따르는 능력도 추가로 개선된다.미세조정하지 않은 모델도 이미 기본적인 지시를 따르지만, 짧은 미세조정을 거치면 성능이 빠르게 향상된다.
- 4 지시문 미세조정: 이 연구는 Chung et al. (2022)의 프로토콜을 사용해 단 한 번의 지시문 미세조정 실험을 수행한다.지시문 미세조정은 이 논문의 주요 초점이 아니다.
- 4 지시문 미세조정: MMLU에서 68.9%: LLaMA-I (65B)는 OPT-IML과 Flan-PaLM을 포함한 중간 규모의 기존 지시문 미세조정 모델을 능가한다.비교에는 해당 논문에서 보고한 5-shot MMLU 결과를 사용한다.
5 편향, 유해성 및 허위정보
LLaMA-65B는 유해성과 사회적 편향을 보이며, 모델 크기가 커질수록 유해성이 증가하고 성별 관련 오류는 직업 고정관념에 의존함을 시사한다. TruthfulQA에서는 GPT-3보다 높은 점수를 기록하지만, 낮은 정확도는 여전히 빈번한 허위정보 환각을 시사하며, 이러한 benchmark만으로는 모델 위험을 완전히 포착할 수 없다.
- 평가의 한계: 표준 유해성 및 편향 평가는 유용한 위험 지표를 제공하지만, 이러한 모델과 관련된 위험을 완전히 특성화하기에는 불충분하다.저자들은 third-party PerspectiveAPI pipeline을 통제할 수 없다는 점도 지적하며, 이로 인해 이전 모델과의 비교가 복잡해진다.
- 유해성: 모델 크기가 커질수록 유해성이 증가하며, 특히 정중한 prompt에서 두드러진다. 다만 연구마다 서로 다른 sampling strategy, prompt 수, API 시점을 사용하므로 비교는 어렵다.LLaMA의 RealToxicityPrompts 점수는 기존 문헌과 유사하지만, 저자들은 이러한 관계가 하나의 model family 내부에서만 성립할 수 있다고 주의한다.
- 편향: LLaMA-65B는 평균 편향에서 GPT-3 및 OPT-175B보다 약간 우수하지만, 종교 편향은 OPT-175B보다 10% 높으며 CommonCrawl에서 비롯되었을 수 있다.CrowS-Pairs는 성별, 종교, 인종/피부색, 성적 지향, 연령, 국적, 장애, 외모, 사회경제적 지위를 평가한다.
- 편향: LLaMA-65B는 성별이 표시된 대명사보다 성중립적 WinoGender 대명사에서 더 나은 성능을 보이며, 이는 성별 편향과 직업별 다수 성별에 대한 의존을 나타낼 가능성이 높다.모델은 문장 내 증거를 사용하기보다 대명사가 해당 직업의 다수 성별과 충돌하는 “gotcha” 사례에서 더 많은 오류를 낸다.
- 허위정보: LLaMA는 TruthfulQA에서 진실성과 진실한 정보성 답변 모두에 대해 GPT-3보다 높은 점수를 기록하지만, 낮은 정답률은 거짓 주장을 환각할 가능성을 나타낸다.TruthfulQA는 38개 범주를 다루며 허위정보 생성 위험을 평가하도록 설계되었다.
6 탄소 발자국
저자들은 공통된 공식과 가정을 사용해 학습 에너지 사용량과 탄소 배출량을 추정했으며, 모델 개발에 약 2,638 MWh가 소비되고 1,015 tCO2eq가 배출되었다고 보고한다. 탄소 배출량은 데이터센터의 전력망에 따라 달라지므로 OPT 및 BLOOM과의 비교에는 동일한 위치 가정을 사용한다.
- 6 탄소 발자국: 탄소 배출량은 데이터센터의 전력망에 따라 달라지며, 각각의 전력망 배출 강도를 적용하면 BLOOM은 27 tCO2eq, OPT는 82 tCO2eq로 추정된다.BLOOM의 전력망은 0.057 kg CO2eq/KWh를 배출하는 반면, OPT의 전력망은 0.231 kg CO2eq/KWh를 배출한다.
- 6 탄소 발자국: 약 5개월 동안 2048 A100-80GB GPU를 사용해 모델을 개발하는 데 2,638 MWh의 에너지와 1,015 tCO2eq의 배출량이 발생한 것으로 추정된다.이 추정에서는 Power Usage Effectiveness (PUE)를 1.1로 가정한다.
- 6 탄소 발자국: 학습이 이미 완료되었으므로 모델을 공개하면 향후 배출량을 줄일 수 있으며, 일부 모델은 단일 GPU에서 실행할 수 있다.이는 학습과 관련된 추가 배출량을 완화할 수 있는 방안으로 제시된다.
7 관련 연구
언어 모델링은 n-gram 통계에서 neural network와 self-attention architecture로 발전했으며, transformer는 장거리 의존성 모델링을 개선했다. 또한 model과 dataset 규모를 확장하면 language-model 성능이 향상된다는 사실이 확립되면서 점점 더 큰 system이 개발되었다.
- Architecture: 언어 모델은 n-gram count와 smoothing method에서 feed-forward, recurrent, LSTM neural network로 발전했다 (Graves, 2013).
- Architecture: self-attention에 기반한 Transformer는 language modeling을 개선했으며, 특히 장거리 의존성 포착에 효과적이었다 (Vaswani et al., 2017; Dai et al., 2019).
- Scaling: Scaling에는 오랜 역사가 있다. model과 dataset은 trillion-token n-gram system에서 billion-parameter LSTM과 점점 더 큰 transformer로 확장되었다 (Jozefowicz et al., 2016).
- Scaling: BERT, GPT-2, Megatron-LM, T5, GPT-3, Gopher, Chinchilla, PaLM, OPT, GLM을 포함한 대규모 transformer model은 scaling이 지속되면서 다양한 NLP task에서 성능 향상을 달성했다.GPT-3 (Brown et al., 2020)는 175-billion-parameter model로 식별된다.
- Scaling: 연구들은 model과 dataset 규모를 system 성능과 연결하는 power-law relationship을 보고했으며, 여기에는 transformer language model을 대상으로 도출된 관계도 포함된다 (Hestness et al., 2017; Rosenfeld et al., 2019; Kaplan et al., 2020).
8 결론
이 논문은 공개적으로 공개된 LLaMA 모델을 제시하며, 오직 공개적으로 이용 가능한 training data만으로 더 큰 모델들과 강력한 비교 성능을 보이고 경쟁력 있는 state-of-the-art 성능을 달성한다.
- LLaMA 모델은 공개적으로 공개되었으며 state-of-the-art foundation model과 경쟁력 있는 성능을 보인다.
- LLaMA-13B는 GPT-3보다 10× 이상 작으면서도 더 뛰어난 성능을 보인다.
- LLaMA-65B는 Chinchilla-70B 및 PaLM-540B와 경쟁력 있는 성능을 보인다.
- 모델은 proprietary dataset이 아니라 오직 공개적으로 이용 가능한 data만 사용해 state-of-the-art 성능을 달성한다.
질문 응답
이 절에서는 open-domain question answering 설정, greedy decoding, 답변 정규화 후 exact-match scoring을 사용해 Natural Questions와 TriviaQA에서 LLaMA를 평가한다.
- 질문 응답: LLaMA는 Natural Questions와 TriviaQA에서 평가되며, 3,610개의 open-domain Natural Questions 테스트 질문과 필터링된 TriviaQA 개발 세트를 사용한다.TriviaQA 설정은 GPT-3 및 PaLM과 다르다. 두 모델은 필터링되지 않은 데이터셋의 사용할 수 없는 테스트 세트를 사용했다 [5].
- 질문 응답: 답변은 greedy decoding으로 생성하며, 평가 전에 첫 번째 줄바꿈, 마지막 마침표 또는 쉼표에서 잘라낸다.Exact match는 예측이 정규화된 참조 답변 중 하나와 일치할 때 정답으로 센다. 정규화 과정에서는 텍스트를 소문자로 변환하고 관사, 구두점 및 중복 공백을 제거한다.
- 질문 응답: Figure 3은 Natural Questions와 TriviaQA에 사용된 형식화된 one-shot 데이터셋 예시를 보여준다.이 그림은 각 데이터셋의 예시를 하나씩 보여준다.
B MMLU
이 절에서는 test set의 개별 domain에 대한 상세한 5-shot MMLU 결과를 보고한다.
- B MMLU: 표에는 test set의 각 domain에 대한 상세한 5-shot MMLU 결과가 제시되어 있다.
- B MMLU: 결과는 개별 MMLU domain별로 정리되어 있다.
- B MMLU: 보고된 평가는 MMLU test set을 사용한다.
C LLaMA-65B의 생성 결과
이 절에서는 instruction finetuning 없이 LLaMA-65B가 생성한 예시를 제시한다. 예시는 수학적 설명, 추천서 작성, 코드, 창작 또는 허구적 내용을 포함한다.
- LLaMA-65B의 생성 결과: LLaMA-65B는 instruction finetuning 없이 설명, 편지, 코드, 상상력이 가미된 글쓰기까지 다양한 개방형 콘텐츠를 생성한다.예시에는 Fibonacci 수열 설명, 추천서, 이차방정식 근 함수, 허구의 랩 리뷰, 인물 간 대화가 포함된다.
- LLaMA-65B의 생성 결과: 모델은 Fibonacci 수열 프롬프트를 역사적 맥락과 함께 이어 가며, Leonardo of Pisa를 언급하고 수열의 등장 배경과 초기의 급격한 증가를 설명한다.이어지는 내용은 이 수열이 Fibonacci의 수열임을 밝히고 Liber abaci와 이상화된 토끼 개체 수 문제를 언급한다.
- LLaMA-65B의 생성 결과: 모델은 허구의 용 사육사 직무를 위한 맞춤형 추천서를 작성하며, 기사의 용 퇴치 경험을 먹이 공급 업무와 연결한다.이 편지는 정보를 기억하고 처리하는 능력, 용의 약점을 이해하는 능력, 안전하고 선호되는 먹이를 아는 지식을 강조한다.
- LLaMA-65B의 생성 결과: 다른 생성 결과는 상상력이 가미된 형식을 보여 주며, 조작된 Yann LeCun 랩 리뷰와 Gauss와 Curie의 대화를 포함한다.랩 리뷰는 deep learning과 AI의 미래를 다루고, 대화는 두 과학자가 “geek”의 의미를 논의하는 모습을 묘사한다.
D LLaMA-I의 생성 결과
LLaMA-I는 Chung et al. (2022)의 protocol 및 instruction dataset으로 fine-tuning한 LLaMA-65B로, dialogue, coding, factual explanation, creative writing, responsible-use messaging을 아우르는 예시로 구성된다.
- LLaMA-I는 Chung et al. (2022)의 protocol 및 instruction dataset으로 fine-tuning한 LLaMA-65B다.
- 또한 태양과 명왕성의 대화, 한 알의 모래가 겪는 여정, Julius Caesar와 Napoleon의 고성이 오가는 말다툼 등 상상력 있는 dialogue와 이야기를 생성한다.
- 생성 결과에는 실용적인 programming assistance도 포함되며, JavaScript HTTP-request 예시와 HTML tags를 제거하고 function definitions를 추출하는 Python regular expressions를 제공한다.
- 예시는 체스 오프닝을 논의하고 Italian Game과 Scotch Game을 구분하는 동안 문맥을 유지하는 multi-turn conversational responses를 보여준다.모델은 White의 세 번째 수 이후 두 오프닝이 갈라짐을 식별하며, Italian Game에는 3. Bc4를, Scotch Game에는 3. Qf3을 제시한다.
- 한 예시는 responsible language-model use를 권고하는 지침을 작성하며, 기만적이거나 악의적인 applications와 예방 조치나 경고 없이 모델을 확산하는 행위에 주의를 촉구한다.