Source-linked AI summary

BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension

Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Ves Stoyanov, Luke Zettlemoyer

arXiv:1910.13461v1cs.CLcs.LGstat.ML

TL;DR

기존 pretraining 방법은 특정 최종 과제를 대상으로 하는 경우가 많아 과제 전반에 적용하기 어렵다. BART는 denoising sequence-to-sequence pretraining으로 이를 해결하며, 여러 generation 과제에서 state-of-the-art 성능을 달성하는 동시에 discriminative 과제에서는 RoBERTa와 유사한 성능을 보인다.

  • 문제

    기존 pretraining 방법은 대체로 특정 최종 과제를 대상으로 하므로 더 넓은 범위의 과제에 적용하기 어렵다.

  • 방법

    BART는 bidirectional encoder와 autoregressive decoder를 사용해 손상된 텍스트에서 원문을 복원하는 sequence-to-sequence denoising autoencoder를 pretrain한다.

  • 결과

    BART는 discriminative 과제에서 RoBERTa와 유사한 성능을 보이고, 6 ROUGE 향상을 포함해 여러 text-generation 과제에서 새로운 state-of-the-art 성능을 달성한다.

  • 시사점 및 한계

    BART는 폭넓게 적용 가능한 pretraining 접근법으로, text generation에 특히 효과적이며 comprehension 과제에서도 우수한 성능을 보인다.

  • 시사점 및 한계

    BART는 ELI5처럼 출력이 입력에 의해 느슨하게 제약되는 경우에는 덜 효과적이며, 이 경우 pure language model이 가장 우수한 성능을 보인다.

Abstract

from arXiv · show

We present BART, a denoising autoencoder for pretraining sequence-to-sequence models. BART is trained by (1) corrupting text with an arbitrary noising function, and (2) learning a model to reconstruct the original text. It uses a standard Tranformer-based neural machine translation architecture which, despite its simplicity, can be seen as generalizing BERT (due to the bidirectional encoder), GPT (with the left-to-right decoder), and many other more recent pretraining schemes. We evaluate a number of noising approaches, finding the best performance by both randomly shuffling the order of the original sentences and using a novel in-filling scheme, where spans of text are replaced with a single mask token. BART is particularly effective when fine tuned for text generation but also works well for comprehension tasks. It matches the performance of RoBERTa with comparable training resources on GLUE and SQuAD, achieves new state-of-the-art results on a range of abstractive dialogue, question answering, and summarization tasks, with gains of up to 6 ROUGE. BART also provides a 1.1 BLEU increase over a back-translation system for machine translation, with only target language pretraining. We also report ablation experiments that replicate other pretraining schemes within the BART framework, to better measure which factors most influence end-task performance.

1 서론

BART는 task-specific pretraining 방법의 제한된 적용 범위를 해결하는 유연한 sequence-to-sequence denoising autoencoder다. generation, comprehension, machine translation 과제 전반에서 높은 성능을 보이며, 다른 training objective와의 통제된 비교도 지원한다.

  • 동기와 분석: BART는 masked-language-model 변형의 제한된 적용 범위를 겨냥한다. 이러한 변형은 대체로 span prediction이나 generation 같은 특정 최종 과제에 특화된다.ablation analysis에서는 data와 optimization 요인을 통제한 상태로 다른 training objective를 재현했으며, 검토한 과제 전반에서 일관되게 높은 성능을 보였다.
  • 모델과 학습: BART는 임의의 noising function으로 텍스트를 손상한 뒤 원래 텍스트를 복원하는 방식으로 sequence-to-sequence denoising autoencoder를 pretrain한다.표준 Transformer-based neural machine translation architecture에 bidirectional encoding과 autoregressive decoding을 결합하며, 폭넓은 최종 과제에 적용된다.
  • Noise functions: 가장 우수한 noising 성능은 문장 순서를 무작위로 섞는 방식과 span infilling을 결합할 때 나타난다. 이 방식은 zero-length span을 포함한 임의 길이의 span을 하나의 mask token으로 대체한다.이 유연한 corruption scheme은 기존의 word masking과 next-sentence prediction 접근법을 일반화한다.
  • 실증 결과: BART는 GLUE와 SQuAD에서 RoBERTa와 동등한 성능을 보이며, abstractive dialogue, question answering, summarization에서 state-of-the-art 결과를 달성한다. 여기에는 XSum에서의 6 ROUGE 향상이 포함된다.이 결과는 comparable training resources를 사용했으며, 높은 comprehension 성능과 함께 text generation에서 특히 효과적임을 보여준다.
  • Machine translation: BART는 target-side pretrained language model을 사용해 WMT Romanian-English에서 강력한 back-translation baseline보다 1.1 BLEU 향상된 성능을 보인다.이 방법은 BART 위에 추가 Transformer layer를 쌓아 foreign language를 noised English로 번역한 뒤, 이를 BART를 통해 전파한다.

2 모델

BART는 양방향 encoder와 left-to-right decoder를 사용해 손상된 입력에서 원문 문서를 복원하는 sequence-to-sequence denoising autoencoder다. 유연한 corruption framework는 임의의 문서 변환을 지원하며, reconstruction cross-entropy로 학습된다.

  • 모델: BART는 양방향 encoder, left-to-right autoregressive decoder, negative-log-likelihood training objective를 사용해 손상된 입력에서 원문 문서를 복원한다.reconstruction loss는 decoder 출력과 원문 문서 사이의 cross-entropy다.
  • Architecture: Architecture는 표준 sequence-to-sequence Transformer를 따르며, GeLUs, N(0, 0.02) initialization, base에서 6 encoder/decoder layers, large에서 12 layers를 사용한다.Transformer architecture는 Vaswani et al. (2017)에서 변형되었으며, GeLUs는 GPT를 따르고 parameter initialization은 N(0, 0.02)에서 가져온다.
  • Architecture: BERT와 비교해 BART는 decoder cross-attention을 추가하고, BERT의 pre-word-prediction feed-forward network를 생략하며, 동일한 크기에서 대략 10% 더 많은 parameters를 갖는다.각 decoder layer는 encoder의 최종 hidden layer에 cross-attention을 수행한다.
  • 모델: BART는 reconstruction 전에 임의의 문서 손상을 적용하며, 기존에 제안된 변환과 새롭게 제안된 변환을 포함하고 이들을 조합할 수 있다.모든 source information이 제거되면 BART는 language model과 동등해진다.
  • Noising transformations: Text infilling은 샘플링된 span을 단일 [MASK] token으로 대체하며, span 길이는 Poisson distribution (λ = 3)에서 추출한다. 그 밖에 시험한 corruption에는 token masking, deletion, sentence permutation, document rotation이 포함된다.Token masking은 무작위 token을 대체하고, deletion은 token을 제거하며, sentence permutation은 문장 순서를 섞고, rotation은 무작위로 선택된 token에서 문서를 시작한다.

3 BART Fine-tuning

BART는 encoder–decoder representation을 task-specific하게 활용해 downstream sequence, token, generation task를 지원한다. Machine translation에서는 새로운 source encoder를 추가해 학습함으로써, pretrained model 전체를 English decoder로 사용할 수 있다.

  • Sequence classification: BART는 sequence classification을 위해 최종 decoder token의 hidden state를 사용하며, 이를 통해 전체 입력에서 얻은 decoder state를 참조할 수 있다.입력을 encoder와 decoder 모두에 넣은 뒤, 새로운 multi-class linear classifier를 연결한다.
  • Token classification: Token classification에서는 BART가 decoder의 top hidden state를 word representation으로 사용해 SQuAD answer endpoint와 같은 token을 분류한다.전체 document를 encoder와 decoder 모두에 넣는다.
  • Sequence generation: BART의 autoregressive decoder는 abstractive question answering과 summarization 같은 sequence generation task를 직접 지원한다.encoder는 입력 sequence를 받고 decoder는 autoregressively output을 생성한다. 이러한 task는 입력 정보를 조작하고 복사하므로 denoising pretraining과 부합한다.
  • Machine translation: English로 translation할 때 BART의 encoder와 decoder는 pretrained decoder로 작동하며, bitext로 학습한 새 source encoder를 사용한다.source encoder는 foreign word를 BART가 English로 denoise할 수 있는 입력으로 매핑하며, 별도의 vocabulary를 사용할 수도 있다.
  • Machine translation: Source encoder는 two stages로 학습된다. 먼저 BART parameter 대부분을 frozen한 상태로 학습한 뒤, 짧은 시간 동안 model parameter 전체를 update한다.두 stage 모두 BART output에서 계산한 cross-entropy loss를 backpropagate한다.

4 사전 학습 목표 비교

BART는 데이터, 모델 크기, 학습 및 fine-tuning 조건을 대체로 통제한 상태에서 여러 사전 학습 목표를 비교한다. 결과는 목표의 효과가 downstream task에 크게 좌우되며, ELI5를 제외하면 text-infilling BART가 가장 일관되게 강한 성능을 보인다는 것을 보여준다.

  • 전체 결과: 사전 학습 효과는 task에 따라 크게 달라진다: 단순한 language model은 ELI5에서 가장 우수하지만 SQuAD에서는 가장 낮은 성능을 보이는 반면, BART text-infilling model은 ELI5를 제외한 여러 task에서 강한 성능을 보인다.비교에는 1M steps 동안 학습한 비슷한 크기의 model을 사용했으며, 하단 블록의 system들은 data, code, fine-tuning 절차를 공유한다.
  • 목표 동향: Token masking 또는 deletion은 성공적인 목표의 핵심인 반면, document rotation과 sentence permutation은 단독으로 사용할 때 성능이 낮다. 또한 generation task에서는 deletion이 masking보다 우수하다.Masked 및 permuted language model도 generation에서 성능이 낮으며, 둘 다 pre-training 중 left-to-right autoregressive language modeling을 포함하지 않는다.
  • Task별 결과: Bidirectional encoder는 SQuAD에 결정적이다: 순수한 left-to-right decoder는 성능이 낮지만, BART는 bidirectional layer를 절반만 사용하고도 유사한 성능을 달성한다.이 task의 classification decision에서는 미래 문맥이 중요하다.
  • 한계: Permuted language model은 XLNet (Yang et al., 2019)보다 성능이 낮으며, 이는 부분적으로 relative-position embedding과 segment-level recurrence를 생략하기 때문이다.이는 pre-training objective만이 성능에 영향을 미치는 유일한 요인이 아님을 보여준다.
  • Task별 결과: Pure language model은 ELI5에서 가장 우수하며, 이는 output이 input에 의해 느슨하게만 제약될 때 BART의 효과가 낮아짐을 시사한다.ELI5는 다른 task보다 perplexity가 훨씬 높은 outlier이며, 다른 model이 BART보다 우수한 유일한 generation task다.

5 대규모 Pre-training 실험

대규모 BART는 판별 과제에서 RoBERTa와 대등한 성능을 보이는 동시에, 요약, 대화, 추상적 질문 답변을 비롯한 생성 과제에서 강력한 결과를 달성하며 기존 연구를 개선한다. 이 모델은 text infilling과 sentence permutation을 사용해 RoBERTa 규모로 pre-training된다.

  • Pre-training 설정: 대규모 성능을 검증하기 위해 BART는 RoBERTa 규모로 학습되며, 동일한 160Gb pre-training corpus를 사용하고 학습 단계의 마지막 10% 동안 dropout을 비활성화한다.corpus에는 뉴스, 도서, 이야기, 웹 텍스트가 포함되며, dropout 변경은 CNN/DailyMail 과제에 맞추는 데 도움을 주기 위한 것이다.
  • Pre-training 설정: large BART 모델은 encoder와 decoder 각각 12개 layer, hidden size 1024, batch size 8000, 500000 training steps를 사용한다.GPT-2 byte-pair encoding을 사용하고, token의 30%를 mask하며, 모든 sentence를 permute하고, text infilling과 sentence permutation을 결합한다.
  • 요약: BART는 두 요약 dataset과 보고된 모든 metric에서 CNN/DailyMail 및 XSum의 기존 연구를 능가한다.XSum에서 BART는 모든 ROUGE metric에서 가장 우수한 기존 BERT 기반 시스템보다 약 6.0 point 높은 성능을 보이며, CNN/DailyMail에서는 강력한 extractive baseline이 존재함에도 기존 연구를 앞선다.
  • 판별 과제: BART는 SQuAD와 GLUE에서 RoBERTa와 유사한 성능을 보이며, 과제별 차이는 작다. 이는 생성 성능 향상이 classification 성능을 희생하지 않음을 보여준다.비교에는 동일한 pre-training 자원이 사용되지만 objective는 다르며, Table 2에서는 BART와 XLNet도 비교한다.
  • 대화 및 추상적 QA: BART는 CONVAI2 response generation에서 기존 연구를 능가하며, 기존 ELI5 시스템 중 최고 성능보다 1.2 ROUGE-L만큼 높다.CONVAI2는 대화 맥락과 텍스트로 명시된 페르소나를 조건으로 한 응답을 평가하는 반면, ELI5는 장문의 자유 형식 답변을 평가하며 질문이 답을 약하게 지정하기 때문에 여전히 어렵다.

6 정성적 분석

BART는 기존 최고 성능보다 요약 평가 지표를 최대 6포인트 향상시키며, 정성적 예시에서는 문서 근거와 배경 지식을 결합한 유창하고 매우 추상적인, 대체로 사실적으로 정확한 요약을 생성한다. 이러한 샘플은 BART가 언어 이해와 생성을 강력하게 결합하는 방법을 학습한다는 점을 보여준다.

  • 6 정성적 분석: BART는 기존 최고 성능보다 요약 평가 지표를 최대 6포인트 향상시킨다.정성적 분석은 생성된 요약을 검토함으로써 이러한 자동 평가 결과를 보완한다.
  • 6 정성적 분석: BART는 유창하고 문법적으로 올바른 영어를 생성하며, 입력에서 복사한 구절이 거의 없어 매우 추상적이다.Table 7은 각 기사의 첫 문장을 제거해 쉬운 추출적 요약을 방지한, 사전 pretraining-corpus WikiNews 기사에서 생성된 예시를 제시한다.
  • 6 정성적 분석: 출력은 대체로 사실적으로 정확하며 문서 전반의 뒷받침 근거와 배경 지식을 통합한다.예시로는 이름을 정확히 완성하고 PG&E가 California에서 운영된다고 추론하는 경우가 있다.
  • 6 정성적 분석: 이 샘플은 BART pretraining이 자연어 이해와 생성을 강력하게 결합하는 방법을 학습한다는 점을 보여준다.

7 관련 연구

기존 pretraining 방법은 context modeling, prediction structure, generation 또는 discrimination에 대한 적합성에서 차이를 보인다. BART는 bidirectional context에 대한 autoregressive decoding을 통해 이러한 차이를 다루며, BERT, UniLM, MASS, XL-Net 및 multilingual translation pretraining 접근법과 대비된다.

  • Language-model pretraining: 초기의 GPT 와 ELMo (Peters et al., 2018)는 서로 분리된 방향별 표현을 사용한 반면, 매우 큰 language model은 unsupervised multitask behavior를 가능하게 한다.GPT model은 왼쪽 context만 사용하고, ELMo는 왼쪽만 본 표현과 오른쪽만 본 표현을 결합하지만 두 표현 사이의 pretraining 상호작용은 학습하지 않는다.
  • Language-model pretraining: BERT (Devlin et al., 2019)는 masked language modelling을 통해 좌우 context 상호작용을 학습하지만, non-autoregressive predictions 때문에 generation에는 효과가 떨어진다.더 긴 training (Liu et al., 2019), parameter sharing (Lan et al., 2019), span masking (Joshi et al., 2019)이 BERT를 개선한다.
  • Comparison with related sequence-to-sequence models: BART는 UniLM (Dong et al., 2019)처럼 generative 및 discriminative task를 지원하며, autoregressive decoder와 손상되지 않은 decoder context가 generation에 더 잘 부합한다.UniLM의 prediction은 conditionally independent인 반면, BART는 손상되지 않은 context에서 decoder를 left-to-right로 학습한다.
  • Pretraining for machine translation: Machine-translation pretraining은 source와 target language를 함께 pretraining할 때 가장 큰 이점을 얻었지만, 이를 위해서는 관심 있는 모든 language에 대해 pretraining해야 한다.다른 연구는 pretrained representation을 사용해 encoder를 개선하지만, decoder의 성능 향상은 더 제한적이다 (Edunov et al., 2019).

8 결론

BART는 손상된 문서를 원문으로 매핑하도록 프리트레이닝되어, 판별 과제에서는 RoBERTa와 비슷한 성능을 보이고 여러 텍스트 생성 과제에서 최고 수준의 결과를 달성한다.

  • 8 결론: BART는 프리트레이닝 중 손상된 문서를 원래 형태로 매핑하는 방법을 학습한다.저자들은 특정 최종 과제에 맞춘 손상 방법을 개발하는 것을 향후 연구 과제로 제시한다.
  • 8 결론: BART는 판별 과제에서 RoBERTa와 비슷한 성능을 달성한다.
  • 8 결론: BART는 여러 텍스트 생성 과제에서 새로운 최고 수준의 결과를 달성한다.
  • 8 결론: 향후 연구에서는 특정 최종 과제에 맞춘 문서 손상 방법을 탐구해야 한다.
Loading 1910.13461v1…