Source-linked AI summary

Improving Massively Multilingual Neural Machine Translation and Zero-Shot Translation

Biao Zhang, Philip Williams, Ivan Titov, Rico Sennrich

arXiv:2004.11867v1cs.CL

TL;DR

Massively multilingual NMT는 제한된 모델링 용량 때문에 bilingual model보다 성능이 낮은 경우가 많고, off-target 오류로 zero-shot 번역 성능도 낮다. 이 논문은 언어 인식형 심층 모델과 random online backtranslation으로 이러한 문제를 해결해 bilingual model과의 격차를 좁히고 zero-shot 성능을 ~10 BLEU 향상한다.

  • 문제

    Massively multilingual NMT는 모델링 용량 부족과 zero-shot 방향에서의 off-target 번역으로 어려움을 겪는다.

  • 방법

    이 논문은 심층 언어 인식형 NMT 구성 요소와, 학습에 포함되지 않은 언어 쌍을 위한 random online backtranslation을 결합한다.

  • 결과

    이 방법은 bilingual model과의 성능 격차를 좁히고, off-target 번역을 ∼50% 줄이며, zero-shot 성능을 ∼10 BLEU 향상한다.

  • 시사점 및 한계

    실험은 OPUS-100에서 multilingual NMT를 사용한 massively zero-shot translation의 실현 가능성을 입증한다.

  • 시사점 및 한계

    one-to-many 학습 및 테스트 세트는 문장 중복에 대해 적극적으로 필터링되지 않았으므로, 그 결과를 many-to-many 결과와 직접 비교할 수 없다.

Abstract

from arXiv · show

Massively multilingual models for neural machine translation (NMT) are theoretically attractive, but often underperform bilingual models and deliver poor zero-shot translations. In this paper, we explore ways to improve them. We argue that multilingual NMT requires stronger modeling capacity to support language pairs with varying typological characteristics, and overcome this bottleneck via language-specific components and deepening NMT architectures. We identify the off-target translation issue (i.e. translating into a wrong target language) as the major source of the inferior zero-shot performance, and propose random online backtranslation to enforce the translation of unseen training language pairs. Experiments on OPUS-100 (a novel multilingual dataset with 100 languages) show that our approach substantially narrows the performance gap with bilingual models in both one-to-many and many-to-many settings, and improves zero-shot performance by ~10 BLEU, approaching conventional pivot-based methods.

1 서론

초다언어 NMT는 배포, 전이, 저자원 및 zero-shot 측면의 이점을 제공하지만, 제한된 capacity로 다양한 방향을 지원해야 하므로 bilingual model보다 성능이 낮다. 이 논문은 language-specific component, 더 깊은 architecture, 그리고 off-target zero-shot translation을 겨냥하는 random online backtranslation (ROBT)으로 이 문제를 다룬다.

  • 1 서론: baseline은 독일어 대신 source sentence를 복사하거나 영어로 번역하여 off-target French→German zero-shot translation을 생성하는 경우가 많다.이는 parallel training data가 없는 language pair에서 multilingual model이 target-language 정보를 무시할 수 있다는 더 일반적인 문제를 보여준다.
  • 1 서론: 제안 architecture는 language-aware layer normalization과 encoder–decoder linear transformation을 사용하여 representation 제약을 완화하고 language-specific translation correspondence를 유도한다.이 논문은 bilingual method와의 성능 격차를 더 줄이기 위해 deep NMT architecture도 조사한다.
  • 1 서론: 실험에는 100개 언어를 포괄하는 55M-pair English-centric dataset인 OPUS-100이 사용되며, one-to-many 및 many-to-many translation setting에서 평가한다.이 dataset은 OPUS에서 수집되었으며 후속 연구를 촉진하기 위해 공개되었다.
  • 1 서론: multilingual model capacity를 늘리면 큰 폭의 개선이 나타나고 bilingual-model 격차가 줄어들며, 특히 low-resource translation에 가장 큰 이점이 있다.Language-specific modeling과 deep NMT architecture는 zero-shot translation을 소폭 개선하지만 off-target translation을 완화하지는 못한다.
  • 1 서론: ROBT는 off-target translation을 ∼50% 줄이고 zero-shot performance를 ∼10 BLEU 향상시켜 conventional pivot-based method에 근접하게 한다.ROBT finetuning은 수천 step 이내에 수렴한다.

2 관련 연구

기존 multilingual NMT 연구는 language-specific multitask architecture에서 shared component와 massively multilingual model로 발전해 왔으며, zero-shot 연구는 cross-lingual method와 artificial parallel data를 통해 잘못된 target language로 번역되는 오류를 다뤄 왔다. ROBT는 무작위로 선택한 intermediate language를 사용한 online backtranslation으로 후자의 연구 흐름에 속한다.

  • Multilingual NMT: Multilingual NMT는 encoder 또는 attention mechanism을 공유하는 multitask approach로 시작했지만, language-specific encoder 또는 decoder는 확장성을 제한했다.Dong et al. (2015)은 one-to-many translation에 shared encoder를 사용했고, Firat et al. (2016a)은 many-to-many translation에 shared attention을 사용했다. 이후 Lee et al. (2017)은 many-to-one translation에 shared encoder와 character-level input을 사용했다.
  • Zero-shot translation: Zero-shot multilingual NMT는 흔히 잘못된 target language로 번역하며, 이는 cross-lingual regularization과 artificial parallel-data approach의 동기가 되었다.이 논문은 이러한 실패를 ‘missing ingredient problem’ (Arivazhagan et al., 2019a)과 spurious correlation (Gu et al., 2019)에 연결하며, cross-lingual method와 backtranslation 또는 pivot-based translation을 두 가지 해결 범주로 구분한다.
  • Zero-shot translation: ROBT는 무작위로 선택한 intermediate language를 사용해 각 training step에서 online backtranslation을 수행함으로써 backtranslation 기반 zero-shot method를 확장한다.Gu et al. (2019)Lakew et al. (2019)과 달리 ROBT는 각 zero-shot direction마다 전체 training set을 decoding하지 않는다.
  • Massively multilingual translation: 이 연구는 multilingual 및 zero-shot performance를 모두 향상시키는 것을 목표로 하는 approach를 개발함으로써 massively multilingual translation 연구를 이어 간다.Aharoni et al. (2019)은 massively multilingual NMT의 실현 가능성을 입증하고 고무적인 결과를 보고했으며, Arivazhagan et al. (2019b)도 독립적으로 deep architecture를 사용해 model capacity를 높이는 방법을 검토했다.

3 다국어 NMT

다국어 NMT baseline은 각 source sentence 앞에 target-language token을 붙여 하나의 model이 여러 language로 번역할 수 있게 한다. 이 system은 residual connection과 layer normalization을 적용한 6-layer Transformer encoder-decoder backbone을 사용한다.

  • Multilingual NMT 접근법: 각 source sentence 앞에 target language를 지정하는 token을 붙여 하나의 multilingual NMT model을 학습하며, 예를 들어 영어에는 <2EN>을 사용한다 [Johnson et al., 2017].이렇게 수정된 multilingual dataset은 여러 target language로의 번역을 지원한다.
  • Transformer backbone: baseline은 뛰어난 multilingual performance 때문에 Transformer를 backbone으로 사용한다 [Vaswani et al., 2017; Lakew et al., 2018].encoder와 decoder는 각각 6개 layer로 구성되며, decoder layer에는 source representation에 대한 cross-attention이 추가로 포함된다.
  • Transformer backbone: 각 Transformer sublayer는 residual connection 다음에 layer normalization을 적용하며, 이는 model convergence를 가속한다 [He et al., 2015; Ba et al., 2016].encoder layer는 self-attention과 point-wise feedforward sublayer를 결합하고, decoder에는 cross-attention이 추가된다.

4 접근법

이 접근법은 더 깊은 architecture, language-aware component, 확장 가능한 random online backtranslation을 통해 multilingual NMT의 부족한 modeling capacity와 zero-shot off-target translation 문제를 다룬다.

  • 동기: 이 접근법은 multilingual NMT가 여러 언어로 확장될수록 심각해지는 부족한 modeling capacity와 off-target translation을 겨냥한다.저자들은 이를 massively multilingual NMT의 두 가지 핵심 단점으로 식별한다.
  • Deep Transformer: Deep Transformer는 depth-scaled initialization을 사용해 model depth를 늘림으로써 multilingual translation capacity를 향상한다.이 방법은 더 깊은 model이 더욱 추상적인 representation과 복잡한 dependency를 학습할 수 있다는 점에 동기를 둔다.
  • Language-aware Layer Normalization: Language-aware Layer Normalization은 target-language token을 조건으로 normalization을 수행해 언어 간 shared Gaussian-space constraint를 완화한다.이 formula는 모든 normalization layer에 적용되며, source-language information을 조건으로 사용하는 것은 future work로 남겨 둔다.
  • Language-aware Linear Transformation: Language-aware Linear Transformation은 encoder와 decoder 사이에 target-language-specific transformation을 삽입해 더욱 유연한 translation relationship을 표현한다.target language를 추가할 때는 weight matrix 하나만 필요하므로 expressivity와 scalability 사이의 균형을 이룬다.
  • Random Online Backtranslation: 9702개의 zero-shot direction에서는 각 pair에 대해 전체 training set을 decoding하는 것이 비현실적이므로, ROBT는 randomly sampled intermediate language를 사용한 online backtranslation을 수행한다.Batch-based greedy decoding은 computational cost를 줄이며, 처음에는 online translation이 완벽하지 않더라도 이 방법은 translation signal의 이점을 얻는다.

5 OPUS-100

OPUS-100은 100개 언어와 언어 쌍별 최대 1M개의 training pair를 포함하는 영어 중심 multilingual NMT dataset으로, many-to-many 및 zero-shot 평가를 지원하도록 설계되었다. 이 dataset은 domain balancing 없이 OPUS에서 sampling한 약 55M개의 sentence pair로 구성되며, validation, testing 및 15개의 비영어 zero-shot pairing을 위한 held-out data를 포함한다.

  • Dataset construction: 모든 training pair에 영어가 포함되므로, 영어가 없는 언어 쌍은 zero-shot translation 또는 영어를 통한 pivoting이 필요하다.이 영어 중심 설계는 Aharoni et al. (2019)을 따른다.
  • Dataset construction: OPUS-100은 영어를 포함한 100개 언어를 다루며, 각 언어 쌍에 대해 최대 1M개의 training pair를 포함한다.언어는 OPUS에서 이용 가능한 parallel data의 규모에 따라 선택되었다.
  • Data composition: 이 dataset은 movie subtitle부터 Bible documentation까지 다양한 OPUS corpus를 결합하며, domain을 선별하거나 균형화하지 않는다.각 언어 쌍의 data를 다운로드하고, 연결한 뒤 training, validation 및 test set 간 monolingual sentence overlap을 피하도록 filtering했다.
  • Dataset statistics: 약 55M개의 sentence pair가 OPUS-100을 구성한다. 99개 언어 쌍 중 44개는 1M개의 training pair를, 73개는 최소 100k개를, 95개는 최소 10k개를 보유한다.이 dataset은 언어 쌍별로 2000개의 validation pair와 2000개의 test pair도 포함한다.
  • Evaluation setup: Zero-shot 평가는 Arabic, Chinese, Dutch, French, German 및 Russian 간 15개 pairing 각각에 대해 2000개의 test sentence pair를 사용하며, OPUS-100에 이미 포함된 문장은 제외한다.이 pairing에는 영어가 포함되지 않으므로 비영어 언어 간 translation을 평가한다.

6 실험

OPUS-100 실험에서 language-aware components와 더 깊은 Transformer가 multilingual NMT를 크게 개선해 bilingual model과의 격차를 좁히는 것으로 나타났다. 이러한 효과는 특히 low-resource 및 many-to-many translation에서 두드러진다. Random online backtranslation은 off-target zero-shot translation 문제를 대부분 해결해 품질을 pivot-based methods에 가까운 수준으로 높이며, supervised translation 비용은 modest하게 증가시킨다.

  • One-to-many ablation: Language-aware components와 깊이는 capacity limitation을 해결한다. LALN과 LALT를 결합하면 3.37 BLEU94와 55.3% WR이 추가되고, 깊이를 늘리면 1.88 BLEU94가 추가된다.Deep Transformer는 유사한 parameter count에서 BLEU 기준으로 LALN+LALT보다 성능이 낮지만, language pair 전반에서 6.4% WR만큼 더 일관되게 개선된다.
  • One-to-many 결과: 전체 접근법은 29.60 BLEU94와 21.23 BLEU4를 달성해 92.6%의 task에서 multilingual baseline을 능가하고, base bilingual model보다 0.33 BLEU4 높다.이 접근법은 multilingual–bilingual 격차를 20.90에서 21.23 BLEU4로 좁히지만, 비슷한 깊이의 bilingual model은 여전히 1.52 BLEU4 더 우수하다.
  • Many-to-many 결과: Many-to-many translation에서는 English→X의 capacity 문제가 더 심각하지만, deep Transformer와 LALN 및 LALT를 결합하면 bilingual 격차가 -4.93에서 -0.45 BLEU4로 줄어든다.X→English에서는 multitask learning만으로도 bilingual NMT를 2.13 BLEU4 앞서며, capacity를 강화하면 그 격차가 4.80 BLEU4로 커진다.
  • Data scale과 direction: Language-aware modeling은 low-resource English→X pair에서 가장 큰 효과를 내며, high/medium-resource pair의 1.37/3.11 BLEU에 비해 5.82 BLEU를 추가한다. 반면 depth는 양방향을 비슷하게 개선한다.두 접근법을 통합하면 최상의 성능과 low-resource pair에 대한 positive transfer를 얻는다. Training data가 English를 target으로 불균형하게 포함하므로 English→X는 X→English보다 여전히 약하다.
  • Zero-shot translation: ROBT는 수천 회의 online-backtranslation step 이내에 수렴하지만, supervised English↔X translation에서는 약 0.50 BLEU94와 4% WR의 비용이 발생한다.더 큰 model capacity는 ROBT 전후의 zero-shot language accuracy와 BLEUzero도 개선하며, robustness가 높아졌음을 보여준다.

7 결론 및 향후 연구

이 논문은 model capacity를 높이고 random online backtranslation으로 off-target zero-shot translation을 교정해 massively multilingual NMT를 개선한다. 공개된 OPUS-100 dataset 실험에서 bilingual 및 pivot-based methods와의 격차가 줄었으며, 향후 연구에서는 더 가벼운 language-aware models와 더욱 강력한 zero-shot 개선을 목표로 한다.

  • 결론: Multilingual NMT는 model capacity가 부족하며, Transformer를 심화하고 language-aware neural models를 고안해 이를 해결한다.또한 이 논문은 zero-shot directions에서 발생하는 off-target translations를 식별하고, 이를 교정하기 위해 random online backtranslation을 제안한다.
  • 결론: 제안한 접근법은 translation performance를 크게 높여 OPUS-100에서 bilingual NMT models 및 pivot-based methods와의 격차를 줄인다.OPUS-100에는 100개 언어와 약 55M개의 sentence pairs가 포함된다.
  • 향후 연구: 향후 연구에서는 LALT의 lightweight alternatives를 개발하고, 더 큰 zero-shot 개선을 위해 ROBT의 upper bound를 넘어서는 generative modeling strategies를 탐구한다.인용된 generative modeling strategies에는 Zhang et al. (2016), Su et al. (2018), García et al. (2020), Zheng et al. (2020)가 포함된다.

A OPUS-100: OPUS 다국어 데이터셋

이 절에서는 OPUS-100을 영어 중심 다국어 데이터셋으로 소개하고 언어 범위와 문장 쌍 수를 요약한다.

  • A OPUS-100: OPUS 다국어 데이터셋: Table 8에는 OPUS-100에 포함된 비영어 언어와 각 언어의 문장 쌍 수가 제시된다.이 데이터셋은 영어 중심이다.

B 모델 설정

모델은 label smoothing, scheduled learning rate, dropout, token 기반 batching을 사용하는 Adam 계열 최적화를 적용한다. Multilingual training에서는 더 낮은 초기 learning rate를 사용하며, 더 깊은 모델에는 더 높은 dropout rate를 적용한다.

  • 최적화: Multilingual 모델은 학습을 안정화하기 위해 bilingual 모델의 1.0 대신 0.5의 초기 learning rate를 사용한다.학습에는 0.1의 label smoothing과 4k-step learning-rate warmup도 사용된다.
  • 정규화: Residual layer와 attention weight에 dropout을 적용하며, 6-layer Transformer에서는 0.1/0.1, 더 깊은 모델에서는 0.3/0.2를 사용한다.
  • 배칭: 학습 batch에는 sentence pair에서 묶은 약 50k target token이 포함되며, bilingual 모델은 예외다.
  • 데이터셋: 영어 중심 multilingual dataset에는 리투아니아어에 대해 1,000,000개의 training sentence pair, 2,000개의 validation sentence pair, 2,000개의 test sentence pair가 포함된다.
Loading 2004.11867v1…