Source-linked AI summary

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

arXiv:1810.04805v2cs.CL

TL;DR

Les modèles de langage unidirectionnels limitent les représentations contextuelles pour les tâches de NLP au niveau de la phrase et du token. BERT utilise un pré-entraînement par modèle de langage masqué avec un contexte bidirectionnel et atteint des performances de pointe sur onze tâches de NLP, notamment un score GLUE de 80.5 contre 72.8 pour OpenAI GPT.

  • Problème

    Les modèles de langage unidirectionnels restreignent les représentations pré-entraînées en empêchant l’utilisation simultanée du contexte gauche et droit, en particulier pour les tâches au niveau de la phrase et du token.

  • Méthode

    BERT pré-entraîne des représentations profondément bidirectionnelles à l’aide de la modélisation du langage masqué et de la prédiction de la phrase suivante, puis les affine pour des tâches en aval.

  • Résultats

    Score GLUE de 80.5 contre 72.8 pour OpenAI GPT, BERT atteignant des performances de pointe sur les onze tâches de NLP évaluées.

  • Conclusions et limites

    Le pré-entraînement profondément bidirectionnel généralise l’apprentissage par transfert à un large éventail de tâches de NLP tout en réduisant le besoin d’architectures fortement conçues pour chaque tâche.

  • Conclusions et limites

    Le pré-entraînement par modèle de langage masqué crée un décalage avec l’affinage, car le token [MASK] n’apparaît pas pendant l’affinage.

Abstract

from arXiv · show

We introduce a new language representation model called BERT, which stands for Bidirectional Encoder Representations from Transformers. Unlike recent language representation models, BERT is designed to pre-train deep bidirectional representations from unlabeled text by jointly conditioning on both left and right context in all layers. As a result, the pre-trained BERT model can be fine-tuned with just one additional output layer to create state-of-the-art models for a wide range of tasks, such as question answering and language inference, without substantial task-specific architecture modifications. BERT is conceptually simple and empirically powerful. It obtains new state-of-the-art results on eleven natural language processing tasks, including pushing the GLUE score to 80.5% (7.7% point absolute improvement), MultiNLI accuracy to 86.7% (4.6% absolute improvement), SQuAD v1.1 question answering Test F1 to 93.2 (1.5 point absolute improvement) and SQuAD v2.0 Test F1 to 83.1 (5.1 point absolute improvement).

1 Introduction

BERT remédie à l’unidirectionnalité du pré-entraînement standard des modèles de langage grâce à la modélisation du langage masqué, permettant d’obtenir des représentations profondément bidirectionnelles. Il réduit la dépendance aux architectures propres aux tâches et fait progresser l’état de l’art sur onze tâches de NLP.

  • Problème et contribution: BERT remédie à la limitation unidirectionnelle du pré-entraînement antérieur des modèles de langage, contrairement au modèle de gauche à droite d’OpenAI GPT et à la concaténation superficielle de modèles directionnels indépendants d’ELMo.
  • Contribution: BERT utilise la modélisation du langage masqué pour fusionner le contexte gauche et droit, permettant le pré-entraînement de représentations Transformer profondément bidirectionnelles.L’objectif masque aléatoirement des tokens d’entrée et prédit leur identité d’origine dans le vocabulaire à partir du contexte.
  • Méthode: BERT pré-entraîne conjointement les représentations de paires de textes avec une tâche de prédiction de la phrase suivante, en plus de la modélisation du langage masqué.
  • Contribution: BERT réduit le besoin d’architectures fortement conçues pour chaque tâche grâce à un modèle de représentations fondé sur le fine-tuning.L’article présente BERT comme atteignant l’état de l’art sur un vaste ensemble de tâches au niveau de la phrase et des tokens, tout en surpassant de nombreuses architectures propres aux tâches.
  • Résultats: BERT fait progresser l’état de l’art pour onze tâches de NLP.

2 Travaux connexes

Les travaux antérieurs sont passés des word embeddings préentraînés aux représentations de phrases et de paragraphes, aux caractéristiques contextuelles des tokens, puis aux encodeurs préentraînés ajustés pour des tâches aval. Ces approches ont établi l’intérêt du transfert à partir de données non annotées et supervisées, en s’appuyant sur diverses fonctions objectives de modélisation du langage, de débruitage et d’auto-encodage.

  • Représentations des mots et des phrases: Les word embeddings préentraînés, développés par des méthodes neuronales et non neuronales, sont devenus essentiels aux systèmes de TAL et ont amélioré les performances par rapport aux embeddings appris à partir de zéro.Parmi les approches représentatives figurent les fonctions objectives de modélisation du langage de gauche à droite et les premières méthodes qui préentraînaient uniquement les paramètres des word embeddings à partir de textes non annotés.
  • Représentations des mots et des phrases: Les représentations de phrases et de paragraphes ont étendu le préentraînement au-delà des mots au moyen du classement de la phrase suivante, de la génération de gauche à droite et de fonctions objectives d’auto-encodage débruitant.Ces méthodes visaient des représentations de granularité de plus en plus grossière, tout en préservant le transfert à partir de textes non annotés.
  • Représentations contextuelles: ELMo et son prédécesseur produisaient des caractéristiques contextuelles des tokens en concaténant des représentations de modèles de langage de gauche à droite et de droite à gauche, améliorant plusieurs benchmarks majeurs du TAL.Leurs embeddings contextuels étaient intégrés à des architectures existantes spécifiques aux tâches.
  • Encodeurs préentraînés: Les encodeurs préentraînés de phrases ou de documents ont ensuite produit des représentations contextuelles des tokens et ont été ajustés sur des tâches aval supervisées, réduisant le nombre de paramètres appris à partir de zéro.Ces modèles utilisaient des fonctions objectives de modélisation du langage ou d’auto-encodage ; OpenAI GPT a obtenu des résultats de pointe sur de nombreuses tâches de niveau phrase de GLUE.
  • Apprentissage par transfert: L’apprentissage par transfert s’est également révélé efficace à partir de jeux de données supervisés d’inférence en langage naturel et de traduction automatique, tandis que la vision par ordinateur a démontré l’intérêt de l’ajustement de modèles préentraînés sur ImageNet.Ces résultats ont élargi les éléments attestant la possibilité de transférer des connaissances issues de grands modèles préentraînés entre les tâches.

3 BERT

BERT est un encodeur Transformer bidirectionnel préentraîné par modélisation du langage masqué et prédiction de la phrase suivante, puis ajusté de bout en bout pour les tâches aval. Son architecture unifiée représente les phrases seules et les paires de phrases dans une séquence unique et nécessite un minimum de modifications spécifiques à la tâche.

  • Ajustement: L’ajustement initialise des modèles aval distincts avec les paramètres préentraînés de BERT et met à jour tous les paramètres de bout en bout, tout en remplaçant les entrées et les couches de sortie spécifiques à la tâche.Les représentations des tokens prennent en charge les tâches au niveau des tokens, tandis que la représentation [CLS] prend en charge la classification.
  • Architecture du modèle: BERT utilise un encodeur Transformer bidirectionnel multicouche, contrairement à l’auto-attention contrainte de GPT, et présente BERTBASE avec 110M paramètres et BERTLARGE avec 340M paramètres.BERTBASE possède L=12, H=768, A=12 ; BERTLARGE possède L=24, H=1024, A=16.
  • Représentations des entrées et sorties: BERT regroupe une ou deux phrases dans une séquence unique au moyen de tokens WordPiece, des marqueurs [CLS] et [SEP], d’embeddings de segment, d’embeddings de position et de représentations sommées des tokens.L’état [CLS] sert de représentation agrégée pour les tâches de classification.
  • Tâches de préentraînement: La modélisation du langage masqué masque aléatoirement 15% des tokens WordPiece et les prédit à partir du contexte bidirectionnel, tandis que la variation des remplacements réduit l’écart entre le préentraînement et l’ajustement.La procédure de masquage remédie à l’absence de tokens [MASK] lors de l’ajustement.
  • Tâches de préentraînement: La prédiction de la phrase suivante préentraîne BERT à modéliser les relations entre paires de phrases, en ciblant les relations nécessaires à des tâches telles que la réponse aux questions et l’inférence en langage naturel.La tâche est un objectif de classification binarisé généré à partir de corpus monolingues.
  • Données de préentraînement: Le préentraînement utilise BooksCorpus avec 800M mots et Wikipédia en anglais avec 2,500M mots, en conservant le texte au niveau du document de Wikipédia tout en excluant les listes, les tableaux et les en-têtes.Le corpus au niveau du document permet d’extraire de longues séquences cohérentes.

4 Expériences

Le fine-tuning de BERT apporte des gains substantiels sur GLUE, SQuAD 1.1, SQuAD 2.0 et SWAG. Les expériences utilisent des couches de sortie légères et spécifiques à chaque tâche, tout en conservant de solides performances sans modification architecturale importante.

  • GLUE: BERTBASE et BERTLARGE surpassent tous les systèmes sur chaque tâche de GLUE, avec une amélioration de la précision moyenne de 4.5% et 7.0%, respectivement, par rapport à l’état de l’art antérieur.Sur MNLI, BERT obtient une amélioration absolue de la précision de 4.6%.
  • SQuAD 1.1: +1.5 F1 avec ensembling et +1.3 F1 comme système unique par rapport au meilleur système du classement SQuAD 1.1, le modèle BERT seul dépassant son meilleur ensemble.Sans données de fine-tuning de TriviaQA, les performances ne diminuent que de 0.1–0.4 F1, tout en restant supérieures à celles des systèmes existants.
  • SWAG: BERTLARGE surpasse la baseline ESIM+ELMo de +27.1% et OpenAI GPT de 8.3% sur SWAG.Le fine-tuning de SWAG évalue chacune des quatre continuations de paires de phrases au moyen d’un vecteur spécifique à la tâche appliqué à la représentation [CLS].

5 Études d’ablation

Les ablations montrent que le pré-entraînement bidirectionnel profond de BERT, une capacité accrue du modèle et la stratégie de fine-tuning améliorent chacune nettement les performances en aval. Les modèles bidirectionnels surpassent les alternatives de gauche à droite, le passage à l’échelle reste bénéfique même pour les petites tâches, et l’utilisation fondée sur les features demeure compétitive avec le fine-tuning.

  • Ablations des tâches de pré-entraînement: La suppression de NSP dégrade significativement QNLI, MNLI et SQuAD 1.1, tandis que le pré-entraînement de gauche à droite donne de moins bons résultats que le masked language modeling pour toutes les tâches évaluées.Le modèle de gauche à droite affiche des baisses particulièrement importantes sur MRPC et SQuAD.
  • Ablations des tâches de pré-entraînement: L’ajout d’un BiLSTM améliore le modèle de gauche à droite sur SQuAD, mais celui-ci reste nettement moins performant que le pré-entraînement bidirectionnel et dégrade les performances sur GLUE.Le modèle de gauche à droite ne dispose pas d’informations du contexte droit dans les représentations cachées au niveau des tokens, ce qui motive l’ajout d’un BiLSTM.
  • Ablation de la taille du modèle: Les modèles BERT plus grands produisent des gains stricts en accuracy sur les quatre jeux de données GLUE sélectionnés, y compris MRPC malgré seulement 3,600 exemples d’entraînement annotés.Les résultats utilisent l’accuracy moyenne sur l’ensemble de développement, calculée sur cinq redémarrages aléatoires du fine-tuning ; les auteurs décrivent le passage à des tailles de modèles extrêmes comme une amélioration des très petites tâches lorsqu’elles sont suffisamment pré-entraînées.
  • Approche fondée sur les features: BERTLARGE obtient des résultats compétitifs sur la NER de CoNLL-2003, la concaténation des features des quatre couches supérieures n’étant qu’à 0.3 F1 du fine-tuning du modèle complet.Cela démontre l’efficacité de BERT à la fois dans les configurations de fine-tuning et fondées sur les features.

6 Conclusion

L’article soutient qu’un pré-entraînement non supervisé riche est essentiel aux systèmes de compréhension du langage et étend ses bénéfices des architectures profondément unidirectionnelles aux architectures profondément bidirectionnelles pour un large éventail de tâches de NLP.

  • 6 Conclusion: Le pré-entraînement non supervisé riche est devenu une composante essentielle de nombreux systèmes de compréhension du langage.
  • 6 Conclusion: Les architectures profondément unidirectionnelles permettent de tirer parti du transfert d’apprentissage, même pour les tâches de compréhension du langage à faibles ressources.
  • 6 Conclusion: BERT généralise ces résultats aux architectures profondément bidirectionnelles, permettant à un seul modèle pré-entraîné de traiter un large éventail de tâches de NLP.

Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding » · A Détails supplémentaires sur BERT

L’annexe est organisée en trois sections consacrées aux détails supplémentaires de l’implémentation de BERT, aux détails expérimentaux et aux études d’ablation. Ces dernières portent notamment sur l’effet du nombre d’étapes d’entraînement et sur différentes procédures de masquage.

  • Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding »: L’annexe est divisée en trois sections.
  • A Détails supplémentaires sur BERT: L’annexe A présente des détails supplémentaires sur l’implémentation de BERT.
  • Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding »: L’annexe B fournit des détails supplémentaires sur les expériences.
  • Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding »: L’annexe C présente des études d’ablation supplémentaires pour BERT.
  • Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding »: Les études d’ablation supplémentaires examinent l’effet du nombre d’étapes d’entraînement.
  • Annexe de « BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding »: Les études d’ablation supplémentaires comparent également différentes procédures de masquage.

A.1 Illustration des tâches de pré-entraînement

Cette section illustre la procédure de masked language modeling de BERT et la tâche de next sentence prediction. Le masked LM masque ou modifie certains tokens afin de produire des représentations contextuelles, converge légèrement plus lentement que l’entraînement de gauche à droite, mais les gains obtenus compensent largement le surcoût.

  • Masked LM et procédure de masquage: La procédure de masquage contraint l’encodeur Transformer à maintenir des représentations contextuelles distributionnelles pour chaque token d’entrée, car il ne peut pas identifier les positions à prédire ou remplacées aléatoirement.Seuls 1.5% de l’ensemble des tokens sont remplacés aléatoirement, ce qui, selon l’article, ne semble pas nuire aux capacités de compréhension du langage.
  • Masked LM et procédure de masquage: Le masked LM ne prédit que 15% des tokens par batch ; il peut donc nécessiter davantage d’étapes de pré-entraînement et converge légèrement plus lentement qu’un modèle de gauche à droite, mais ses améliorations empiriques compensent largement l’augmentation du coût d’entraînement.La comparaison porte sur un modèle de gauche à droite qui prédit chaque token.
  • Next Sentence Prediction: La next sentence prediction est illustrée par des exemples contenant des tokens [MASK] et des frontières de phrases [SEP].Le passage fourni introduit des exemples, mais ne précise ni la procédure d’échantillonnage ni l’objectif de la tâche.

A.2 Procédure de pré-entraînement … B Configuration expérimentale détaillée

Le pré-entraînement de BERT échantillonne des segments appariés pour le masked language modeling et la next sentence prediction, selon un ordonnancement progressif de la longueur des séquences et une optimisation à grande échelle. Le fine-tuning adapte BERT aux tâches au niveau de la séquence et des tokens avec une seule couche de sortie supplémentaire, tandis que les comparaisons avec ELMo et GPT mettent en évidence la bidirectionnalité, les tâches de pré-entraînement et l’adaptation spécifique à la tâche.

  • A.2 Procédure de pré-entraînement: BERT échantillonne des segments appariés avec des embeddings sentence-A/B, le second segment étant le véritable successeur dans 50% des cas et une phrase aléatoire dans 50% des cas pour la next sentence prediction.Les segments appariés sont échantillonnés de sorte que leur longueur combinée ne dépasse pas la limite de séquence du modèle.
  • A.2 Procédure de pré-entraînement: Le pré-entraînement s’effectue sur 1,000,000 steps avec des batches de 256 séquences, soit 128,000 tokens per batch, pendant environ 40 epochs sur un corpus de 3.3-billion words.L’optimisation utilise Adam avec un learning rate de 1e-4, un warmup de 10,000 steps, une décroissance linéaire, un dropout de 0.1, des activations GELU et une loss combinant les likelihoods du masked-LM et de la next-sentence prediction.
  • B Configuration expérimentale détaillée: 90% des steps de pré-entraînement utilisent une longueur de séquence de 128 et les 10% restants une longueur de 512, ce qui réduit le coût quadratique de l’attention tout en apprenant les positional embeddings pour les longues séquences.Les séquences plus longues sont disproportionnellement coûteuses, car l’attention évolue quadratiquement avec la longueur de la séquence.
  • A.3 Procédure de fine-tuning: Le fine-tuning conserve généralement les hyperparamètres du pré-entraînement, à l’exception de la batch size, du learning rate et du nombre d’epochs, avec un dropout fixé à 0.1.Selon les tâches, les plages utiles sont une batch size de 16 ou 32, un learning rate Adam de 5e-5, 3e-5 ou 2e-5, et 2, 3 ou 4 epochs.
  • A.3 Procédure de fine-tuning: Le fine-tuning est moins sensible aux hyperparamètres sur les grands jeux de données comptant 100k+ labeled examples, de sorte qu’une recherche exhaustive sur l’ensemble de développement est pratique, car le fine-tuning est généralement rapide.La recherche recommandée couvre les batch sizes, learning rates et nombres d’epochs indiqués.
  • A.4 Comparaison de BERT, ELMo ,and OpenAI GPT: Comparé à l’approche feature-based d’ELMo et à l’approche de fine-tuning de GPT, BERT est également une méthode de fine-tuning dont le pré-entraînement incorpore la structure des phrases et des learning rates spécifiques à la tâche.BERT utilise BooksCorpus et Wikipedia, apprend [SEP], [CLS] et les embeddings sentence-A/B pendant le pré-entraînement, et sélectionne le learning rate du fine-tuning sur les données de développement.
  • A.4 Comparaison de BERT, ELMo ,and OpenAI GPT: BERT utilise des représentations bidirectionnelles et deux tâches de pré-entraînement, que l’article identifie comme les principales sources d’amélioration par rapport au language modeling de gauche à droite de GPT.Des ablations servent à isoler les effets de la bidirectionnalité et des deux tâches de pré-entraînement.
  • A.5 Illustrations du fine-tuning sur différentes tâches: Les modèles spécifiques aux tâches ajoutent une couche de sortie à BERT, prenant en charge les tâches au niveau de la séquence et des tokens, tout en n’apprenant from scratch qu’un nombre minimal de paramètres.La représentation [CLS] fournit la sortie de classification dans la configuration illustrée au niveau de la séquence.

B.1 Descriptions détaillées des expériences avec le benchmark GLUE. · C Études d’ablation supplémentaires

Les expériences GLUE couvrent diverses tâches d’entailment, d’équivalence, de sentiment, d’acceptabilité, de similarité et de paraphrase, tout en excluant WNLI et en ne rapportant que les résultats de fine-tuning mono-tâche. Les passages fournis ne décrivent pas la section fusionnée consacrée aux études d’ablation.

  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: Les résultats GLUE rapportés proviennent du leaderboard GLUE et d’un article de blog d’OpenAI consacré à l’apprentissage non supervisé du langage.Le passage présente ces sources avant d’énumérer les descriptions des jeux de données, résumées d’après Wang et al. (2018a).
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: Le benchmark inclut MNLI, une tâche de classification d’entailment à trois classes prédisant l’entailment, la contradiction ou la neutralité à partir de paires de phrases.MNLI est décrit comme un jeu de données de grande ampleur construit à partir de contributions participatives.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: QQP et MRPC évaluent l’équivalence sémantique de paires de phrases, à partir de questions de Quora pour QQP et de phrases issues de médias d’information en ligne pour MRPC.QQP est une classification binaire, tandis que MRPC utilise des annotations humaines de l’équivalence.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: QNLI transforme SQuAD en une classification binaire visant à déterminer si une paire question–phrase contient la bonne réponse.Les exemples négatifs proviennent du même paragraphe, mais ne contiennent pas la réponse.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: SST-2, CoLA et STS-B mesurent respectivement le sentiment dans des critiques de films, l’acceptabilité de phrases anglaises et la similarité sémantique, notée de 1 à 5.Ces tâches utilisent des phrases seules ou des paires de phrases provenant de critiques, d’exemples linguistiques, de titres de presse et d’autres sources.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: RTE est une tâche binaire d’entailment similaire à MNLI, mais disposant de beaucoup moins de données d’entraînement.Le passage identifie RTE comme Recognizing Textual Entailment.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: WNLI a été exclu en raison de problèmes connus dans sa construction, et les systèmes soumis ont obtenu des performances inférieures à la baseline de 65.1 fondée sur la classe majoritaire ; la soumission prédisait toujours la classe majoritaire.Cette exclusion visait à garantir une comparaison équitable avec OpenAI GPT.
  • B.1 Descriptions détaillées des expériences avec le benchmark GLUE.: Seuls les résultats du fine-tuning mono-tâche sont rapportés, bien que le fine-tuning multitâche puisse améliorer les performances, notamment avec des gains substantiels observés sur RTE grâce à l’entraînement sur MNLI.Le passage indique que les améliorations liées au multitâche pourraient potentiellement accroître davantage les performances.

C.1 Effet du nombre d’étapes d’entraînement

BERT bénéficie substantiellement d’un pré-entraînement prolongé : BERTBASE gagne presque 1.0 % de précision sur MNLI à 1M contre 500k étapes. Bien que MLM converge légèrement plus lentement que LTR, il dépasse LTR en précision absolue presque immédiatement.

  • C.1 Effet du nombre d’étapes d’entraînement: BERTBASE obtient presque 1.0 % de précision supplémentaire sur MNLI à 1M contre 500k étapes de pré-entraînement.La Figure 5 présente la précision sur le jeu Dev de MNLI après l’affinage de checkpoints pré-entraînés pendant k étapes.
  • C.1 Effet du nombre d’étapes d’entraînement: MLM converge légèrement plus lentement que LTR, mais commence presque immédiatement à le dépasser en précision absolue.La comparaison tient compte du fait que MLM ne prédit que 15 % des mots dans chaque batch, tandis que LTR prédit chaque mot.

C.2 Ablation pour différentes procédures de masquage

L’ablation évalue des stratégies de masquage visant à réduire le décalage entre le pré-entraînement et le fine-tuning, en rapportant les résultats Dev de MNLI et de NER pour les approches par fine-tuning et fondées sur les features. Le fine-tuning est robuste quelle que soit la stratégie, mais le NER fondé sur les features donne de mauvais résultats avec seulement MASK, tandis que seulement RND est moins performant que la stratégie mixte de BERT.

  • C.2 Ablation pour différentes procédures de masquage: L’ablation du masquage compare la stratégie MLM mixte à des procédures alternatives afin de réduire le décalage, car [MASK] n’apparaît jamais pendant le fine-tuning.Le NER comprend une évaluation par fine-tuning et une évaluation fondée sur les features, le décalage devant être amplifié pour les représentations fondées sur les features, qui ne peuvent pas s’ajuster pendant le fine-tuning.
  • C.2 Ablation pour différentes procédures de masquage: Le fine-tuning est robuste face aux différentes stratégies de masquage, tandis que le NER fondé sur les features pâtit de l’utilisation de MASK seul et que RND seul est moins performant que la stratégie mixte de BERT.La comparaison utilise les résultats Dev de MNLI et de NER présentés dans la Table 8 ; la représentation du NER fondée sur les features concatène les quatre dernières couches de BERT.
  • C.2 Ablation pour différentes procédures de masquage: MASK remplace la cible par [MASK], SAME la conserve inchangée et RND la remplace par un autre token aléatoire pendant le pré-entraînement MLM.La stratégie mixte de BERT utilise des probabilités de 80 % pour MASK, 10 % pour SAME et 10 % pour RND.
Loading 1810.04805v2…