Source-linked AI summary
PromptBERT: Improving BERT Sentence Embeddings with Prompts
Ting Jiang, Jian Jiao, Shaohan Huang, Zihan Zhang, Deqing Wang, Fuzhen Zhuang, Furu Wei, Haizhen Huang, Denvy Deng, Qi Zhang
TL;DR
Original BERT는 static token bias와 비효율적인 layer 활용으로 표현력이 제한되어 문장 임베딩 성능이 낮다. PromptBERT는 prompt 기반 표현과 template-denoising contrastive learning을 사용해 다양한 데이터셋과 설정에서 문장 임베딩 성능을 크게 향상한다.
문제
Original BERT는 기존 표현이 static token embedding bias와 비효율적인 BERT layer 활용의 영향을 받아 문장 임베딩 성능이 낮다.
방법
PromptBERT는 문장 표현을 위해 prompt 기반 template을 사용하고, 비지도 문장 임베딩을 개선하기 위해 template-denoising contrastive learning을 적용한다.
결과
Prompt 기반 방법은 모든 데이터셋에서 Original BERT를 개선하며, pooling 방법보다 Spearman 상관계수를 10% 초과 높이고, 수작업 template을 사용했을 때 BERT-flow와 BERT-whitening을 능가한다.
시사점 및 한계
Prompt 기반 문장 표현은 기존 pooling에만 의존하지 않고 STS 및 transfer task에서 Original BERT를 크게 개선할 수 있다.
시사점 및 한계
Template은 여전히 수작업으로 생성되며, 자동 생성된 template은 수작업 template보다 성능이 낮다.
Abstract
from arXiv · showhide
We propose PromptBERT, a novel contrastive learning method for learning better sentence representation. We firstly analyze the drawback of current sentence embedding from original BERT and find that it is mainly due to the static token embedding bias and ineffective BERT layers. Then we propose the first prompt-based sentence embeddings method and discuss two prompt representing methods and three prompt searching methods to make BERT achieve better sentence embeddings. Moreover, we propose a novel unsupervised training objective by the technology of template denoising, which substantially shortens the performance gap between the supervised and unsupervised settings. Extensive experiments show the effectiveness of our method. Compared to SimCSE, PromptBert achieves 2.29 and 2.58 points of improvement based on BERT and RoBERTa in the unsupervised setting.
1 서론
서론은 original BERT가 anisotropy만이 아니라 BERT layers와 token embeddings가 편향을 유발하기 때문에 낮은 성능의 sentence embeddings를 만든다고 주장한다. 또한 prompt-based representations가 embedding bias를 줄이는 동시에 BERT layers를 활용하고 contrastive positive-pair construction을 개선하는 방법임을 동기와 함께 제시한다.
- 문제: Original BERT는 sentence embeddings에서 성능이 낮으며, GloVe 같은 전통적 word embeddings보다도 낮은 성능을 보인다.이는 BERT (Devlin et al., 2019)와 RoBERTa (Liu et al., 2019)를 포함한 pretrained models가 sentence embeddings에서 거둔 전반적인 성공과 대조된다 (Gao et al., 2021b; Yan et al., 2021).
- 문제: 서론은 anisotropy를 주요 원인으로 보는 설명에 의문을 제기하고, original BERT layers와 빈도·대소문자·subword에 민감한 token-embedding bias가 초래하는 손상을 지적한다.선행 연구는 anisotropy를 낮은 성능과 연결했지만 (Li et al., 2020; Yan et al., 2021; Gao et al., 2021b), 저자들은 static token embeddings 역시 GloVe보다 열등하다고 주장한다.
- 동기: Prompt-based templates는 embedding bias를 피하면서 original BERT layers를 활용하기 위해 제안되며, 이를 통해 합리적인 sentence embeddings를 얻고 일부 fine-tuned BERT-based methods보다 높은 성능을 낼 수 있다.이 접근법은 NLP tasks를 빈칸 채우기 문제로 재구성하는 prompt-based reformulations에서 동기를 얻는다 (Brown et al., 2020).
- 기여: 이 접근법은 fine-tuned settings에도 적용되며, 기존 contrastive-learning practices보다 나은 positive-pair generation을 위해 prompts를 활용한다.기존 unsupervised methods는 적절한 positive pairs가 유출되는 문제를 겪는 반면, dropout noise는 여러 data-augmentation methods보다 더 효과적인 것으로 나타났다 (Gao et al., 2021b; Yan et al., 2021).
2 관련 연구
문장 임베딩 연구는 점점 BERT를 활용하고 있으며, contrastive learning 방법은 state-of-the-art 성능을 달성하고 있다. 그러나 original BERT는 anisotropy로 인해 성능이 만족스럽지 않아 post-processing 접근법이 제안되었다.
- BERT 문장 임베딩: Contrastive learning 방법은 supervised 및 unsupervised 설정에서 BERT로 state-of-the-art 문장 임베딩 성능을 달성한다.Gao et al. (2021b)은 inner dropout을 noise로 사용하는 contrastive training objective를 제안했다.
- BERT 문장 임베딩: 최근 연구는 supervised 및 unsupervised 설정 전반에서 문장 임베딩을 위해 BERT를 활용하는 데 초점을 맞추었다.여러 연구가 BERT로 우수한 성능을 달성했다 (Gao et al., 2021b).
- Original BERT의 한계: Original BERT는 만족스럽지 않은 문장 임베딩 성능을 보이는데, 이는 부분적으로 anisotropy 때문에 문장 쌍이 매우 유사해지기 때문이다.Post-processing 방법은 이러한 anisotropy를 줄인다 (Su et al., 2021).
3 Original BERT의 문장 임베딩 재고
분석 결과, Original BERT의 문장 임베딩 성능 저하는 anisotropy만으로 설명되기보다 비효율적인 BERT layers와 static token embedding bias에 주로 기인한다. 편향된 token을 제거하면 성능이 크게 향상되지만, 짧은 문장에서는 의미 있는 단어가 누락될 수 있다.
- 3 Original BERT의 문장 임베딩 재고: 분석 결과, anisotropy 자체보다 비효율적인 BERT layers와 static token embedding bias가 낮은 semantic similarity의 주요 원인으로 나타난다.anisotropy 측정값은 sentence embedding 간 평균 cosine similarity에 기반하며, isotropic representation에서는 0에 가까워질 것으로 예상된다.
- Observation 1: Original BERT layers는 성능 향상에 실패한다: BERT layers는 bert-base-uncased와 roberta-base에서 sentence embedding 성능을 크게 저하시키는 반면, bert-base-cased의 향상 폭은 0.28에 불과하다.이러한 성능 저하는 sentence-level anisotropy로 설명되지 않는다. last-layer averaging은 더 isotropic할 수 있지만 static-token averaging보다 성능이 낮다.
- Observation 2: Embedding bias는 sentence embedding 성능을 저하시킨다: Token embedding은 frequency, subword structure, case에 의해 크게 편향되며, 이러한 무관한 속성에 대응하는 서로 다른 영역을 형성한다.High-frequency token은 군집을 이루는 반면 low-frequency token은 분산된다. BERT에서는 begin-of-word token이 frequency에 더 민감하고, RoBERTa에서는 subword가 더 민감하다.
- Observation 2: Embedding bias는 sentence embedding 성능을 저하시킨다: Static-token anisotropy는 embedding bias를 신뢰성 있게 설명하지 못한다. roberta-base는 평균 cosine similarity가 0.0235인 isotropic 상태이지만 여전히 편향되어 있다.검토한 세 pretrained model 중 bert-base-uncased만 static token embedding이 highly anisotropic하다.
- Observation 2: Embedding bias는 sentence embedding 성능을 저하시킨다: Static embedding bias를 제거하면 세 pretrained model에서 Spearman correlation이 각각 9.22, 7.08, 11.76 points 향상된다.이러한 향상은 선택된 token을 단순히 제거함으로써 얻어진다. 그 결과의 RoBERTa representation은 static token embedding만 사용하면서도 BERT-flow와 BERT-whitening보다 우수하다.
- Observation 2: Embedding bias는 sentence embedding 성능을 저하시킨다: Embedding bias를 수동으로 제거하는 방식은 very short sentences에서 부적절하다. 의미 있는 단어가 누락될 수 있기 때문이다.bias removal이 일반적으로 sentence embedding 성능을 향상시키더라도 이러한 한계가 존재한다.
4 Prompt 기반 문장 임베딩
PromptBERT는 prompt를 사용해 문장 임베딩을 masked-language modeling으로 재정식화하며, [MASK] 기반 표현으로 BERT layer를 활용하고 static token-embedding bias를 피한다. 또한 더 강한 positive pair를 구성하기 위해 template search와 template-denoised contrastive learning을 도입한다.
- 4 Prompt 기반 문장 임베딩: PromptBERT는 문장 임베딩을 masked-language modeling으로 재구성하고, prompt 기반 문장 표현을 통해 BERT의 pretrained knowledge를 활용하면서 static token-embedding bias를 피한다.이 접근법은 Brown et al. (2020)에서 영감을 받았다.
- 4 Prompt 기반 문장 임베딩: 이 방법은 prompt representation과 prompt discovery를 다룬 뒤, MLM classification label을 문장 출력으로 사용하는 대신 prompt-based contrastive learning method를 구축한다.문장 임베딩은 벡터이며, MLM classification head가 예측한 label token이 아니다.
- 4.1 Prompt로 문장 표현하기: “[X] means [MASK]”와 같은 template이 주어지면, PromptBERT는 입력 문장을 template에 매핑하고 pretrained model에 입력해 representation을 얻는다.한 가지 representation 방법은 [MASK] token의 hidden vector를 사용하며, 다른 방법은 probability에 따라 top-k MLM-predicted token embedding을 평균낸다.
- 4.1 Prompt로 문장 표현하기: PromptBERT는 token-weight averaging이 static embedding bias를 유지하고 downstream에서 BERT를 fine-tuning하기 어렵게 만들기 때문에 [MASK]-hidden-vector method를 선택한다.token-mapping 대안은 더 conventional한 방법으로 설명되지만, 두 가지 단점을 모두 겪는다.
- 4.2 Prompt Search: Prompt search는 manual greedy search, T5-based generation, OptiPrompt를 결합한다. manual search는 relationship token과 prefix token을 분리하고, T5 generation은 500개의 word-definition template을 사용한다.방법들은 STS-B development set에서 Spearman correlation으로 평가된다. T5-based generation은 Gao et al. (2021a)을 따르며, OptiPrompt는 Zhong et al. (2021)을 따른다.
- 4.2 Prompt Search: 80.90 versus 73.44 STS-B Spearman은 frozen-BERT unsupervised contrastive training에서 optimized continuous template이 manual initialization보다 뛰어남을 보여준다.OptiPrompt는 manual-template static token embedding으로부터 continuous template을 초기화하고 unsupervised contrastive learning으로 최적화한다.
- 4.3 Template Denoising을 적용한 Prompt 기반 Contrastive Learning: Template denoising은 한 문장에 대한 different templates for one sentence as positive views로 취급하고, contrastive training 전에 template bias를 제거해 template-specific representation effect를 줄인다.이 objective는 temperature τ와 mini-batch size N을 사용하며, prompt-based positive-instance construction을 따른다.
5 실험
실험에서는 non-fine-tuned 및 fine-tuned BERT 설정에서 7개 STS dataset에 대해 PromptBERT를 평가한다. Prompt 기반 representation은 original BERT를 개선하며, Prompt 기반 contrastive learning은 기존 방법을 능가하고 안정적인 unsupervised training을 달성한다.
- 실험 설정: Prompt 기반 방법은 7개 일반적인 STS dataset에서 평가되며, 각 sentence pair에는 0부터 5까지의 semantic-similarity score가 부여된다.Dataset은 2012–2016년 STS task, STS-B, SICK-R로 구성되며, SentEval을 사용해 다운로드한다.
- Non-fine-tuned BERT: Prompt 기반 representation은 모든 non-fine-tuned STS dataset에서 BERT pooling 방법보다 Spearman correlation을 10% 초과 개선한다.실험에서는 last layer의 averaging과 first 및 last layer의 averaging, 그리고 BERT-flow와 BERT-whitening을 비교한다.
- Fine-tuned BERT: Fine-tuned BERT 실험에서 Prompt 기반 contrastive learning은 기존 contrastive 방법과 초기 sentence-embedding 방법을 능가하며, unsupervised–supervised 성능 격차를 좁힌다.평가에서는 unsupervised 및 supervised 설정에서 BERT와 RoBERTa를 사용하며, contrastive learning이 불안정했기 때문에 unsupervised 결과는 10개의 random seed로 학습한다.
- Training-objective 분석: PromptBERT는 SimCSE보다 더 안정적인 unsupervised 결과를 내며, same-template, different-template, template-denoising objective 중 가장 우수하고 안정적인 성능을 달성한다.Objective 비교에서는 10회의 random run을 사용하며, training 중 positive pair를 생성하는 방식만 변경한다.
6 논의
논의에서는 template denoising이 template bias를 줄이고 예측된 token의 관련성을 높이며, PromptBERT가 SimCSE보다 더 안정적인 비지도 contrastive learning 결과를 낸다는 점을 확인한다.
- Template denoising: Template denoising은 original BERT의 prompt template에서 bias를 효율적으로 제거한다.이 메커니즘은 더 나은 masked-token prediction과 sentence embedding을 지원한다.
- Template denoising: PromptBERT의 template denoising은 sentence embedding에 사용되는 무관한 predicted token을 제거하고 top-k token의 품질을 높인다.“nothing,no,yes”와 같은 token을 제거하고 문장과 더 관련된 prediction을 유도한다.
- 결과 안정성: 10개의 random seed에서 SimCSE의 최고 결과와 최저 결과 간 격차는 3.14%이며, PromptBERT에서는 0.53에 불과하다.이 비교는 재현한 비지도 SimCSE-BERTbase 결과를 사용하며 PromptBERT의 더 높은 안정성을 보여준다.
7 결론
이 논문은 original BERT의 약한 문장 임베딩이 정적 token embedding 편향을 유발하고 BERT layer를 충분히 활용하지 못하는 부적절한 표현 방식에서 비롯된다고 주장한다. 이러한 한계를 prompt 기반 문장 임베딩 방법으로 해결해 BERT의 문장 임베딩 성능을 향상한다.
- 7 결론: 이 논문은 original BERT의 낮은 문장 임베딩 성능이 부적절한 문장 표현 방식 때문이라고 분석한다.이러한 방식은 정적 token embedding 편향을 유발하고 original BERT layer를 효과적으로 활용하지 못한다.
- 7 결론: 제안한 prompt 기반 문장 임베딩 방법은 문장 임베딩을 위해 BERT를 더 효과적으로 활용한다.결론에서는 이 접근법이 original BERT가 뛰어난 문장 임베딩 성능을 달성하는 데 도움이 된다고 밝힌다.
8 한계 · A 정적 Token Embeddings 편향 · A.1 Token 제거를 통한 편향 제거
이 논문의 방법은 비지도 및 지도 설정에서 합리적인 성능을 보이지만, 수동으로 구성한 template이 자동 생성된 T5 template보다 우수하다는 점에서 template 구성은 여전히 한계로 남는다. 부록에서는 BERT와 RoBERTa 변형 전반에서 정적 token-embedding 편향을 해결하기 위한 token 제거 절차를 자세히 설명한다.
- 8 한계: 수동 template은 여전히 자동 생성된 T5 template보다 우수하므로, 비지도 및 지도 성능이 합리적임에도 현재 방법의 자동화에는 한계가 있다.저자들은 더 나은 자동 template 생성 메커니즘의 개발을 향후 과제로 남긴다.
- 8 한계: Continuous template은 prompt가 sentence embedding에 효과적임을 검증하지만, 신중하게 설계된 자동 template이 성능을 더 향상할 가능성도 있다.이 기대는 입증된 결과가 아니라 향후 과제로 제시된다.
- A 정적 Token Embeddings 편향: 부록에서는 bert-base-uncased, bert-base-cased, roberta-base에서 token을 삭제하여 정적 token-embedding 편향을 조사한다.구현에는 빈도 기반, subword 기반, case 기반 token 제거 전략이 포함된다.
- A.1 Token 제거를 통한 편향 제거: 빈도 기반 제거에서는 Yan et al. (2021)의 설정에 따라 빈도가 높은 상위 36개 token을 삭제한다.제거된 빈도 token은 Table 11에 나열되어 있다.
- A.1 Token 제거를 통한 편향 제거: Subword 기반 제거에서는 모든 subword token을 삭제하며, 이는 Figure 2의 노란색 token으로 식별된다.이는 직접적인 token 제거 전략으로 적용된다.
- A.1 Token 제거를 통한 편향 제거: 대문자와 소문자 문장을 포함하는 데이터셋은 SICK뿐이므로, case 기반 제거에서는 대문자 token을 제거하기 위해 해당 문장을 소문자로 변환한다.따라서 이 절차는 SICK 데이터셋의 대소문자 변이에 특화되어 있다.
A.2 사전학습을 통한 편향 제거
이 절에서는 정적 token embedding 편향이 주로 MLM classification head에서 발생한다고 보고, weight tying이 이러한 편향에 어떻게 기여하는지 살펴본다. tied 및 untied BERT 계열 모델을 비교하고, frequency, subword, capitalization 특성에 따른 embedding 분포를 시각화한다.
- 편향 분석: 정적 token embedding 편향은 주로 MLM classification head에서 발생하며, 이 head의 tied weight가 [MASK] 표현을 token probability로 변환한다.정적 token embedding과 MLM classification head 사이의 weight tying으로 인해 embedding이 이러한 편향을 겪는다.
- Embedding 시각화: Figure 2에서는 untied 모델의 정적 embedding과 MLM-head weight를 tied 모델의 정적 embedding과 함께 시각화하고, frequency, subword, capitalization 패턴을 표시한다.더 어두운 색은 더 높은 token frequency를 나타내며, 노란색은 subword를, 빨간색은 대문자를 포함한 token을 나타낸다.
- 사전학습 설정: 두 BERT 계열 모델은 batch size 2k로 125k steps 동안 MLM으로 사전학습되었으며, token embedding weight와 MLM-head weight를 tied했는지 여부만 달랐다.
B 학습 세부 사항
학습에는 수작업으로 설계한 prompt를 사용하며, OptPrompt는 BERT를 frozen 상태로 유지한 채 template embedding을 추가로 학습한다. fine-tuned와 unsupervised 설정에서는 서로 다른 template-denoising 절차와 고정된 sequence-length 제약을 사용한다.
- 학습 설정: OptPrompt는 manual prompt에서 template embedding을 초기화한 다음, frozen BERT와 unsupervised task를 사용해 이를 학습하며, batch size 256, learning rate 3e-5, 5 epochs, 1000 steps마다 validation을 적용한다.fine-tuned 설정은 Gao et al. (2021b)와 동일한 training data를 사용한다.
- Template 설계: non-fine-tuned 학습에서는 manual template “This sentence: “[X]” means [MASK]”를 사용하며, fine-tuned model에서는 STS-B development 성능에 따라 선택한 manually searched template을 사용한다.fine-tuned 설정에서는 maximum sentence length를 32로 제한한다.
- Template denoising: Unsupervised training에서는 template denoising을 적용한 two templates를 사용하는 반면, prediction에서는 denoising 없이 one template을 사용한다. Supervised training에서는 contrastive learning에 동일한 template을 사용하면서 template denoising을 적용한다.fine-tuned model의 manual template은 Table 13에 제시되어 있다.
C 전이 과제
PromptBERT는 SentEval의 기본 설정을 사용해 7개 전이 과제에서 평가된다. RoBERTa 기반 방법은 비지도 모델에서 SimCSE보다 2.52포인트, 지도 모델에서 0.92포인트 향상된다.
- 전이 과제 설정: 전이 평가는 SentEval의 기본 설정에서 MR, CR, SUBJ, MPQA, SST-2, TREC, MRPC를 대상으로 수행된다.결과는 Table 15에 보고된다.
- 전이 과제 결과: PromptBERT의 RoBERTa 기반 방법은 비지도 모델에서 SimCSE보다 2.52포인트, 지도 모델에서 0.92포인트 향상된다.비교에는 Table 15에 보고된 전이 과제 결과가 포함된다.
- 전이 과제 결과: Table 15는 PromptBERT와 SimCSE의 전이 과제 결과를 제시한다.평가에서는 비지도 및 지도 설정에서 RoBERTa 기반 방법을 비교한다.