Source-linked AI summary

Gemini Embedding: Generalizable Embeddings from Gemini

Jinhyuk Lee, Feiyang Chen, Sahil Dua, Daniel Cer, Madhuri Shanbhogue, Iftekhar Naim, Gustavo Hernández Ábrego, Zhe Li, Kaifeng Chen, Henrique Schechter Vera, Xiaoqi Ren, Shanfeng Zhang, Daniel Salz, Michael Boratko, Jay Han, Blair Chen, Shuo Huang, Vikram Rao, Paul Suganthan, Feng Han, Andreas Doumanoglou, Nithi Gupta, Fedor Moiseev, Cathy Yip, Aashi Jain, Simon Baumgartner, Shahrokh Shahi, Frank Palma Gomez, Sandeep Mariserla, Min Choi, Parashar Shah, Sonam Goenka, Ke Chen, Ye Xia, Koert Chen, Sai Meher Karthik Duddu, Yichang Chen, Trevor Walker, Wenlei Zhou, Rakesh Ghiya, Zach Gleicher, Karan Gill, Zhe Dong, Mojtaba Seyedhosseini, Yunhsuan Sung, Raphael Hoffmann, Tom Duerig

arXiv:2503.07891v1cs.CLcs.AI

TL;DR

범용 embedding model은 다양한 언어, 도메인, task를 지원해야 한다. Gemini Embedding은 Gemini에서 파생된 capability와 training data를 활용해 multilingual, English, code 평가 전반에서 state-of-the-art 결과를 달성한다.

  • 문제

    기존 연구는 다양한 언어, 도메인, modality, downstream task 전반에서 우수한 성능을 내는 범용 embedding을 모색한다.

  • 방법

    Gemini Embedding은 엄선된 multilingual 및 code-task data, synthetic generation, filtering, hard-negative mining, contrastive learning, task prompt를 활용해 Gemini를 조정한다.

  • 결과

    Gemini Embedding은 multilingual, English, code 평가 전반에서 state-of-the-art 성능을 달성하며, MTEB(Multilingual) Task Mean 68.32와 Borda rank #1을 포함한다.

  • 시사점 및 한계

    통합 model은 다양한 언어와 task 유형에서 classification, similarity search, clustering, ranking, retrieval에 활용할 수 있는 다목적 representation을 제공한다.

  • 시사점 및 한계

    이 보고서는 Gemini Embedding을 image, video, audio modality로 확장하는 일을 적합한 multimodal training data가 필요한 향후 과제로 남긴다.

Abstract

from arXiv · show

In this report, we introduce Gemini Embedding, a state-of-the-art embedding model leveraging the power of Gemini, Google's most capable large language model. Capitalizing on Gemini's inherent multilingual and code understanding capabilities, Gemini Embedding produces highly generalizable embeddings for text spanning numerous languages and textual modalities. The representations generated by Gemini Embedding can be precomputed and applied to a variety of downstream tasks including classification, similarity, clustering, ranking, and retrieval. Evaluated on the Massive Multilingual Text Embedding Benchmark (MMTEB), which includes over one hundred tasks across 250+ languages, Gemini Embedding substantially outperforms prior state-of-the-art models, demonstrating considerable improvements in embedding quality. Achieving state-of-the-art performance across MMTEB's multilingual, English, and code benchmarks, our unified model demonstrates strong capabilities across a broad selection of tasks and surpasses specialized domain-specific models.

1. 서론

이 논문은 Gemini로 초기화하고 Gemini의 지원을 받은 데이터 큐레이션을 활용해 이질적인 embedding task로 학습한 모델인 Gemini Embedding을 소개한다. 100개가 넘는 task와 250개 이상의 언어에 걸쳐 모델을 평가하고, multilingual 및 기타 benchmark에서 state-of-the-art 결과를 보고한다.

  • 1. 서론: Embedding model은 의미적으로 유사한 텍스트를 embedding space에서 서로 가깝게 배치하는 dense vector로 텍스트를 표현한다.domain과 modality를 아울러 의미 정보를 포착하는 데 사용된다.
  • 1. 서론: Large language model은 hard-negative mining과 synthetic-data generation을 통해 training data를 정제하고 강력한 초기화를 제공함으로써 embedding 개발을 개선한다.이러한 접근법은 LLM의 지식을 더 작은 embedding model로 distill할 수 있으며, 더 높은 computational demand에도 불구하고 우수한 성능을 낸다.
  • 1. 서론: Gemini Embedding은 Gemini로 초기화되고, 이질적이며 고품질인 dataset을 사용해 포괄적인 embedding task 모음으로 학습된다.Gemini는 저품질 example을 filtering하고 관련성 높은 positive 및 negative retrieval passage를 식별하는 데 도움을 준다.
  • 1. 서론: MTEB(Multilingual)에서 68.32 mean score를 기록해 multilingual-e5-large-instruct를 +5.09 앞서며, 59.64 task-type mean으로 gte-Qwen2-7B-instruct를 +3.64 앞선다.Gemini Embedding은 public leaderboard에서 가장 높은 Borda rank도 달성했으며, XOR-Retrieve (Asai et al., 2021)를 비롯한 여러 다른 benchmark에서 새로운 state-of-the-art 결과를 확립한다.

2. 관련 연구

기존 연구는 downstream NLP task를 위한 범용 text embedding, LLM 기반 embedding encoder, synthetic-query 방법을 개발해 왔다. 최근 LLM-initialized model은 대체로 이전의 BERT- 또는 T5 기반 접근법보다 우수한 성능을 보이지만, generalization에 대한 우려도 제기한다.

3. Gemini Embedding

Gemini Embedding은 Gemini에서 초기화한 뒤 retrieval, clustering, classification, ranking을 위한 포괄적 표현으로 정교화된다. 설계에는 bidirectional transformer encoding, contrastive training, 다차원 embedding, model averaging을 포함한 2단계 training pipeline이 결합된다.

  • Architecture: 이 모델은 Gemini에서 초기화한 bidirectional transformer를 사용한 뒤, token embedding을 하나의 입력 표현으로 변환하는 pooler를 적용한다.이 초기화는 Gemini의 parameter에 이미 인코딩된 지식을 활용한다.
  • Training objective: Gemini Embedding은 in-batch negative, task string, classification과 같은 task에 맞춘 masking을 사용하는 noise-contrastive estimation으로 학습된다.이 방법은 잠재적 false negative가 대부분의 task에서 성능을 낮추는 것으로 나타났기 때문에 same-tower negative를 제외한다.
  • Embedding dimensions: 이 모델은 3,072차원 embedding을 지원하며, 겹치는 768차원 및 1,536차원 subspace를 학습하기 위해 multi-resolution loss를 사용한다.이를 통해 하나의 모델이 여러 embedding 차원을 지원할 수 있다.
  • Training recipe: 학습은 noisy-pair pre-finetuning, hard negative를 사용한 task-specific fine-tuning, 그리고 일반화를 향상하기 위한 checkpoint의 model-soup averaging을 거쳐 진행된다.Pre-finetuning에서는 hard negative 없이 large batch를 사용하고, fine-tuning에서는 dataset-homogeneous한 smaller batch를 사용하며 training configuration을 탐색한다.

4. 데이터셋

학습 혼합물은 다양한 다국어 embedding 및 code-retrieval task를 결합하며, Gemini는 synthetic generation, filtering, hard-negative mining을 통해 데이터를 개선한다. Pre-finetuning에서는 billion-scale web title–passage pair를 사용하고, fine-tuning에서는 task, language, coding 다양성을 목표로 한다.

  • 학습 데이터: Gemini는 synthetic data generation, data filtering, hard-negative mining을 통해 다양한 다국어 및 code-retrieval 학습 혼합물을 개선한다.
  • Pre-finetuning: Pre-finetuning에서는 모델을 billion-scale web title–passage pair에 노출한다. 이는 LLM initialization에서도 효과적인 것으로 확인된 단순한 접근법이다.
  • Fine-tuning: Fine-tuning에서는 task diversity, language diversity, coding capability를 위해 설계된 혼합물을 사용하며, leakage로 인한 성능 향상을 줄이기 위해 다수의 in-domain MTEB dataset은 제외한다.Task-diversity 혼합물에는 Gecko에서 사용한 academic dataset과 Section 4.2에서 소개한 synthetic dataset이 포함된다.
  • Synthetic Data Generation: Synthetic dataset은 few-shot prompting을 사용한 Gemini-enhanced FRet 및 SWIM-IR adaptation을 통해 retrieval and classification 학습을 확장한다.
  • 데이터 필터링: Gemini는 few-shot prompt로 예시를 평가하고 잘못된 target을 가진 낮은 품질의 사례를 제거하여 human-annotated retrieval data를 필터링한다.
  • Hard Negative Mining: Hard negative는 초기 embedding model로 nearest neighbor를 검색하고, 두 prompting strategy를 사용해 Gemini로 점수를 매긴 뒤 lowest-scoring neighbor를 선택하여 채굴한다.Graded classification prompt와 query likelihood prompt의 점수는 Reciprocal Rank Fusion으로 결합한다.

5. 평가

Gemini Embedding은 다국어, 영어, 코드 embedding benchmark 전반에서 state-of-the-art 성능을 달성하며, cross-lingual retrieval도 발전시킨다. 평가는 250+개 언어에 걸친 164개 task와 여러 task 유형을 아우르며, MMTEB (Enevoldsen et al., 2025), XTREME-UP (Ruder et al., 2023), XOR-Retrieve (Asai et al., 2021)를 포함한다.

  • MTEB(Multilingual) leaderboard: Task Mean 68.32, Task Type Mean 59.64, Borda rank #1을 기록하며 Gemini Embedding은 최상위 MTEB(Multilingual) 모델로 자리매김한다.이 지표들은 March 10, 2025 leaderboard에서 task와 task type 전반의 종합 성능을 요약한다.
  • 전체 benchmark 결과: Gemini Embedding은 MTEB(Multilingual), MTEB(Eng, v2), MTEB(Code)에서 ranks #1을 기록하며, state-of-the-art general-purpose cross-lingual embedding을 발전시킨다.이 unified model은 다국어, 영어, 코드, cross-lingual 평가 전반에서 shared embedding space를 사용한다.
  • XTREME-UP: Gemini Embedding은 XTREME-UP에서 강력한 cross-lingual retrieval 성능을 보이며, 20 underrepresented languages의 query를 영어 passage에 매핑한다.Figure 2는 Assamese와 Hindi query를 번역 없이 encoding해 올바르게 retrieval한 결과를 보여주며, typo가 포함된 Hindi query도 포함한다.
  • Ablation: MTEB classification에서 Gemini-generated data를 사용한 self-training에 대해 +17.6이 보고되며, multilingual fine-tuning은 XTREME-UP long-tail languages에서 가장 큰 도움을 준다.training-mixture ablation은 MTEB(Multilingual), MTEB(Eng, v2), XOR-Retrieve에서 양호한 English-only 성능도 보고한다.

6. Ablation Study

Ablation study는 Gemini Embedding의 폭넓은 성능이 staged pre-finetuning과 fine-tuning, synthetic data generation, dataset filtering, hard-negative mining에 기인한다고 분석한다. 이러한 구성 요소는 언어, task, retrieval dataset 전반의 성능을 향상시키지만, hard negative가 지나치게 많으면 overfitting이 발생할 수 있다.

  • Training Recipe: Pre-finetuning은 여러 benchmark 전반의 성능을 크게 향상시키며, multilingual evaluation에서도 English-only fine-tuning은 여전히 강력하다.이 연구는 언어와 task 전반의 generalization을 분석하기 위해 no training, pre-finetuning only, subsequent fine-tuning을 비교한다.
  • Data Filtering: LLM-filtered retrieval dataset은 언어 전반에서 결과를 일관되게 향상시키며, 일부 MIRACL 언어에서는 소폭의 하락만 나타난다.Filtering 실험은 18개 언어에 걸친 MIRACL training dataset을 대상으로 한다.
  • Hard Negative Mining: Hard negative는 일반적으로 네 개 dataset 전반의 retrieval 성능을 높이지만, excessive negative는 overfitting과 성능 저하를 일으킨다.이 분석은 regularization과 개선된 hard-negative sampling strategy에 관한 향후 연구의 필요성을 제시한다.
  • Synthetic Data Generation: Zero-shot synthetic classification dataset으로 학습하면 평가된 모든 dataset에서 성능이 크게 향상되며, in-domain training과 맞먹는 성능을 낼 수 있다.Synthetic dataset은 original dataset의 예시를 사용하지 않고 multi-stage prompting strategy로 생성되었다.

7. 향후 연구

향후 연구에서는 Gemini Embedding을 텍스트에서 이미지, 비디오, 오디오로 확장해 멀티모달 조합을 하나의 embedding space에서 표현하고자 한다. 또한 단일 모달과 멀티모달 역량의 균형을 맞추는 training recipe를 탐색할 예정이다.

  • 7. 향후 연구: Gemini의 멀티모달 역량을 활용해 모델을 이미지, 비디오, 오디오로 확장하고, 하나의 embedding space에서 모달리티 조합을 표현한다.이는 모달리티 전반에서 Gemini Embedding을 더욱 포괄적으로 만드는 것을 목표로 한다.
  • 7. 향후 연구: 서로 다른 단일 모달 및 멀티모달 역량 전반에서 성능의 균형을 맞추기 위한 training recipe를 탐색한다.

8. 결론

Gemini Embedding은 Gemini의 다국어 및 코드 이해 능력을 활용해 다양한 언어, 도메인, 태스크 유형에 적용되는 통합 범용 embedding model로 제시된다. MMTEB 평가에서 다국어, 영어, 코드 평가 모두 이전 최고 성능 모델을 크게 앞섰으며, 특히 classification, clustering, retrieval에서 강점을 보인다.

  • 8. 결론: Gemini Embedding은 Gemini의 다국어 및 코드 이해 능력을 기반으로 구축된 통합 범용 embedding model이다.다양한 언어, 도메인, 태스크 유형에 걸친 입력에 대해 범용적인 encoding을 생성한다.
  • 8. 결론: MMTEB 평가에서 다국어, 영어, 코드 평가 전반에 걸쳐 이전 최고 성능 모델을 크게 앞섰다.이러한 결과는 embedding 성능의 state of the art를 진전시킨다.
  • 8. 결론: Gemini Embedding은 특히 classification, clustering, retrieval 태스크에서 뛰어난 성능을 보인다.통합된 능력에 더해 representation을 사전 계산할 수 있다.

9. 전체 결과

이 절에서는 다국어, 영어, 코드, 검색 및 다국어 이해 벤치마크 전반에 걸친 Gemini Embedding의 전체 결과를 보고한다.

  • MTEB(Multilingual)에서 Gemini Embedding의 전체 결과를 제시한다.
  • MTEB(Eng, v2) 및 MTEB(Code)에서 전체 결과를 제시한다.
  • 또한 XOR-Retrieve 및 XTREME-UP에서 전체 결과를 제시한다.

10. 기여 및 감사의 말

이 보고서는 Jinhyuk Lee를 동등한 기여를 한 핵심 기여자로 명시하고, Iftekhar Naim, Gustavo Hernández Ábrego 등을 포함한 추가 기여자들을 열거한다.

  • 핵심 기여자: Jinhyuk Lee는 동등한 기여를 한 핵심 기여자로 명시된다.
  • 핵심 기여자: 추가 기여자로 Iftekhar Naim, Gustavo Hernández Ábrego, Zhe Li, Kaifeng Chen, Henrique Schechter, Vera Xiaoqi Ren, Shanfeng Zhang, Daniel Salz, Michael Boratko, Jay Han, Blair Chen, Shuo Huang, Vikram Rao가 포함된다.
Loading 2503.07891v1…