Source-linked AI summary
Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini
TL;DR
기존 embedding model은 혼합 modality 입력과 상호작용을 일관되게 표현하는 데 한계가 있다. Gemini Embedding 2는 video, audio, image, text의 임의 조합을 위한 unified embedding으로 이를 해결하며, 다양한 embedding benchmark에서 state-of-the-art 성능을 달성한다.
문제
기존 embedding model은 modality 전반에 걸쳐 혼합 modality 입력과 상호작용을 일관되게 표현하는 능력이 제한적이다.
방법
Gemini Embedding 2는 Gemini 기반 multimodal representation과 multi-task training을 사용해 video, audio, image, text의 임의 조합을 하나의 space에 embedding한다.
결과
Gemini Embedding 2는 multilingual, code, cross-modal, multimodal retrieval benchmark 전반에서 최첨단 성능을 달성한다.
시사점 및 한계
이 unified representation은 document retrieval, video recommendation, audio search, RAG를 비롯한 downstream 용도를 지원한다.
시사점 및 한계
이 논문은 확장되는 interleaved multimodal application을 benchmark하기 위해 새로운 evaluation framework가 필요하다고 지적한다.
Abstract
from arXiv · showhide
We introduce Gemini Embedding 2, a native multimodal embedding model that allows embedding video, audio, image, and text modalities in a unified representation space. We leverage the multimodal capabilities of Gemini to produce embeddings for arbitrary combinations of interleaved inputs across all these modalities that generalize well across a wide variety of tasks. Applying large-scale contrastive learning in a multi-task multi-stage training setup, we achieve state-of-the-art performance on key embedding benchmarks including unimodal, cross-modal, and multimodal retrieval spanning a diverse set of tasks. We show that our embedding model demonstrates strong performance (with a score of 62.9 R@1 on MSCOCO, 68.8 NDCG@10 on Vatex, 69.9 on MTEB multilingual and 84.0 on MTEB Code) across a variety of tasks surpassing the performance of specialized models. These unified capabilities make Gemini Embedding 2 a promising candidate for downstream use cases such as RAG, recommendation and search. Furthermore, its robust zero-shot performance across distinct fields - from astronomy and bioscience to fine arts and the culinary arts - establishes it as a highly reliable, out-of-the-box representation even for specialized domains.
1. 서론
Gemini Embedding 2는 이질적인 입력과 임의의 modality 조합을 하나의 representation space로 매핑하는 범용 multimodal embedding model로 소개된다. Gemini의 capability와 multi-task training을 활용해 modality 간 상호작용을 더 풍부하게 포착하며, 다양한 benchmark에서 state-of-the-art performance를 달성한다.
- 동기: Native multimodal embedding은 downstream application을 위해 modality 내부와 modality 간의 일관된 의미 표현이 필요하다는 동기에서 출발한다.서론은 이 capability가 dense semantic vector representation을 통해 폭넓은 application 성능을 가능하게 한다고 연결한다.
- 기여: Gemini Embedding 2는 video, audio, image, text와 이들의 임의 조합을 하나의 representation space에 embedding한다.이 model은 modality별 encoder를 따로 사용하는 데 그치지 않고 modality 간 상호작용을 포착하도록 설계된다.
- 동기: CLIP [1], ALIGN [2], SigLIP 2, CoCa 와 같은 기존 late-fusion model은 modality 간 상호작용을 활용하지 않기 때문에 mixed-modality input을 제대로 처리하지 못한다.이 model들은 paired cross-modal data와 modality별 encoder를 사용해 unimodal 및 cross-modal capability에서는 좋은 성능을 내지만, mixed-modality representation은 덜 풍부하다.
- 평가: 이 model은 다양한 academic-focused 및 enterprise-focused benchmark에서 state-of-the-art performance를 달성한다.평가에는 retrieval, clustering, classification 및 기타 downstream use case를 아우르는 multilingual text embedding task가 포함된다.
2. 관련 연구
관련 연구는 encoder-only text embedder와 제한적인 image–text dual tower에서 출발해, 다양한 modality와 enterprise document를 아우르는 instruction-tuned multimodal model로 발전해 왔다. Gemini Embedding 2는 이러한 기존의 분리된 기능을 하나의 out-of-the-box model로 통합하는 모델로 자리매김한다.
- Text embedder로서의 Large Language Model: Text embedding model은 BERT [11]와 RoBERTa [12] 같은 encoder-only architecture에서 decoder-only 및 massive LLM backbone으로 발전했으며, BGE [13]와 E5 [14]는 task-specific prefix를 사용한다.이러한 instruction-tuned representation은 하나의 model 안에서 semantic search, clustering, classification을 통합한다.
- Multimodal Embedder의 발전: Multimodal embedder는 image–text pair로 학습한 CLIP [1]과 ALIGN [2]의 dual tower에서 출발해 text, code, image, document, audio, video를 포괄하는 unified semantic space로 확장되었다.초기 paradigm은 단순한 image–text pair에 대한 제한적인 contrastive objective 때문에 제약을 받았다.
- Bidirectional Attention을 위한 Architectural Adaptation: Architectural adaptation은 dense context-aware embedding을 제한하는 causal LLM의 unidirectional attention을 MoCa [21]와 modality-aware continual pre-training 같은 방법으로 보완한다.MoCa [21]는 interleaved text 및 image input을 denoise하기 위해 joint reconstruction objective를 사용한다.
- Enterprise Use Case에 대한 Adaptation: Enterprise 중심 embedder는 complex PDF, chart, table을 처리하기 위해 특화된 visual-document method를 사용해 대규모 document context를 처리하며, RAG 품질은 chunking 같은 pipeline 선택에도 좌우된다.이러한 요구는 document 중심의 enterprise 및 agentic workload가 증가하면서 발생했다.
- Novelty: Gemini Embedding 2는 multi-stage distillation, LLM backbone adaptation, enterprise use case를 통합하며, 선행 architecture가 대체로 개별적으로 다루었던 기능을 하나로 묶는다.이 논문은 이러한 통합이 out-of-the-box model을 통해 폭넓은 use case를 지원한다고 제시한다.
3. 멀티모달 Gemini Embedding
Gemini Embedding 2는 Gemini로 초기화된 transformer, modality-aware tokenization, pooled embeddings를 사용해 개별 및 결합 modality의 unified representations를 구축한다. multi-task, multi-stage contrastive training은 modality-specific tasks, cross-modal tasks, dimensionality support, checkpoint averaging을 결합한다.
- Model Architecture: Gemini Embedding 2는 멀티모달 입력에 대한 holistic representations를 생성하며, 서로 다른 modality에 걸쳐 retrieval, clustering, classification, ranking을 지원한다.이 모델은 Gemini의 multimodal 및 cross-modal capabilities를 활용하며, 파라미터에 이미 존재하는 지식을 사용하도록 Gemini에서 초기화된다.
- Model Architecture: Raw images, video, audio는 Gemini이 지원하는 format conversions를 사용해 token sequences로 변환된 뒤, bidirectional Gemini-initialized transformer와 mean pooling을 거친다.L tokens로 이루어진 입력 sequence에 대해 transformer는 pooler가 하나의 d_M-dimensional representation을 생성하기 전에 token embeddings를 출력한다.
- Training Objective: 이 모델은 noise-contrastive estimation과 in-batch negatives를 사용해 single-modality, multimodal, cross-modal tasks를 아우르는 multi-task, multi-stage training을 수행한다.Text-only tasks에는 question answering이나 fact checking과 같은 task strings가 포함될 수 있으며, task strings를 사용할 수 없을 때의 robustness를 높이기 위해 이를 무작위로 제거한다.
- Training Objective: Gemini Embedding 2는 3,072-dimensional embeddings를 생성하며, MRL은 768- 및 1,536-dimensional subspaces에 최적화된 overlapping losses를 학습한다.이 adaptation을 통해 하나의 모델로 서로 다른 embedding dimensions를 사용할 수 있다.
- Training Recipe: Training은 noisy image, text, code pairs에 대한 pre-fine-tuning, task-specific batches를 사용한 six modalities 전반의 fine-tuning, 그리고 model soup checkpoint averaging을 거쳐 진행된다.Pre-fine-tuning은 encoding을 위해 autoregressive parameters를 조정하며, model soup은 개별 fine-tuning runs의 checkpoints를 평균내 modality 전반의 generalization을 향상한다.
4. 평가
Gemini Embedding 2는 unimodal, cross-modal, multimodal retrieval 전반에서 강력하거나 state-of-the-art 수준의 성능을 달성하면서 text-only 품질을 유지하고, 수동 prompt engineering 없이도 견고한 zero-shot 평가를 가능하게 한다. Native multimodal processing은 audio retrieval에서 특히 유용하며, 동일 언어 및 cross-lingual 설정 모두에서 transcription 기반 encoding을 능가한다.
- Multimodal retrieval: Gemini Embedding 2는 가장 높은 global mean score를 달성하고 unimodal image, text-to-image, image-to-text, text-to-video retrieval task에서 선두를 차지한다.dataset별 in-domain training split 없이도 Vatex, MSR-VTT, YouCook2로 일반화하며, 특히 DOCCI와 TextCaps에서 강력한 결과를 보인다.
- Multimodal retrieval: ViDoRe V2에서의 64.9는 document retrieval에서 Gemini Embedding 2가 Amazon Nova MME (60.6)를 앞서고 Voyage-3.5-multimodal (65.5)에 근접함을 보여준다.이 task는 page-level visual structure, layout, embedded-text understanding을 요구하며, Gemini Embedding 2는 전체 Video/Audio/Image/Text modality set도 지원한다.
- Text and code benchmarks: MMTEB에서의 69.9는 이전 text-only Gemini Embedding model의 68.32 mean을 넘어, 확장된 multimodal capability가 textual performance를 저해하지 않음을 보여준다.Gemini Embedding 2는 MTEB Code v1과 CoIR에서도 새로운 state-of-the-art performance 수준을 세우며, 이전 text-only model을 능가한다.
- Audio retrieval: PassageInLang에서 +2.0 points (75.58 vs. 73.58), PassageCrossLang에서 +5.01 points (72.56 vs. 67.55)는 언어 조건 전반에서 일관된 native-audio gain을 보여준다.더 큰 cross-lingual 개선은 중간 단계 ASR transcript의 음성학적 제약을 넘어 견고한 semantic alignment를 뒷받침한다.
5. 절제 연구
절제 실험은 Gemini Embedding 2의 성능이 Gemini가 생성한 학습 데이터, 추가 video 학습, targeted fine-tuning의 이점을 얻으며, model souping이 태스크 전반의 강건성을 보존함을 보여준다. Zero-shot 평가에서도 전문 분야 전반에서 state-of-the-art 수준의 domain-robust multimodal retrieval 성능이 확인된다.
- Zero-shot domain evaluation: Gemini Embedding 2는 평가된 모든 전문 분야에서 state-of-the-art zero-shot image-to-text retrieval 성능을 달성하며, R@5 점수는 astronomy에서 64.4, microscopy에서 79.3이다.Recipe1M에서는 ingredient retrieval에서 90.2, instruction retrieval에서 92.1에 도달해 SigLIP2-Giant의 81.2와 80.4를 상회한다.
- Synthetic-data ablation: Gemini Embedding 2는 synthetic data를 추가하기 전부터 text-only Gemini Embedding baseline보다 성능이 향상되어 multimodal model의 이점을 입증한다.또한 Gemini는 MTEB Code ablation 태스크를 위한 고품질 학습 데이터를 합성하는 데 사용되었다.
- Model souping: Model souping은 태스크별 이득과 original model의 강건성 사이에서 균형을 이루며, 여러 경우에 태스크 전반에서 baseline을 능가한다.Targeted data는 in-domain 성능을 높일 수 있지만 out-of-domain 태스크 성능은 소폭 저하시킬 수 있으며, YouCook2에서는 0.6% 하락이 나타난다.
- Fine-tuning ablation: Fine-tuning은 거의 모든 image 및 video benchmark에서 pre-fine-tuning보다 성능을 향상시키며, 가장 큰 이득은 video 태스크에 집중된다.Image 성능 향상은 일관되지만 상대적으로 작으며, fine-tuned checkpoint에 추가된 video 학습 데이터에 기인한다.
- Targeted-data ablation: 수천 단계만 추가하고 소량의 O(k) targeted in-domain data만 사용해도 해당 태스크 성능이 크게 향상되며, MSR-VTT는 76.1%에 도달한다.또한 MSR-VTT와 Vatex의 training split을 추가하면 해당 태스크 metric이 상승하지만, 제공된 텍스트에서는 Vatex 값이 잘려 있다.
6. 향후 연구
향후 연구에서는 native multimodal representation이 가능하게 하는 엔터프라이즈 애플리케이션을 위해 Gemini Embedding 2를 탐색하고, retrieval을 개선하기 위해 search system의 ranking signal을 통합한다.
- 6. 향후 연구: Native multimodal capability는 agentic RAG, video recommendation, interleaved multimodal retrieval과 같은 엔터프라이즈 활용 사례를 지원할 수 있다.이러한 애플리케이션에서는 입력을 중간 modality로 변환하지 않아도 된다.
- 6. 향후 연구: search system의 ranking 및 기타 signal을 통합하는 것은 embedding retrieval capability를 개선하는 방법으로 제안된다.
7. 결론
Gemini Embedding 2는 Gemini의 text-only embedding model을 잇는 최첨단 멀티모달 후속 모델로 제시된다. 텍스트, 이미지, 오디오, 비디오 입력을 임의로 조합해 embedding을 생성하며, 다양한 과제에 걸쳐 일반화된다.
- Gemini Embedding 2는 text-only Gemini Embedding model을 잇는 최첨단 멀티모달 후속 모델로 제시된다.
- 텍스트, 이미지, 오디오, 비디오 입력을 임의의 조합으로 교차 배치해 embedding을 생성한다.
- 이 모델은 Gemini의 멀티모달, 다국어, 코드 중심 기반을 활용해 매우 다양한 과제에 걸쳐 잘 일반화된다.
8. 전체 결과
이 절에서는 MTEB Multilingual 및 MTEB Code 벤치마크에서 Gemini Embedding 2의 전체 결과를 제시한다.
- Gemini Embedding 2의 전체 MTEB Multilingual 결과를 Table 7에 보고한다.
- Gemini Embedding 2의 전체 MTEB Code 결과를 Table 8에 보고한다.
9. 기여 및 감사의 말
이 논문은 핵심 기여자, 리더십 팀, 추가 기여자와 감사의 말을 이름별로 명시한다.
- 핵심 기여자: 핵심 기여자로는 동등한 기여를 한 것으로 표시된 Madhuri Shanbhogue와 Gustavo Hernández Ábrego가 포함되며, 더 넓은 기여자 그룹도 함께 포함된다.나머지 핵심 기여자는 기여자 명단 전반에 걸쳐 제시된다.
- 핵심 기여자: 추가 기여자로는 Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter, Vera Shen, Gao, Hesen Zhang이 제시된다.
- 리더십: 리더십 팀은 Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini로 구성된다.
- 감사의 말: 감사의 말에서는 James Gan, Jon Matthews, Luciano Martins, Patrick Löber, Anna Kelly, Kristen Quan, Roxanne Daniel, Ryan Trostle, Tania Bedrax-Weiss, Srinivasan (Cheenu) Venkatachary, Howard Zhou, Tomas Izo에게 감사를 표한다.