Source-linked AI summary
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun
TL;DR
CoT 기반 multimodal embedding은 일반 retrieval에서 중복되고 모호하며 비용이 클 수 있다. RIME은 CoT를 retrieval 친화적 rewriting으로 대체하고 generative embedding과 discriminative embedding을 정렬해, thinking length를 약 50% 줄이면서 여러 benchmark에서 기존 generative model을 능가한다.
문제
CoT 기반 multimodal embedding은 중복된 reasoning과 의미적으로 모호한 요약을 생성해 inference cost를 높이고 일반 retrieval 요구와 어긋날 수 있다.
방법
RIME은 cross-mode alignment와 discriminative embedding을 anchor로 삼는 reinforcement learning을 활용한 retrieval 친화적 rewriting으로 multimodal generation과 embedding을 공동 최적화한다.
결과
RIME은 MMEB-V2, MRMR, UVRB에서 state-of-the-art performance를 달성하면서 기존 방법 대비 thinking process를 approximately 50% 줄인다.
시사점 및 한계
Retrieval 친화적 rewriting은 더 compact하고 의미적으로 충실한 표현을 제공하면서 generative retrieval mode와 discriminative retrieval mode를 유연하게 지원한다.
시사점 및 한계
이 framework는 external reasoning model 대신 shared-parameter reasoning을 채택하므로 external-model 대안은 baseline evaluation의 범위에 포함되지 않는다.
Abstract
from arXiv · showhide
Multimodal Large Language Models (MLLMs) have emerged as a promising foundation for universal multimodal embeddings. Recent studies have shown that reasoning-driven generative multimodal embeddings can outperform discriminative embeddings on several embedding tasks. However, Chain-of-Thought (CoT) reasoning tends to generate redundant thinking steps and introduce semantic ambiguity in the summarized answers in broader retrieval scenarios. To address this limitation, we propose Rewrite-driven Multimodal Embedding (RIME), a unified framework that jointly optimizes generation and embedding through a retrieval-friendly rewrite. Meanwhile, we present the Cross-Mode Alignment (CMA) to bridge the generative and discriminative embedding spaces, enabling flexible mutual retrieval to trade off efficiency and accuracy. Based on this, we also introduce Refine Reinforcement Learning (Refine-RL) that treats discriminative embeddings as stable semantic anchors to guide the rewrite optimization. Extensive experiments on MMEB-V2, MRMR and UVRB demonstrate that RIME substantially outperforms prior generative embedding models while significantly reducing the length of thinking. Code is available at https://github.com/PeppaWu/RIME.
1 서론
Generative multimodal embedding은 semantic representation을 개선하기 위해 reasoning을 활용하지만, 불필요하거나 긴 Chain-of-Thought는 비용을 증가시키고 retrieval ambiguity를 유발할 수 있다. 제안하는 rewrite-driven paradigm은 CoT를 retrieval-friendly rewriting으로 대체하며, cross-mode alignment와 refine reinforcement learning을 통해 효율성과 embedding quality를 개선한다.
- 동기: Generative embedding은 multimodal representation learning에 중간 reasoning을 추가하여, token embedding을 직접 추출하는 discriminative model을 넘어선다 [7] [15] [21].전통적인 dual encoder는 복잡한 multimodal input과 document 및 video 같은 구조화된 visual data를 처리하는 데 어려움이 있으므로, MLLM 기반 embedding model은 일반적 해법으로 등장했다 [37] [25].
- 문제: 긴 CoT reasoning은 inference cost를 증가시키며, TTE는 external reasoner를 필요로 하고, 그 밖의 jointly trained approach도 비용이 큰 긴 reasoning을 유지한다 [6] [7] [15] [21] [30] [53].이러한 한계는 low-latency, high-throughput deployment를 어렵게 하며 retrieval-oriented alternative의 필요성을 제기한다.
- 기여: Rewrite-Driven Joint SFT는 전통적인 CoT reasoning을 image, video, document, text에 적용 가능한 modality-agnostic, task-general rewriting으로 대체한다.이 framework는 요약된 최종 답변을 생성하지 않고, recaptioning을 위해 visual input을, 추가 설명을 위해 text를 구조적으로 rewrite한다.
- 기여: Cross-mode alignment는 mutual contrastive learning을 사용하여 동일한 query에 대한 discriminative embedding과 generative embedding을 정렬하는 동시에 negative sample을 분리한다.이를 통해 embedding space 간 cross-retrieval이 가능해져 rewriting 관련 inference overhead가 감소하고 유연성이 향상된다.
- 결과: 기존 방법보다 Approximately 50% less thinking을 달성하면서 [21] [30], MMEB-V2 [17]에서 기존 연구보다 훨씬 강한 성능을 보인다.서론에서는 reasoning length 감소와 benchmark performance 향상을 함께 보고한다.
- 기여: Refine reinforcement learning은 discriminative embedding을 semantic anchor로 사용하여 더 나은 generative embedding을 향하도록 rewriting을 유도한다.이 방법은 anchor-guided rewriting을 통해 generative embedding을 정제하는 mechanism으로 제시된다.
2 관련 연구
관련 연구는 대조 학습 기반 dual encoder에서 MLLM 기반 unified embedding과 generative embedding 방법으로 발전해 왔으며, query rewriting은 query와 document 사이의 semantic gap을 연결하는 경로를 제공한다.
- CLIP [37], BLIP [25], ALIGN [14]과 같은 대조 학습 기반 dual encoder는 이기종 modality를 multimodal retrieval을 위한 unified space에 임베딩한다.이러한 방법은 vision encoder와 language model을 결합해 semantic alignment를 강화한다.
- 고정 구조 encoder는 video, multi-page document, mixed-modal content를 포함한 복잡한 입력을 충분히 모델링할 능력이 부족하다.
- MLLM [2] [3] [22] [23] [31] [39]은 instruction tuning과 contrastive learning을 통해 이기종 modality를 shared space에 투영함으로써 unified embedding learning을 가능하게 한다.대표적인 model로는 VLM2Vec [17] [35], GME [50], MM-Embed [27], LLaVE [20]가 있다.
- Generative embedding 방법은 representation quality와 복잡한 query 이해를 강화하기 위해 Chain-of-Thought (CoT) [12] [18] [41] [42]를 포함한 generation 및 intermediate reasoning step을 활용한다.
- Autoregressive generation과 embedding alignment를 공동으로 학습하면 model이 language modeling 쪽으로 편향되어 embedding discriminability를 저하시킬 수 있으며 [8] [26] [45], 이는 Think-then-Embed (TTE) [6] [7]와 같은 decoupled design의 동기가 된다.다른 연구 [21]에서는 이러한 충돌을 완화하기 위해 reinforcement learning과 reward mechanism을 탐구한다.
- Query rewriting은 user와 document 사이의 semantic gap을 연결하며, lexical feedback 방법 에서 LLM 기반 expansion, rationale generation, pseudo-document construction [34]으로 발전해 왔다.MLLM은 query decomposition과 implicit constraint inference를 포함한 semantic-level rewriting도 지원한다.
3 방법
RIME은 CoT 기반 embedding 생성을 retrieval 지향 rewriting으로 대체하고, rewrite generation과 contrastive learning을 공동 최적화한다. 또한 generative space와 discriminative space를 정렬하고, format과 retrieval separation을 유지하면서 rewrite informativeness를 높이기 위해 reinforcement learning을 사용한다.
- 사전 지식: generative embedding baseline은 external reasoning model을 사용하는 대신 reasoning model과 embedding model 사이에서 파라미터를 공유하여, 파라미터 중복과 최적화 문제를 피한다.generative embedding은 reasoning과 summary를 생성한 뒤 지정된 token의 hidden state를 사용한다.
- Rewrite-Driven Joint SFT: RIME은 CoT reasoning과 answer summarization을 multimodal query와 target의 구조화된 rewriting으로 대체하여, retrieval 요구와의 semantic mismatch를 줄인다.retrieval query에는 고유한 답이 없고 target은 요약이 필요하지 않은 경우가 많기 때문에 CoT는 중복, 부적절한 요약 granularity, semantic distortion을 유발할 수 있다.
- Rewrite-Driven Joint SFT: rewrite-driven framework는 autoregressive rewriting과 multimodal contrastive learning을 end to end로 공동 학습하며, λ는 rewrite quality와 retrieval performance 사이의 균형을 조정한다.전통적인 query rewriting과 달리 RIME은 query와 target을 모두 rewrite하여 shared rewritten semantic space에서 정렬한다.
- Cross-Mode Alignment: Cross-Mode Alignment는 generative embedding과 discriminative embedding을 하나의 semantic space로 매핑하여, inference 시 low-latency discriminative retrieval 또는 더 깊은 generative rewriting을 가능하게 한다.cross-mode loss와 intra-mode loss는 mutual retrieval을 지원하고 generative embedding이 안정적인 discriminative semantics에서 벗어나 drift하는 것을 방지한다.
- Refine Reinforcement Learning: Refine-RL은 discriminative embedding을 안정적인 anchor로 사용하고, positive–negative similarity gap을 확대하며 required format을 따르고 discriminative baseline보다 개선되는 rewrite에 보상을 부여한다.rewrite policy는 grouped sampled rewrite와 group-normalized reward를 사용하는 Group Relative Policy Optimization으로 최적화된다.
4 실험
RIME은 MMEB-V2, MRMR, UVRB 전반에서 강력한 멀티모달 검색 성능을 달성하며, rewrite 기반 접근법으로 CoT reasoning을 개선하고 CMA를 통해 유연한 embedding-mode retrieval을 지원한다. Ablation 결과 Rewrite-Driven Joint SFT, CMA, Refine-RL의 효과가 확인되었으며, rewriting은 불필요한 summarized-answer 효과를 줄인다.
- MMEB-V2: MMEB-V2에서 68.6 overall을 기록한 RIME-7B는 open-source 모델 중 최고 성능으로, UME-R1-7B를 4.1 points, VLM2Vec-7B를 16.3 points 앞선다.RIME-7B는 image tasks에서 73.4, video tasks에서 49.4, visual-document tasks에서 75.6을 기록하며, 추가 Reasoner module 없이 Think-Then-Embed와 동률이고 CAFe보다 8.0 points 높다.
- MRMR: RIME-7B는 MRMR comprehensive score에서 50.2로 최고 성능을 달성하며, UME-R1-7B를 2.2 points, Ops-MM-Embed-7B를 2.1 points, GME-7B를 14.0 points 앞선다.MRMR은 Knowledge, Theorem, Contradiction 범주에 걸친 11개의 expert-level reasoning-intensive subtask를 평가하며, 주요 metric으로 nDCG@10을 사용한다.
- Ablation studies: Rewrite-Driven Joint SFT, CMA, Refine-RL을 단계적으로 추가하면 측정 가능한 성능 향상이 나타나며, CMA는 pure discriminative retrieval을 55.8에서 56.3으로 높이고 경쟁력 있는 hybrid mode를 가능하게 한다.Gen.-Gen.은 benchmark 전반에서 평균 58.1을 기록한다. Disc.-Gen.은 query token 0개로 57.0에 도달하고, Gen.-Disc.은 query token 232개로 57.1에 도달한다.
- Rewrite versus CoT: non-RL variant에서 Rewrite는 CoT보다 4.4 points 높으며, forced summarized answer를 제거하면 CoT가 60.5로 향상되고 Rewrite는 answer-forced variant를 2.3 points 앞선다.이 결과는 chain-of-thought reasoning보다 retrieval-friendly rewriting을 지지하며, forced summarized answer가 semantic ambiguity를 유발할 수 있음을 보여준다.
- UVRB: RIME-7B는 UVRB overall 성능에서 최고를 달성하며, 16개 video-retrieval subtask 전반에서 유사한 training-data 설정하에 기존 state-of-the-art 모델을 크게 앞선다.UVRB는 주로 Recall@1을 사용하며, 다양한 task type, application domain, textual·composed·visual retrieval 설정을 포괄한다.
5 결론 · 부록 · A 데이터 구축 세부사항
RIME은 chain-of-thought reasoning을 retrieval-friendly rewriting으로 대체해 효율적이고 일반화 가능한 generative multimodal embeddings를 구축하며, 세 벤치마크 전반에서 state-of-the-art 성능을 달성한다. 부록은 query와 target을 위한 고품질 rewrite annotations가 retrieval 성능에 중요하다는 점을 강조한다.
- 5 결론: RIME은 기존 chain-of-thought reasoning을 retrieval-friendly rewriting paradigm으로 직접 대체한다.이 framework는 generative multimodal embeddings를 위해 설계됐다.
- 5 결론: RIME은 효율적이면서도 높은 일반화 성능을 갖춘 generative multimodal embeddings를 생성한다.
- 5 결론: RIME은 MMEB-V2, MRMR, UVRB 벤치마크 전반에서 state-of-the-art performance를 달성한다.
- 5 결론: RIME은 광범위한 벤치마크 성능을 유지하면서 inference overhead를 크게 줄인다.
- 5 결론: 결론에서는 제안된 framework에 여전히 일정한 한계가 있음을 인정한다.제공된 본문에서는 이러한 한계를 더 구체적으로 설명하지 않는다.
- A 데이터 구축 세부사항: query와 target 모두에 대한 rewrite annotations가 retrieval 성능을 직접 결정하므로, data construction pipeline은 RIME 학습에 중요하다.부록에서는 이 pipeline을 종합적으로 개괄한다.
A.1 학습 데이터 구성 · A.2 모달리티 인식 Rewrite 주석
RIME은 약 1.5백만 개의 멀티모달 샘플로 rewriting을 학습하고, 서로 겹치지 않는 15K 샘플에 Refine-RL을 별도로 적용한다. Modality-aware prompt는 텍스트, 이미지, 비디오, 시각 문서에 맞춘 retrieval-friendly rewrite를 생성하며, teacher가 생성한 annotation은 embedding에 맞게 표준화된다.
- A.1 학습 데이터 구성: 약 1.5백만 개의 VLM2VEC-v2 [35] 샘플을 사용해 이미지, 비디오, 시각 문서 전반에 걸쳐 Rewrite SFT를 수행한다.이미지 데이터셋은 matching, visual question answering, classification, composed image retrieval을 포함한다. 비디오 데이터는 video QA, retrieval, caption retrieval을 포함하며, 문서 데이터는 차트, 표, 논문을 포함하는 document-as-image retrieval로 구성된다.
- A.1 학습 데이터 구성: 이미지 SFT 데이터는 MSCOCO, ImageNet-1K, ChartQA, A-OKVQA, DocVQA, SUN397, Visual7W, N24News, VOC2007, HatefulMemes, VisualNews, InfographicsVQA, CIRR, VisDial, WebQA, NIGHTS, OK-VQA로 구성된다.이 데이터셋들은 image-text matching, visual question answering, image classification, composed image retrieval 시나리오를 포괄한다.
- A.1 학습 데이터 구성: 비디오 학습에는 video question answering, video-text retrieval, caption retrieval을 위한 LLaVA-Hound [48] subset이 사용된다.이 subset들은 비디오 이해 시나리오를 포괄한다.
- A.1 학습 데이터 구성: 시각 문서 학습에는 복잡한 차트, 테이블, 논문을 포함하는 document-as-image retrieval을 위해 ViDoRe [9]와 VisRAG [46]가 사용된다.이는 일반적인 이미지 및 비디오 이해를 넘어 시각적으로 렌더링된 문서까지 학습 구성을 확장한다.
- A.1 학습 데이터 구성: 별도의 Refine-RL 데이터셋에는 SFT 데이터와 겹치지 않는 이미지, 비디오, 시각 문서 예제 약 15K개를 균일하게 샘플링해 포함한다.held-out 데이터셋은 process reward를 최대화하는 rewrite를 학습하기 위한 GRPO 탐색 공간을 제공하며 일반화 평가를 지원한다.
- A.2 모달리티 인식 Rewrite 주석: 모달리티 인식 prompt는 입력 모달리티와 task type에 따라 retrieval-friendly description을 유도한다 [34].텍스트의 경우 rewriting을 통해 텍스트 유형을 식별하고, 모호성을 해소하며, 논리적 관계를 추출하고, 간결하게 요약한다. 이미지의 경우 대상, 동작, 장면을 재구성한다.
- A.2 모달리티 인식 Rewrite 주석: 비디오 rewrite는 장면 전환, temporal progression, key frame, event node, 시간순서를 포착하며, video VQA rewrite는 프레임 전반의 temporal dynamics, 복수 사건, 대화 또는 텍스트를 처리한다.이 비디오 전략은 이미지 VQA 접근법을 확장해 시간 구조와 다중 사건 콘텐츠를 명시적으로 표현한다.
- A.2 모달리티 인식 Rewrite 주석: Qwen2-VL-72B-Instruct [39]가 비동기적으로 rewrite 주석을 생성하며, 이를 후처리해 표준화된 embedding-ready output으로 변환한다.생성에 실패한 결과는 필터링하고, 콘텐츠는 <think>...</think> tag로 감싸며, 표준 answer format은 “All can be embedded into <gen_emb>.”로 끝난다.
B 추가 실험 결과
이 절에서는 MR2-Bench 성능과 Rewrite SFT loss hyperparameter의 효과를 포함해 여러 평가 차원에서 RIME을 심층 분석하는 추가 실험을 제시한다.
- MR2-Bench 결과: Table 8은 12개 주제별 subtask에 걸쳐 nDCG@10을 사용해 MR2-Bench에서 RIME을 평가하고 평균 점수를 보고한다.subtask는 Biology, Cooking, Gardening, Physics, Chemistry, Earth Science, Economics, Mathematics, Nature, Spatial, Puzzle, Analogy를 포괄한다.
- Hyperparameter Ablation: Table 9는 MMEB-V2의 평균 점수를 사용해 Rewrite SFT의 joint loss에서 λ의 효과를 분석한다.이 실험은 Rewrite SFT loss hyperparameter에 대한 ablation이다.
B.1 하이퍼파라미터 𝜆에 대한 Ablation
MMEB-V2에서 λ를 Ablation한 결과, rewrite generation에 대한 가중치를 높일수록 전체 retrieval 성능이 향상되며 64.1의 최적 점수에 도달한다.
- B.1 하이퍼파라미터 λ에 대한 Ablation: 전체 성능은 λ=0.1에서 59.7, λ=0.5에서 61.1로 상승하며, λ가 증가함에 따라 64.1의 최적 점수에 도달한다.Joint-loss 가중치 λ는 rewrite generation 품질과 retrieval 성능 간의 trade-off를 조절한다. Rewrite에 대한 가중치가 충분하지 않으면 semantic understanding이 최적 수준에 이르지 못한다.
B.2 MR2-Bench 결과
MR2-Bench에서 RIME-7B는 28.6의 종합 점수를 달성해 UME-R1을 앞서고 Seed-1.6-embed에 근접한다. 가장 큰 향상은 reasoning-intensive sub-task에서 나타나며, Puzzle은 모든 모델에 여전히 어려운 과제로 남는다.
- B.2 MR2-Bench 결과: 28.6: RIME-7B는 28.6의 종합 MR2-Bench 점수를 달성해 UME-R1 (27.5)을 앞서고 Seed-1.6-embed (30.7)에 근접한다.MR2-Bench는 Multimodal Knowledge Retrieval, Visual Illustration, Visual Relation의 12개 sub-task에 걸쳐 multimodal reasoning-intensive retrieval을 평가한다.
- B.2 MR2-Bench 결과: 64.2 vs. 55.7: RIME는 Economics에서 UME-R1보다 8.5 points 향상되며, Spatial reasoning에서도 2.7 points (40.4 vs. 37.7), Analogy에서도 2.9 points (15.1 vs. 12.2)의 추가 향상을 보인다.이는 reasoning-intensive sub-task에서 나타난 주목할 만한 향상이다.
- B.2 MR2-Bench 결과: Near-zero scores: Puzzle은 모든 모델에서 여전히 어려운 과제로, 점수가 0에 가깝다.Puzzle은 MR2-Bench의 Visual Relation sub-task 중 하나다.
B.3 MMEB-V2/UVRB 상세 결과
이 절에서는 이미지, 비디오, 시각 문서 modality에 걸친 78개 하위 과제를 포함하여 MMEB-v2 [17] [35]의 과제별 종합 평가 결과를 보고한다. 상세 결과는 재현성 확보, 세밀한 분석, 향후 비교를 지원하기 위해 제시한다.
C 데이터 구성 예시
이 절에서는 modality-aware rewriting이 텍스트, 이미지, 시각적 질의응답 입력을 retrieval-friendly representation으로 변환하는 방식을 보여준다. 예시는 다양한 입력 modality와 task에 걸쳐 구조화된 분석, multiple rewrite, 요약된 embedding을 사용한다.
- 데이터 구성 예시: Modality-aware rewriting은 텍스트, 이미지, 동영상 및 이들의 조합을 아우르는 예시를 통해 multimodal input을 retrieval-friendly representation으로 변환한다.이 절에서는 다양한 입력 modality에 걸친 데이터 구성 예시를 제시하고 Figures 6–10을 참조한다.
- Text-to-Rewrite: Text rewriting은 input type을 분석하고, input과 rewrite를 embedding하기 전에 의미를 보존하는 변환을 최대 세 개 생성한 뒤 이를 요약한다.Text-analysis prompt는 단일 단어, 관습적인 문장 또는 문단, 분야별 전문 텍스트를 구분하며, 예시에서는 caption을 세 가지 방식으로 rewrite한다.
- Image-to-Rewrite: Image-to-rewrite processing은 먼저 정보 밀도에 따라 이미지를 분류한 다음, 시각적 내용을 설명하고 embedding을 위해 질문에 답하거나 장면을 요약한다.VQA prompt는 high-information image와 low-information image를 구분하고 이미지 평가, 내용 분석, 질의응답을 구조화한다.
- Task Coverage: 예시는 caption retrieval, 컴퓨터 개수 세기, 인포그래픽 질의응답, 이미지 분류, Llavahound caption retrieval을 포함해 다양한 retrieval 및 이해 task를 다룬다.구체적인 사례로는 고양이 caption 이미지 질의, 컴퓨터 세 대가 포함된 이미지, 회복 비율 질문, toyshop 분류, Llavahound_Caption_Retrieval이 있다.