Source-linked AI summary
UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval
Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang
TL;DR
Universal multimodal retrieval은 효율적인 corpus-scale matching과 fine-grained reasoning을 결합해야 하지만, item-wise CoT는 positive와 hard negative를 구분하는 명시적 근거가 부족하다. UMER는 pair-aware discriminative ranking과 contrastive embeddings를 mutual distillation으로 공동 학습해, MMEB-V2에서 65.5의 overall score를 달성하고 RIME보다 1.4 points 앞선다.
문제
기존 item-wise CoT는 query–candidate 상호작용을 모델링하거나 positive가 왜 match되고 hard negative가 왜 실패하는지 설명하지 못해, retrieval에 필요한 discriminative evidence를 제한한다.
방법
UMER는 Pair-Aware Discriminative Reasoning을 사용해 독립적으로 index할 수 있는 embeddings와 pairwise ranking을 공동 학습하며, 둘 사이에 상호 보완적인 mutual distillation을 적용한다.
결과
overall 65.5, RIME보다 1.4 points 높음: UMER-H가 overall MMEB-V2 score에서 최고 성능을 달성한다.
핵심 요점 및 한계
UMER는 universal multimodal retrieval을 위해 효율적인 vector retrieval과 명시적인 reasoning-based ranking을 결합한다.
핵심 요점 및 한계
명시적인 CoT reasoning은 각 embedding 전에 rationale을 생성해야 하므로 substantial decoding cost를 유발한다.
Abstract
from arXiv · showhide
Universal multimodal retrieval aims to support diverse instruction-aware retrieval tasks, demanding both efficient corpus-scale matching and fine-grained semantic reasoning. Recent MLLM-based embedding methods typically derive representations from hidden states, while Chain-of-Thought (CoT) reasoning is emerging as a promising strategy for embedding enhancement by encoding intermediate semantic evidence into the representation space. However, existing CoT methods typically use item-wise reasoning over queries and candidates in isolation, providing no explicit evidence to distinguish a positive from a semantically confusable hard negative. Moreover, contrastive embeddings capture global similarity but struggle with meta-tasks requiring answer verification, category judgment or fine-grained reasoning. In this paper, we propose UMER, a Unified Multimodal Embedding and Ranking framework for universal multimodal retrieval. UMER replaces item-wise reflection with Pair-Aware Discriminative Reasoning, which compares query--candidate pairs to identify instruction-relevant matching and discrepancy evidence. UMER jointly learns contrastive embeddings for efficient global matching and discriminative ranking for explicit pairwise relevance judgment within a single MLLM. A complementary mutual distillation strategy further transfers reliable pairwise preferences between the embedding and ranking functions. On the MMEB-V2 benchmark, UMER achieves state-of-the-art performance under comparable experimental settings while supporting budget-adjustable inference.
서론
Universal multimodal retrieval은 이기종 미디어와 instruction-aware task 전반에서 효율적인 shared-space matching과 추론 중심 relevance judgment를 결합한다. UMER는 pair-aware discriminative reasoning과 embedding 및 ranking을 공동 학습하는 통합 framework를 통해 이 간극을 해소하며, inference cost를 조절할 수 있다.
- 서론: Universal multimodal retrieval은 images, texts, videos, documents 전반의 instruction-aware task를 대상으로 하며, 이기종 입력을 shared embedding space로 인코딩한다.MLLM-based method는 이 설정을 확장하고, CoT-based approach는 textual rationale과 intermediate reasoning의 영향을 받은 hidden state에서 embedding을 도출한다.
- 서론: 기존 item-wise CoT는 semantic하게 혼동하기 쉬운 hard negative에서 positive를 구별할 pair-aware evidence가 부족한 반면, embedding과 ranking은 상호 보완적인 능력을 제공한다.Figure 1은 이를 universal multimodal retrieval에서 간과된 문제로 제시한다.
- 서론: UMER는 하나의 MLLM에서 multimodal embedding과 discriminative ranking을 공동 학습하여 이기종 universal retrieval 요구를 지원한다.이 framework는 contrastive embedding learning과 discriminative ranking을 결합하며, complementary mutual distillation을 통해 두 function 사이에서 지식을 전달한다.
- 서론: Pair-Aware Discriminative CoT는 positive와 hard-negative query–candidate pair를 비교하여 matching 및 discrepancy evidence를 식별하고 결정적인 ranking judgment를 생성한다.이는 독립적인 item-wise reflection을 명시적인 pairwise comparison으로 대체하여 representation learning에 활용한다.
- 서론: UMER는 budget-adjustable inference를 지원하며, 효율적인 retrieval을 위해 one-pass embedding과 vector indexing을 사용하거나 accuracy-oriented 및 hard-sample 설정을 위해 pair-aware CoT ranking을 추가한다.Embedding-then-CoT-Ranking pipeline은 inference budget에 따라 staged computation을 가능하게 한다.
관련 연구
기존 연구는 instruction-aware multimodal embedder, reasoning-enhanced representation, pairwise reranker를 아우르지만, 효율성이나 통합 측면에서 공백이 남아 있다. UMER는 하나의 end-to-end 최적화 MLLM 안에서 embedding, pair-aware reasoning, ranking을 통합해 이 공백을 해소한다.
- Universal Multimodal Embedding: Universal multimodal embedding은 dual encoder에서 출발해, MMEB benchmark에서 contrastive 학습된 instruction-following MLLM 기반 embedder로 발전했다.이러한 발전에는 CLIP, ALIGN, SigLIP (Radford et al. 2021; Jia et al. 2021; Zhai et al. 2023)가 포함되며, 이후 VLM2Vec (Jiang et al. 2024b)과 VLM2Vec-V2 (Meng et al. 2025)가 등장했다.
- Reasoning-Enhanced Embedding: Reasoning-enhanced embedder는 representation을 추출하기 전에 중간 rationale을 인코딩하지만, 명시적 decoding은 모든 embedding에 상당한 비용을 추가한다.UME-R1 (Lan et al. 2026)은 rationale을 autoregressive하게 생성하고, Embed-RL (Jiang et al. 2026)은 retrieval-oriented reinforcement learning으로 이를 최적화하며, PLUME (He et al. 2026)과 LaME (Wu et al. 2026b) 같은 latent 접근법은 이러한 overhead를 줄인다.
- MLLM Reranking: MLLM reranker는 fine-grained relevance estimation을 위해 query–candidate pair를 jointly encode하지만, 일반적으로 별도의 second-stage module로 구성된다.RagVL (Chen et al. 2024), UniME-V2-Reranker (Gu et al. 2026), Qwen3-VL-Reranker (Li et al. 2026) 등이 그 예다.
- UMER의 통합: UMER는 단일 MLLM 안에서 embedding, Pair-Aware Discriminative Reasoning, ranking을 통합해, discrete offline knowledge transfer 대신 shared-backbone end-to-end 공동 최적화를 가능하게 한다.기존 reranker는 soft label이나 mined pseudo-negative를 통해 ranking 지식을 embedding으로 전달하는 반면, UMER는 두 branch를 jointly optimize한다.
방법론
UMER는 하나의 공유 MLLM 내에서 코퍼스 규모 검색을 위한 독립적으로 계산 가능한 embedding과 명시적 관련성 검증을 위한 pair-aware ranking을 공동 학습한다. contrastive hard-negative learning, 구조화된 evidence-grounded reasoning, 선택적 cross-capability distillation, 단계적 최적화를 결합한다.
- 방법 개요: UMER는 검색과 검증을 위해 공유 MLLM을 사용해 독립적으로 계산 가능한 embedding function과 pair-aware ranking function을 공동 학습한다.embedding은 코퍼스 규모의 candidate retrieval을 지원하고, ranking은 query–candidate 관련성을 명시적으로 검증한다.
- Embedding encoding 단계: Contrastive learning은 learnable aggregation token, in-batch candidate, mined hard negative를 사용해 query와 candidate를 독립적으로 index할 수 있는 공유 metric space로 매핑한다.Branch-wise attention은 retrieval 시 사용할 수 없는 cross-item 정보가 embedding에 유입되는 것을 방지한다.
- Pair-aware reasoning 및 ranking 단계: Pair-aware discriminative CoT는 각 query–candidate pair를 비교하고, 공동으로 관측 가능한 evidence에 reasoning을 근거시키며, rationale-conditioned representation을 binary 및 pairwise ranking loss에 입력한다.목적 함수는 pair-conditioned evidence, absolute relevance, 그리고 hard negative보다 높은 positive logit을 감독한다.
- Supervision 구성: Verified training triplet은 frozen embedder를 이용한 hard-negative mining, 구조화된 Query Intent 및 Target Observations CoT, 그리고 두 pair rationale에 대한 text-only verification을 결합한다.verifier가 positive와 대응하는 hard-negative CoT 모두에서 ground-truth Yes/No label을 정확히 추론할 때만 triplet을 유지한다.
- Mutual distillation 및 학습: Selective bidirectional CMD는 content-matching task에서는 embedding preference를 ranking으로, reasoning-intensive task에서는 ranking preference를 embedding으로 전달해 상호보완적 역할을 유지한다.UMER는 단계적으로 학습한다. 먼저 embedding을 학습하고, 다음으로 verified-pair reasoning과 ranking을 학습한 뒤, frozen reference model에서 cross-capability distillation을 수행한다.
실험 및 결과
UMER는 modality-specific retrieval metric을 사용해 78-task MMEB-V2 benchmark에서 평가되며, 전체 및 modality 수준에서 강력한 성능을 달성한다. Ablation 결과는 embedding과 ranking의 상호보완적 역량을 보여주며, mutual distillation과 조정 가능한 reranking은 역량 전이와 효율성을 향상한다.
- 주요 결과: UMER-H는 전체 MMEB-V2 score 65.5로 최고 성능을 달성하며, Image (70.4), Video (45.0), VisDoc (73.6)에서 modality 수준 최고 성능을 보인다.MMEB-V2는 image, video, visual-document domain에 걸친 78개 task로 구성되며, classification, question answering, retrieval, grounding, moment retrieval을 포함한다.
- Pair-aware reasoning과 ranking: Pair-aware CoT는 UMER-E를 62.9까지 향상하고, ranking supervision은 hybrid 성능을 65.0까지 높이며, 두 메커니즘을 결합하면 unified system이 더욱 향상된다.Pair-aware CoT는 embedding space를 직접 개선하는 반면, ranking loss는 효과적인 pairwise supervision을 제공한다. 다만 CoT만 사용할 경우 [RANK] head는 여전히 calibration되지 않는다.
- 상호보완적 mutual distillation: Selective bidirectional distillation은 UMER-E와 UMER-R을 각각 63.1과 63.9까지 향상하며, 잘못된 teacher와의 일치를 강제하지 않기 때문에 unconditional bidirectional transfer를 능가한다.One-way transfer는 의도한 branch를 향상하지만, unconditional bidirectional transfer는 62.6 / 63.6에서 이점의 일부만 포착한다.
- 역량 specialization과 transfer: Embedding은 content-matching retrieval과 grounding에서 뛰어난 반면, ranking은 reasoning-intensive classification과 question answering에서 더 강하다.이러한 capability split은 서로 다른 inductive bias를 반영하며, 상호보완적 mutual distillation은 각 specialization을 붕괴시키지 않고 task group 전반에서 두 function을 모두 향상한다.
- 효율성과 budget-adjustable inference: UMER-E는 reasoning token을 0개 사용하면서 63.1을 달성하고, query/indexing에서 UME-R1 대비 118.6×/99.6×, PLUME 대비 3.9×/3.1×의 speedup을 제공한다.UMER-H는 UMER-E index를 재사용하며, reranking K를 3에서 20으로 늘리면 score가 64.8에서 66.1로 상승한다. default K = 5는 K = 20 latency의 24%에서 65.5를 달성한다.
결론
UMER는 Pair-Aware Discriminative Reasoning을 통해 query–candidate pair를 명시적으로 비교함으로써 universal multimodal retrieval을 위한 multimodal embedding과 ranking을 통합한다. 하나의 shared MLLM이 독립적으로 index할 수 있는 embedding, pair-aware CoT generation, discriminative ranking을 공동 학습한다.
- UMER는 universal multimodal retrieval을 위한 통합 multimodal embedding 및 ranking framework를 제시한다.
- Pair-Aware Discriminative Reasoning은 query와 candidate를 비교해 matching 또는 discrepancy evidence를 식별하며, item-wise CoT의 제한적인 discriminative supervision 문제를 해결한다.
- 하나의 shared MLLM이 독립적으로 index할 수 있는 embedding, pair-aware CoT generation, discriminative ranking을 공동 학습한다.
보충 자료 · 구현 및 평가 세부 사항
보충 자료의 구현 및 평가 세부 사항은 멀티모달 학습 데이터, 엄선된 positive, 검색된 hard negative, 오프라인에서 감사된 pair-aware CoT target을 포함한 UMER의 전체 설정을 종합한다.
- 구현 및 평가 세부 사항: 학습 혼합 데이터는 image, video, visual-document source로 구성된다.
- 구현 및 평가 세부 사항: 사용 가능한 경우 엄선된 positive가 raw target을 대체한다.
- 구현 및 평가 세부 사항: 각 학습 인스턴스는 검색된 hard negative와 쌍을 이룬다.
- 구현 및 평가 세부 사항: 검색된 hard negative는 contrastive learning과 pairwise learning 모두에 대한 supervision을 제공한다.
- 구현 및 평가 세부 사항: pair-aware CoT target은 학습 전에 오프라인에서 생성되고 감사된다.
- 구현 및 평가 세부 사항: UMER의 전체 구현 및 평가 설정은 Table 1에 종합되어 있다.
Pair-Aware CoT 데이터 구축
Pair-aware CoT 데이터 파이프라인은 query–positive 및 hard-negative pair에서 supervision을 구축하고, label을 공개하지 않은 채 각 pair에 대한 구조화된 evidence를 생성한다. 이후 생성된 note를 text-only 방식으로 감사하여 schema validity, label agreement, decision leakage를 점검한다.
- 개요: Pair-aware rationale은 각 query를 relevant target 및 그럴듯한 distractor와 비교하여, query만 설명하는 대신 label된 target을 구별하는 세부 정보를 모델에 학습시킨다.파이프라인은 의미적으로 가까우면서 relevant하지 않은 candidate를 확보하고, positive pair와 negative pair에 대해 별도의 rationale을 생성한다.
- Stage 1: hard-negative mining: Hard-negative mining은 annotation된 positive를 mask하고, cosine similarity로 source-local gallery를 검색하며, 누락되었을 가능성이 높은 positive를 필터링한 뒤 candidate를 최대 3개까지 유지한다.검토된 non-relevant candidate를 사용할 수 있으면 이를 우선하고, 그렇지 않으면 embedding으로 mining한 pool을 fallback으로 사용한다.
- Stage 2: structured CoT generation: Qwen3.5-9B는 각 pair를 독립적으로 annotation하여 query intent와 target observations를 기록하고, match decision은 내리지 않은 채 두드러진 overlap, 누락된 evidence 또는 conflict를 남긴다.구조화된 output은 두 field를 사용하며, relevant entity, attribute, action, relation 또는 text cue를 중립적인 표현으로 포함한다.
- Stage 3: text-only evidence verification: Qwen3.5-0.8B auditor는 생성된 field만 사용해 note를 검증하며, prediction이 label과 일치하고 schema가 valid하며 decision이 leak되지 않을 때만 trace를 수용한다.verifier는 match, not_match 또는 unknown을 반환하고, 구체적인 supporting observation 또는 conflict를 요구한다. 네 개의 sidecar에는 6,632,206개의 canonical pair record가 포함된다.
전체 MMEB-V2 결과
전체 78-task MMEB-V2 평가에서 UMER-H는 Qwen2-VL-2B에서 보고된 평균 중 최고 성능을 기록했으며, 동일한 K = 5 hybrid configuration에서 Qwen2-VL-7B로도 강력한 결과를 달성한다.
- Qwen2-VL-2B: overall 65.5, image 70.4, video 45.0, visual-document average 73.6으로 UMER-H가 overall 최고 성능을 기록하며 RIME보다 1.4 points 앞선다.이 결과는 Qwen2-VL-2B 모델의 모든 MMEB-V2 task를 포괄한다.
- 평가 범위: 전체 비교는 78 tasks를 보고하며, image와 video에는 Hit@1을, visual-document retrieval에는 NDCG@5를 사용한다.Baselines는 해당 parameter scale에서 task-level 결과가 공개된 모델로 제한한다.
- Qwen2-VL-7B: 동일한 K = 5 hybrid configuration에서 UMER-H는 overall 70.6과 image/video/visual-document task에서 각각 74.3/50.5/80.0을 달성한다.비교 대상은 78-task breakdown이 공개된 Qwen2-VL-7B 모델이다.
추가 추론 분석
추가 추론 분석은 embedding retrieval과 pair-aware ranking이 상호보완적인 판단 신호를 제공하며, hybrid inference가 폭넓은 ranking weight 범위에서 안정적임을 보여준다. 따라서 기본 fusion 설정은 재학습 없이 두 branch를 결합하는 이점을 얻는다.
- Weight 민감도: 65.5는 UMER-H 점수의 최고값이며, 고정된 candidates, normalization, decoding 조건에서 모든 ranking-score weight 0.5–5.0은 이 값과의 차이가 0.8점 이내로 유지된다.기본 hybrid mode는 ranking-score weight 2.0을 할당한다. 더 큰 weight에서는 소폭 하락이 나타나므로, 어느 branch도 모든 query에서 우세해서는 안 됨을 보여준다.
- 판단 overlap: Overlap 분석은 동일한 83,530 MMEB-V2 queries에 대해 변경하지 않은 candidates와 evaluation을 사용하여 두 branch를 비교하고, Both, E only, R only, Neither 결과를 구분한다.서로 다른 실패 양상을 보존하기 위해 reasoning/semantic 및 content-matching 쿼리 family별로 백분율을 별도로 보고한다.
- 판단 overlap: queries의 10.3%는 pair-aware ranking을 사용할 때만 정답이고 9.0%는 embedding retrieval을 사용할 때만 정답인 반면, 47.2%는 두 방식 모두로 해결되어 상호보완적인 branch임을 보여준다.83,530 MMEB-V2 queries 전반에서 어느 branch도 일관되게 우세하지 않으며, ranking-only 성공률은 reasoning/semantic queries에서 12.1%로 embedding-only의 9.0%보다 높다. 반면 content-matching exclusives는 각각 8.9%와 8.3%다.
정성적 결과와 실패 사례
정성적 사례는 pair-aware ranking이 세밀한 구성, 속성, 시각적 은유 제약을 적용해 embedding 오류를 교정함을 보여준다. 공간 관계 사례에서는 전경의 두드러짐이 요청된 배경 관계를 덮어써 ranking이 회귀하는 현상이 드러난다.
- 교정: 사례 1–3은 pair-aware ranking이 정확한 구성, 속성, 시각적 또는 문서 수준 제약에 대한 근거를 우선시해 embedding retrieval을 교정함을 보여준다.관련 candidate는 이미 검색되었지만, embedding similarity가 넓은 범주 또는 주제 단서를 과도하게 강조했다.
- 사례 2: 속성에 민감한 구성 retrieval: Rank 4에서 rank 1로: ranking은 두 마리의 가오리 같은 동물이 있고 사람이 없는 시각적으로 유사한 수중 이미지를, 결합 제약을 만족하는 이미지로 대체한다.embedding의 최상위 결과는 장면은 유지했지만, 요청된 종과 사람 없음 조건을 위반했다.
- 사례 3: 시각적 은유 문서 retrieval: Rank 3에서 rank 1로: ranking은 관련 동영상 슬라이드를, 데이터를 맹목적으로 따르는 결과를 보여주는 요청된 자동차 침몰 은유로 대체한다.상향된 슬라이드는 물속 자동차 아이콘과 명시된 은유를 결합하는 반면, embedding 결과는 넓은 주제만 공유한다.
- 사례 4: 공간 관계 ranking 회귀: ranking은 올바른 candidate가 여전히 top-2에 있음에도, 빨간색 오토바이 뒤에 있는 요청된 오토바이 대신 전경의 오토바이를 우선시해 regresses한다.Candidate별 reasoning이 전경의 두드러짐에 집중하면서 질의의 뒤/오른쪽 공간 관계를 보존하지 못한다.