Source-linked AI summary

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

arXiv:2608.18504v1cs.AI

TL;DR

Universal multimodal retrieval에는 효율적인 corpus-scale 매칭과 세밀한 pairwise reasoning이 모두 필요하지만, 기존 item-wise reasoning은 positive와 hard negative를 구분하지 못한다. UMER는 pair-aware discriminative reasoning, 공동 학습한 embedding 및 ranking function, mutual distillation으로 이를 해결하며, 최고 종합 점수 65.5로 MMEB-V2에서 state-of-the-art 성능을 달성한다.

  • 문제

    기존 item-wise CoT와 contrastive embedding은 hard negative를 구분하고 verification, classification, fine-grained reasoning을 처리하기 위한 명시적인 query–candidate evidence가 부족하다.

  • 방법

    UMER는 독립적으로 index할 수 있는 contrastive embedding과 pair-aware discriminative ranking을 공동 학습하며, 두 function 사이에 mutual distillation을 적용한다.

  • 결과

    UMER는 MMEB-V2에서 state-of-the-art 성능을 달성하며, 최고 종합 점수 65.5와 embedding 및 ranking 중심 task 전반에서 상호보완적인 강점을 보인다.

  • 시사점 및 한계

    UMER는 universal multimodal retrieval을 위해 명시적인 reasoning-based ranking과 함께 효율적인 vector retrieval을 지원한다.

  • 시사점 및 한계

    Pair-aware ranking은 query의 relation을 보존하기보다 foreground salience에 집중하면서 spatial relations에서 성능이 저하될 수 있다.

Abstract

from arXiv · show

Universal multimodal retrieval aims to support diverse instruction-aware retrieval tasks, demanding both efficient corpus-scale matching and fine-grained semantic reasoning. Recent MLLM-based embedding methods typically derive representations from hidden states, while Chain-of-Thought (CoT) reasoning is emerging as a promising strategy for embedding enhancement by encoding intermediate semantic evidence into the representation space. However, existing CoT methods typically use item-wise reasoning over queries and candidates in isolation, providing no explicit evidence to distinguish a positive from a semantically confusable hard negative. Moreover, contrastive embeddings capture global similarity but struggle with meta-tasks requiring answer verification, category judgment or fine-grained reasoning. In this paper, we propose UMER, a Unified Multimodal Embedding and Ranking framework for universal multimodal retrieval. UMER replaces item-wise reflection with Pair-Aware Discriminative Reasoning, which compares query--candidate pairs to identify instruction-relevant matching and discrepancy evidence. UMER jointly learns contrastive embeddings for efficient global matching and discriminative ranking for explicit pairwise relevance judgment within a single MLLM. A complementary mutual distillation strategy further transfers reliable pairwise preferences between the embedding and ranking functions. On the MMEB-V2 benchmark, UMER achieves state-of-the-art performance under comparable experimental settings while supporting budget-adjustable inference.

서론

Universal multimodal retrieval은 서로 다른 modality와 instruction-aware task 전반에서 효율적인 shared-space matching과 추론이 필요한 relevance judgment를 결합해야 한다. UMER는 Pair-Aware Discriminative Reasoning, 공동 학습한 embedding·ranking function, mutual distillation, budget-adjustable inference로 이 간극을 해소한다.

  • 배경: Universal multimodal retrieval은 image, text, video, document를 아우르며, 대규모 corpus에 대한 shared-space retrieval과 세밀한 instruction-aware relevance judgment를 모두 요구한다.MLLM 기반 방법은 복잡한 instruction-aware retrieval을 다루며, CoT에서 도출한 hidden state는 중간 추론을 representation에 반영한다.
  • 동기와 기여: UMER는 item-wise CoT를 Pair-Aware Discriminative Reasoning으로 대체하며, positive에는 matching evidence를, hard negative에는 discrepancy evidence를 사용해 query–candidate pair를 비교한다.이 패러다임은 positive pair와 hard-negative pair를 추론 입력으로 받아 결정적인 ranking judgment를 생성한다.
  • Framework: UMER는 하나의 MLLM에서 contrastive multimodal embedding과 discriminative ranking을 공동 학습해 서로 다른 retrieval meta-task에 필요한 상호보완적 역량을 지향한다.이 framework는 heterogeneous universal multimodal retrieval 요구사항을 위해 설계되며, embedding과 ranking이 상호보완적 역할을 수행한다.
  • Framework: 상호보완적인 mutual distillation을 통해 ranking branch는 embedding space를 정교화하고, embedding branch는 global semantic structure로 ranking을 안정화한다.이 기여는 embedding function과 ranking function 사이에서 knowledge를 명시적으로 전달한다.
  • 추론: UMER는 budget-adjustable inference를 지원한다. embedding-only vector indexing은 대규모 retrieval을 효율화하고, 추가적인 pair-aware CoT ranking은 정확도 중심 또는 hard-sample setting을 대상으로 한다.이 pipeline은 Embedding-then-CoT-Ranking으로 구성되며, 더 높은 discrimination이 필요할 때 relevance score를 추가한다.

관련 연구

관련 연구는 instruction-aware MLLM 임베더, reasoning-enhanced representation, multimodal reranker를 아우른다. UMER는 embedding, pair-aware reasoning, ranking을 하나의 end-to-end 공동 최적화 MLLM으로 통합해 이들의 분리와 효율성 한계를 해결한다.

  • Universal Multimodal Embedding: Universal multimodal embedding은 CLIP, ALIGN, SigLIP과 같은 dual encoder에서 instruction-aware MLLM encoder로 발전해 왔다 (Radford et al. 2021; Jia et al. 2021; Zhai et al. 2023).VLM2Vec (Jiang et al. 2024b)와 VLM2Vec-V2 (Meng et al. 2025)는 MMEB와 MMEB-V2에서 contrastive training을 사용하며, UniME-V2 (Gu et al. 2026)는 hard-negative mining을 통해 판별력을 높인다.
  • Reasoning-Enhanced Embedding: Reasoning-enhanced embedder는 representation을 추출하기 전에 중간 rationale을 생성하지만, explicit CoT는 각 embedding 전에 decoding cost를 발생시킨다.UME-R1 (Lan et al. 2026)는 autoregressive rationale generation 후 representation을 도출하고, Embed-RL (Jiang et al. 2026)은 retrieval-oriented reward로 rationale을 최적화하며, PLUME (He et al. 2026)과 LaME (Wu et al. 2026b)는 latent reasoning을 사용해 overhead를 줄인다.
  • MLLM Rerankers: Multimodal reranker는 세밀한 relevance estimation을 위해 query–candidate pair를 함께 encode하며, RagVL (Chen et al. 2024), UniME-V2-Reranker (Gu et al. 2026), Qwen3-VL-Reranker (Li et al. 2026) 등이 이에 해당한다.이러한 모델은 대체로 별도의 second-stage module이므로, ranking 지식은 offline soft label이나 mined pseudo-negative를 통해 embedding으로 전달된다.
  • Unified Framework: UMER는 하나의 MLLM 안에서 embedding, Pair-Aware Discriminative Reasoning, ranking을 통합하고, backbone을 공유하며 end-to-end 공동 최적화를 가능하게 한다.이 설계는 별도의 reranking module과 이산적인 knowledge transfer를 공동 최적화된 embedding branch와 ranking branch로 대체한다.

방법론

UMER는 하나의 공유 MLLM 안에서 corpus-scale retrieval을 위한 독립적으로 계산 가능한 embedding과 명시적 relevance verification을 위한 pair-aware ranking을 공동 학습한다. contrastive learning, discriminative pair reasoning, 검증된 hard-negative supervision, selective mutual distillation, staged training을 결합한다.

  • 방법 개요: UMER는 공유 MLLM을 사용해 corpus-scale candidate retrieval을 위한 독립적으로 계산 가능한 embedding과 명시적 verification을 위한 pair-aware ranking을 함께 학습한다.Embedding function과 ranking function은 backbone을 공유하면서 상호 보완적인 retrieval 역할을 수행한다.
  • Embedding encoding 단계: 학습 가능한 query 및 candidate embedding token은 고정 차원 representation을 형성하며, in-batch contrastive learning과 mined hard negative를 사용해 독립적인 corpus indexing을 학습한다.Branch별 attention mask는 retrieval 시점에 embedding이 사용할 수 없는 cross-item 정보를 이용하지 못하게 한다.
  • Pair-aware reasoning 및 ranking 단계: Pair-aware discriminative CoT는 query–candidate evidence를 함께 드러내고, rationale-conditioned [RANK] token은 relevance를 예측해 positive를 hard negative보다 높은 순위에 배치한다.Loss는 pair-conditioned evidence, absolute relevance label, positive-over-negative logit ordering을 감독한다.
  • Supervision 구성: Training data는 hard-negative mining, Query Intent와 Target Observations를 포함한 structured CoT, 그리고 evidence-sufficient positive–negative triplet만 유지하는 verifier filtering을 사용해 구성한다.Text-only verifier는 양쪽의 대응하는 pair rationale로부터 ground-truth Yes/No relevance label을 추론해야 한다.
  • Mutual distillation: Selective bidirectional CMD는 content-matching task에서 embedding preference를 ranking으로, reasoning-intensive meta-task에서 ranking preference를 embedding으로 전달한다.Retrieval과 Grounding/MR은 embedding supervision을 선호하고, Classification과 나머지 reasoning-intensive task는 ranking supervision을 선호한다.
  • Training 및 inference: Three-stage training은 먼저 embedding을 안정화한 뒤 verified pair-aware reasoning 및 ranking objective를 추가하고, 마지막으로 capability 간 preference를 distill한다.Hybrid score는 normalized embedding distance와 normalized ranking distance를 α로 가중해 결합한다.

실험 및 결과

UMER는 78개 task로 구성된 MMEB-V2 benchmark에서 공식 modality-specific metric을 사용해 평가되며, hybrid UMER-H configuration에서 가장 강력한 overall performance를 달성한다. Ablation과 efficiency study는 embedding과 ranking의 상호보완적 capability, selective mutual distillation의 이점, budget-adjustable inference를 보여준다.

  • Capability specialization: Embedding은 global content-matching retrieval과 grounding에서 더 강하고, ranking은 reasoning-intensive classification과 question answering에서 더 강하다.이러한 task-dependent specialization은 UMER-H에서 두 scoring function을 결합하는 근거가 된다.
  • Pair-aware reasoning and ranking: Pair-aware CoT는 UMER-E를 62.9까지 높이며, ranking supervision만으로도 UMER-E가 60.7에서 62.0으로 상승하고 hybrid mode에서는 65.0을 달성한다.Pair-aware reasoning은 embedding space에 이점을 주는 반면, ranking supervision은 UMER-R을 개선하기 전에 ranking head의 calibration을 필요로 한다.
  • Complementary mutual distillation: Selective bidirectional mutual distillation은 UMER-E와 UMER-R을 각각 63.1과 63.9로 향상시키지만, unconditional bidirectional transfer는 62.6과 63.6에 그친다.One-way transfer는 의도한 branch를 개선하지만, unconditional agreement는 teacher error를 전파할 수 있다. Selective gate는 상호보완적 specialization을 유지하면서 capability gap을 줄인다.
  • Embedding efficiency: UMER-E는 zero reasoning tokens에서 63.1에 도달하며, UME-R1 대비 query/indexing speedup 118.6×/99.6×, PLUME 대비 3.9×/3.1×를 제공한다.UMER-H는 UMER-E index를 재사용해 embedding extraction 중 sequential reasoning을 제거한다. 이는 indexing cost가 corpus size에 따라 증가할수록 특히 유리하다.
  • Budget-adjustable inference: Reranking K를 3에서 20으로 늘리면 score가 64.8에서 66.1로 상승하며 token과 latency는 거의 선형적으로 증가한다. 반면 K = 5는 K = 20 latency의 24%에서 65.5를 달성한다.UMER-H는 UMER-E index를 재사용하고 online top-K reranking에만 computation을 추가한다. 기본값인 K = 5는 관찰된 최대 gain의 80%를 확보한다.

결론

UMER는 Pair-Aware Discriminative Reasoning을 통해 universal multimodal retrieval을 위한 multimodal embedding과 ranking을 통합한다. 하나의 공유 MLLM이 독립적으로 인덱싱 가능한 embedding, pair-aware CoT 생성, discriminative ranking을 학습한다.

  • 결론: UMER는 universal multimodal retrieval을 위한 통합 multimodal embedding 및 ranking framework를 제시한다.
  • 결론: Pair-Aware Discriminative Reasoning은 query와 candidate를 비교해 matching 또는 discrepancy evidence를 식별함으로써 item-wise CoT의 제한적인 discriminative supervision을 극복한다.
  • 결론: 공유 MLLM은 independently indexable embedding, pair-aware CoT 생성, discriminative ranking을 공동으로 학습한다.

보충 자료 · 구현 및 평가 세부사항

UMER의 보충 구현 및 평가 세부사항은 멀티모달 학습 설정, hard negative supervision, pair-aware CoT target의 offline 사전 준비를 종합한다. 설정은 Table 1에 요약되어 있다.

  • 구현 및 평가 세부사항: 학습 혼합에는 image, video, visual-document source가 포함되며, 가능한 경우 raw target 대신 엄선된 positive를 사용한다.
  • 구현 및 평가 세부사항: 각 학습 인스턴스는 검색된 hard negative를 contrastive 및 pairwise supervision과 결합하며, pair-aware CoT target은 학습 전에 offline으로 생성하고 감사한다.
  • 구현 및 평가 세부사항: Table 1은 보충 자료 전반에 걸친 UMER의 전체 구현 및 평가 설정을 종합한다.이 표는 구현과 평가에 사용된 전체 구성을 제시한다.

Pair-Aware CoT 데이터 구축

UMER는 각 query를 관련 positive와 의미적으로 유사하지만 무관한 candidate와 대조해 pair-aware rationale을 구축한다. 세 단계 pipeline은 hard negative를 mining하고, 구조화된 pair note를 생성하며, text-only auditing으로 해당 note를 검증한다.

  • 개요: Pair-aware supervision은 각 query–positive pair를 그럴듯한 무관 candidate와 대조해, 고립된 query 설명이 아니라 판별적 evidence를 학습시킨다.pipeline은 positive pair와 negative pair에 대해 별도의 rationale을 생성해, supervision이 라벨된 target과 distractor를 구분하는 세부 정보를 포착하도록 한다.
  • Stage 1: hard-negative mining: Hard-negative mining은 source-local gallery를 embedding하고, annotated positive를 mask한 뒤, similarity threshold 0.75를 적용해 누락되었을 가능성이 높은 positive를 filtering한 후 최대 세 개의 candidate를 유지한다.독립적으로 검토된 무관 candidate가 있으면 이를 우선하며, 없을 경우 embedding으로 mining한 candidate를 fallback으로 사용한다. 최종 configuration은 offline hard negative 하나를 사용한다.
  • Stage 2: structured CoT generation: Structured CoT generation은 positive pair와 hard-negative pair를 독립적으로 annotation하며, query_intent와 target_observations를 사용한다. 이때 pair label이나 최종 결정을 드러내지 않고 objective한 target-side fact를 활용한다.note는 query별 제약과 관련 entity, attribute, action, relation 또는 text cue를 포착하며, 두드러진 overlap과 누락되거나 충돌하는 evidence도 포함한다.
  • Stage 3: text-only evidence verification: Text-only auditor는 match, not_match 또는 unknown prediction이 pair label과 일치하고, schema가 유효하며, note에 어떤 decision leaks도 없을 때만 rationale을 수용한다.auditor는 생성된 field만 확인한다. 네 개의 source sidecar에 걸쳐 데이터에는 6,632,206개의 canonical pair record가 포함된다.

전체 MMEB-V2 결과

UMER는 Qwen2-VL-2B와 Qwen2-VL-7B 모델 모두에서 전체 78-task MMEB-V2 benchmark 전반에 걸쳐 가장 강력한 성능을 달성한다. 보고된 평가 설정에서 UMER의 hybrid configuration은 전체 평균과 image, video, visual-document task 평균 모두에서 선두를 차지한다.

  • Qwen2-VL-2B 결과: 전체 65.5, image 70.4, video 45.0, visual-document task 73.6을 기록한 UMER-H가 Qwen2-VL-2B 모델 중 가장 우수하며, 전체 성능에서 RIME을 1.4 points 앞선다.Table 2는 모든 MMEB-V2 task를 다루며, 공개된 2B baseline의 세부 task-level 결과를 보고한다.
  • 평가 범위: 전체 비교는 78 MMEB-V2 tasks를 포괄하며, image와 video에는 Hit@1, visual document에는 NDCG@5를 사용하고, embedding, ranking, hybrid inference를 구분한다.표에는 해당 model size에서 공개된 task-level 결과가 있는 baseline만 포함된다.
  • Qwen2-VL-7B 결과: UMER-H는 동일한 K = 5 hybrid configuration에서 전체 70.6, image 74.3, video 50.5, visual-document task 80.0을 달성한다.Table 3은 공개된 78-task breakdown이 있는 Qwen2-VL-7B 모델을 비교한다.

추가 추론 분석

UMER-H는 넓은 ranking-weight 범위에서 견고한 성능을 유지하며, embedding과 pair-aware ranking은 MMEB-V2 쿼리 전반에서 상호 보완적인 정답 결정을 제공한다. 두 방식의 비슷한 수준의 독점적 성공은 어느 한 branch의 우위보다 hybrid inference가 적절함을 뒷받침한다.

  • Ranking-weight 민감도: ranking-score weight를 0.5–5.0으로 설정해도 UMER-H는 최고 score 65.5에서 0.8점 이내의 성능을 유지하며, 재학습 없이도 견고한 hybrid inference가 가능함을 보여준다.기본 weight는 2.0이며, weight가 커지면 성능이 소폭 하락한다. 이는 모든 쿼리에서 어느 한 branch도 우세해서는 안 됨을 시사한다.
  • Decision overlap: 83,530개의 MMEB-V2 쿼리에서 embedding-only와 ranking-only의 성공률은 각각 9.0%와 10.3%이며, 두 branch가 모두 정답인 경우는 47.2%다.서로 겹치지 않는 성공 집합의 규모가 비슷하다는 점은 어느 한 branch도 일관되게 우세하지 않음을 보여주며, hybrid inference를 위한 상호 보완적 decision signal을 확립한다.

정성적 결과와 실패 사례

정성적 사례는 세밀한 구성, 속성 결합, 시각적 은유에서 pair-aware ranking이 embedding의 실패를 보정하는 한편, 공간 관계에서는 regression을 드러냄을 보여준다. 예시는 positive candidate와 top-1 hard negative를 비교하고 reranking 전후의 rank 변화를 보고한다.

  • Case 2: 속성에 민감한 composed retrieval: 결합 속성의 경우, ranking은 시각적으로 유사한 수중 reference 대신 사람이 없는 서로 다른 종의 동물 두 마리를 선택해 positive를 rank 4에서 rank 1로 이동시킨다.embedding 결과는 장면을 유지하지만 두 가지 명시적 요구사항을 모두 위반한다.
  • Case 3: 시각적 은유 문서 retrieval: 시각적 은유 retrieval의 경우, ranking은 데이터를 맹목적으로 따르는 결과와 가라앉는 자동차 아이콘을 결합한 슬라이드를 선택해 positive를 rank 3에서 rank 1로 이동시킨다.반면 embedding은 요청된 은유가 아니라 visual evidence가 video player인 의미적으로 관련된 video slide를 선택한다.
  • Case 4: 공간 관계 ranking regression: Pair-aware ranking은 공간 관계에서 regression을 보이며, embedding rank 1의 올바른 배경 motorcycle을 rank 2의 두드러진 전경 motorcycle로 대체한다.candidate-specific reasoning은 전경의 두드러짐을 강조해 요청된 뒤/오른쪽 관계를 보존하지 못하지만, 올바른 candidate는 여전히 top-2에 남는다.
  • Case 1: 세밀한 이미지 구성: 개 retrieval의 경우, ranking은 품종은 일치하지만 요청된 머리 중심 close-up 구성을 놓친 embedding 결과를 보정해 positive를 rank 5에서 rank 1로 이동시킨다.target은 머리가 중앙에 위치한 Cavalier King Charles Spaniel portrait인 반면, embedding의 top result는 달리는 개 이미지다.
Loading 2608.18504v1…