Source-linked AI summary

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

arXiv:2606.23885v1cs.CVcs.AIcs.CLcs.MM

TL;DR

MLLMs는 여전히 기초적인 시각 추론에 어려움을 겪으며, 기존 representation-alignment 방법은 대체로 고정된 language-backbone layer를 대상으로 하여 Transformer의 세밀한 구조를 간과한다. HeRA는 국소 위상 유사성의 contrastive proxy를 사용해 선택된 attention head를 정렬하며, 까다로운 vision-centric benchmark에서 평균 +3.6점 향상을 달성하는 동시에 visual hallucination을 완화한다.

  • 문제

    MLLMs는 기초적인 시각 추론에서 여전히 어려움을 겪으며, 기존 representation-alignment 방법은 모델의 내부 구조를 고려하지 않고 대체로 고정된 language-backbone representation을 대상으로 한다.

  • 방법

    HeRA는 MKNN-guided selection과 contrastive objective를 사용해 개별 attention head를 external vision encoder의 국소 위상 구조와 정렬한다.

  • 결과

    HeRA는 까다로운 Vision-Centric benchmark에서 평균 +3.6점 향상을 보였으며, 차선 방법의 +2.8점을 능가했다.

  • 시사점 및 한계

    HeRA는 까다로운 vision-centric 성능을 향상하는 동시에 visual hallucination과 linguistic prior에 대한 과도한 의존을 억제하는 regularizer로 기능한다.

  • 시사점 및 한계

    평가는 최신 frontier proprietary MLLMs가 아니라 계산적으로 다루기 쉬운 LLaVA pipeline을 사용한다.

Abstract

from arXiv · show

Representation alignment has emerged as an effective approach to improve Multimodal Large Language Models (MLLMs) by regularizing their internal representations toward those of an external vision encoder. However, existing methods typically align a fixed layer of the language backbone, overlooking the fine-grained structure of Transformer models. In this work, we propose Head-Wise Representation Alignment (HeRA), a method that enforces cross-modal alignment at the level of individual attention heads. Our approach is grounded in the Platonic Representation Hypothesis, focusing on preserving the topological structure of representations (i.e., their local neighborhood relationships) across modalities. Following the Mutual K-Nearest Neighbor (MKNN) alignment metric, we introduce a contrastive objective that acts as a differentiable proxy for matching local structures. HeRA applies this objective during multimodal training to specific attention heads in the LLM, selected by their alignment score according to the MKNN metric. Counterintuitively, we find that aligning the least aligned heads yields the largest gains. Extensive evaluations across multiple MLLMs and 18 benchmarks demonstrate that HeRA consistently improves performance on challenging vision-centric tasks and serves as an effective regularizer against visual hallucinations by naturally curbing the over-reliance on linguistic priors. Our code is publicly released.

1 서론

HeRA는 위상적 cross-modal 일관성과 MKNN 진단을 활용해 개별 attention head를 선택함으로써 MLLM의 고정 layer representation alignment 한계를 해결한다. LLaVA [19]에서 18개 benchmark에 걸쳐 challenging vision-centric 성능을 일관되게 향상시키고 visual hallucination [10] [39]을 억제하도록 regularization한다.

  • 문제와 관련 연구: Representation alignment는 cross-modal distillation [2] [38] [46]을 통해 MLLM language-model representation을 외부 vision encoder의 representation에 맞추도록 regularization한다.MLLM [1] [19] [34] [41]이 발전했음에도 기초적인 visual reasoning은 여전히 제한적이며, 기존 방법은 대체로 고정된 backbone representation을 align한다.
  • 방법의 동기: 이 접근법은 Platonic Representation Hypothesis [9] [13]에 기반하며, 의미적으로 유사한 입력이 modality 전반에서 local neighborhood structure를 보존한다고 가정한다.이는 representation alignment를 representation space의 local geometry, 즉 topology를 보존하는 문제로 정식화한다.
  • 방법의 동기: HeRA는 개별 attention heads 수준에서 cross-modal alignment를 강제하며, 사전 계산된 MKNN score를 사용해 대상으로 삼을 head를 선택한다.고정된 더 거친 layer [46]를 align하는 접근법과 달리, HeRA는 language backbone의 내부 구조를 고려하기 위해 head-level selection을 사용한다.
  • 방법의 동기: HeRA는 least aligned heads를 대상으로 하며, 이미 align된 구조는 보존하면서 misaligned component를 강화해 가장 큰 성능 향상을 얻는다.이 선택은 강한 language prior를 지닌 pre-trained LLM의 복잡한 alignment와 조직화 사이의 상호작용에 근거한다.
  • 결과: HeRA는 LLaVA [19] framework에서 18개 benchmark [34] 전반에 걸쳐 성능을 일관되게 향상시키며, 특히 challenging vision-centric task에서 효과적이고, 일반적인 visual question answering 성능을 저하시키지 않으며 오히려 향상시키는 경우가 많다.이러한 위상적 alignment는 visual hallucination [10] [39]을 억제하는 regularizer로도 작동한다.

2 관련 연구

기존 연구는 모달리티 간 전역적 표현 정렬보다 국소적 표현 정렬을 지지하며, MLLM의 시각적 이해를 향상하는 방법으로 vision-centric supervision을 강조한다. 기존 정렬 방법은 대체로 고정된 language-backbone layer의 visual feature를 대상으로 하는 반면, 본 연구는 주로 LLaVA를 대상으로 하고 Qwen3 모델에도 적용하는 새로운 objective를 연구한다.

  • Platonic Representation Hypothesis: Platonic Representation Hypothesis [13]는 서로 다른 architecture, modality, objective를 사용하는 모델들이 구조적으로 유사한 latent space로 수렴하며, 모달리티 간 국소 이웃 관계가 보존된다고 제안한다 [9].인용된 동시기 연구는 구조적 일관성이 전역적이 아니라 국소적이므로, 절대적인 전역 기하 구조는 달라질 수 있다고 주장한다.
  • MLLM의 Vision-Centric Supervision: Vision-centric supervision 방법은 MLLM 표현을 teacher vision encoder와 정렬하지만, 대체로 고정된 하드코딩 language-backbone layer의 visual feature에서 작동한다.이 대목은 JARVIS [2]를 포함한 최근 representation-alignment 접근법에서 이러한 고정 layer 설계가 일반적인 패턴임을 지적한다.
  • 구현 맥락: 본 연구는 계산 가능성을 위해 LLaVA [19] framework에서 새로운 representation-alignment objective를 연구하고, 추가로 state-of-the-art Qwen3 [45] 모델에도 적용한다.더 넓은 MLLM 연구 맥락에는 대규모 dataset, post-training, 더 강력한 LLM backbone, native multimodal model이 포함된다 [1] [41] [35].

3 제안 방법

HeRA는 선택된 Transformer attention head에 미분 가능한 contrastive objective를 적용해, frozen vision encoder의 local topology에 multimodal representation을 정렬한다. 이 head-wise alignment loss를 표준 language-modeling objective와 결합해, 고정된 language-model layer가 아닌 세밀한 개입을 수행한다.

  • MKNN alignment metric: MKNN은 textual 및 visual k-nearest-neighbor set 간의 일치도를 통해 alignment를 측정하며, 점수가 높을수록 local topological structure가 보존되었음을 의미한다.Text representation에는 average-pooled language-model output을 사용하고, visual representation에는 vision encoder의 CLS embedding을 사용한다.
  • Contrastive topological alignment: 이 방법은 target nearest neighbor를 더 가깝게 끌어당기고 다른 batch sample을 분리함으로써, multimodal representation이 teacher vision encoder의 local neighborhood와 일치하도록 학습한다.Multi-target InfoNCE objective는 미분 불가능한 MKNN metric의 미분 가능한 proxy이며, learnable temperature τ가 distribution sharpness를 조절한다.
  • Head-wise alignment objective: HeRA는 선택된 attention-head representation에 contrastive alignment를 독립적으로 적용해, language modeling과 representation alignment 간의 충돌을 줄이는 atomic intervention을 가능하게 한다.Head마다 역할이 다르게 특화되므로, head-level control은 고정된 intermediate layer를 정렬하는 것보다 더 세밀한 granularity를 제공한다.
  • Training objective: 최종 objective는 표준 language modeling과 선택된 head의 alignment loss를 합산하며, 고정 계수 λ로 두 항의 균형을 맞춘다.Multimodal architecture는 LLM, pretrained vision encoder, projector를 결합하며, generation 전에 visual embedding을 text embedding에 concatenate한다.
  • Head selection: 이 방법은 poorly aligned head의 alignment를 향상시키면서 strongest head는 보존하며, 이는 보고된 best-performing selection strategy에서 확인된다.이러한 selection behavior는 head-wise alignment를 할당하는 이 방법의 선호 방식으로 제시된다.

4 실험

다양한 LLM에서 HeRA는 핵심 언어, 지식, OCR 능력을 일관되게 유지하거나 향상시키면서 vision-centric benchmark에서 가장 큰 성능 향상을 내고 visual hallucination을 줄인다. Ablation 결과, alignment가 가장 낮은 5개 attention head에 contrastive alignment를 적용하는 것이 가장 효과적이며, fixed-layer alignment나 지나치게 많은 head를 정렬하는 방식은 더 약한 것으로 나타난다.

  • Objective와 Granularity: Contrastive alignment는 standard middle-layer cosine alignment보다 우수하며, 평가된 두 LLM 모두에서 alignment가 가장 낮은 5개 head를 선택하는 방식이 가장 높은 5개 head를 선택하는 방식보다 더 큰 성능 향상을 낸다.Head 순위는 vision encoder와의 MKNN alignment를 기반으로 정해지며, 제공된 본문은 worst-5 전략의 두드러진 우위를 보고하지만 예시 수치는 일부만 제시한다.
  • 정렬할 Head 수: 5개 head를 정렬할 때 성능이 가장 좋고, 1개 또는 3개를 정렬하면 성능 향상은 제한적이며, 10개를 정렬하면 특히 Qwen2.5-3B에서 성능이 하락한다. 이는 과도한 alignment가 language modeling과 충돌함을 시사한다.Training 후 worst-5 head는 top-5 alignment를 낮추지 않으면서 vision-language alignment가 크게 향상되며, 이는 Platonic Representation Hypothesis [13]를 뒷받침한다.
  • Cambrian Benchmark 결과: HeRA는 LLM architecture 전반에서 General, Knowledge, OCR 성능을 일관되게 유지하거나 향상시키는 동시에 Vision-Centric 결과를 크게 개선하며, Vicuna-7B에서 +2.3 points, Qwen2.5-14B에서 +3.4 points, Qwen3-14B에서 58.9 Vision-Centric average를 달성한다.이 결과는 여러 architectural generation과 parameter scale에 걸친 모델 및 Cambrian benchmark suite 전반에서 보고되었다.
  • Hallucination Benchmark 결과: HeRA는 CHAIR-MSCOCO와 AMBER에서 hallucination rate를 낮추면서 AMBER accuracy와 F1, 그리고 Qwen3-4B의 해당 benchmark 결과를 제외한 거의 모든 HallusionBench metric을 향상시킨다.이러한 향상은 contrastive loss가 hallucination mitigation을 명시적으로 최적화하지 않더라도 visual grounding이 강화됨을 보여준다.
  • Representation Alignment Strategy와의 비교: Fixed-layer strategy와 비교하면 HeRA의 targeted head-wise topological alignment가 더 효과적이며, 비교된 방법 중 VIRAL만 LLaVA 대비 성능이 하락한다.이 비교는 HeRA의 local-structure objective와 CMAR의 global pointwise CKA matching을 구분한다.
  • Teacher Vision Encoder: SigLIP2 자체를 teacher로 사용하는 방식은 대부분 효과가 없으며, 이는 unsupervised vision encoder가 language-supervised encoder보다 더 나은 representation teacher라는 concurrent work [46] [47]의 결과와 일치한다.Teacher encoder 실험에서는 SigLIP2를 primary vision encoder로 사용하는 Qwen3-8B를 사용한다.

5 결론

HeRA는 외부 vision encoder와 선택된 attention head를 정렬하기 위해 MKNN 기반 contrastive proxy를 사용하여 topological representation alignment를 통해 MLLM을 향상한다. 여러 architecture와 benchmark에서 가장 덜 정렬된 head를 대상으로 할 때 가장 큰 성능 향상이 나타난다.

  • HeRA는 Platonic Representation Hypothesis에 기반한 topological representation alignment를 통해 Multimodal Large Language Model을 향상한다.
  • HeRA는 MKNN metric을 위한 contrastive proxy를 사용하여 특정 attention head를 외부 vision encoder와 정렬한다.
  • 여러 architecture와 benchmark에 걸친 평가에서 가장 덜 정렬된 attention head를 대상으로 할 때 가장 큰 성능 향상이 나타난다.

A 추가 구현 세부사항

구현은 LLaVA-1.5의 2단계 학습 레시피를 따르며, 시각적 이웃 구조에서 HeRA supervision을 구성하고 단계별 token pooling과 학습 가능한 temperature scaling을 적용한다.

  • 학습 세부사항: 학습은 LLaVA-1.5 [19]를 따른다. 먼저 558k image-caption pairs로 projector를 학습한 뒤, LLaVA-Instruct-665k에서 language model과 projector를 함께 최적화한다.첫 번째 단계에서는 language model을 고정하며, 보고된 optimizer, learning rate, batch size는 LLaVA-1.5 [19]와 동일하다.
  • Contrastive Learning 세부사항: Teacher [CLS] representation으로 Gram matrix를 구성하고, top-k visual neighbors에는 균등한 multi-positive contrastive target을 부여하며 나머지 모든 sample에는 zero probability를 부여한다.Target은 각 batch 내 teacher-encoder representation 사이의 pairwise dot product에서 도출된다.
  • Contrastive Learning 세부사항: Student representation은 선택된 head와 단계별 text token에 대해 평균을 낸다. 첫 번째 단계에서는 모든 caption token을 사용하지만, 두 번째 단계에서는 <ASSISTANT> token만 사용한다.두 번째 단계의 token은 language-model loss에 기여하는 token이다.
  • Contrastive Learning 세부사항: Temperature τ는 logarithmic scale에서 학습되며 0.07로 초기화된다.
  • LLM 세부사항 및 선택된 Head: Table 5에는 공개적으로 접근 가능한 LLM checkpoint와 선택된 attention head가 MKNN alignment score가 증가하는 순서로 정리되어 있다.Head identifier는 LXHY 표기를 사용하며, X는 layer를, Y는 head index를 나타낸다.

B 평가 벤치마크

평가는 일반 인지, 지식 추론, OCR, 시각 능력을 아우르는 18개 benchmark와 환각에 초점을 둔 3개 데이터셋으로 구성된 Cambrian Evaluation Suite [34]를 사용한다. 환각 평가는 객체·문장·인지·커버리지 수준의 경향을 측정한다.

  • Cambrian Evaluation Suite: Cambrian Evaluation Suite [34]는 다양한 MLLM 역량을 평가하기 위해 General, Knowledge, OCR, Vision 범주로 구성된 18개 benchmark를 포함한다.제시된 범위에는 인지, 지식 추론, OCR 및 차트 이해, 핵심 시각 능력이 포함된다.
  • 평가 분석: 추가 평가 비교에서는 DINOv2와 SigLIP2 vision encoder의 성능 차이와 서로 다른 LLaVA 학습 단계에 LHeRA를 적용했을 때의 효과를 검토한다.이러한 분석은 각각 Table 6과 Table 7에 제시된다.
  • 환각 데이터셋: 환각 경향은 AMBER [39], CHAIR-MSCOCO [49], HallusionBench [10]에서 평가된다.CHAIR-MSCOCO는 500개 MSCOCO [18] validation image에 대한 설명에서 객체 및 문장 수준의 환각률을 평가한다.
  • 환각 데이터셋: 환각 benchmark는 인간이 환각한 객체와의 중복을 통해 인지를, AMBER의 추가 생성 과제 측정치를 통해 커버리지를 포착한다.제공된 문단에서는 이러한 AMBER 차원을 각각 Cog와 Cover로 정의한다.

C 추가 실험 · C.1 추가 절제 연구 및 결과

추가 실험에서는 vision encoder, LLaVA 학습 단계, language model, alignment 전략, 그리고 전체 18개 VQA benchmark에 걸쳐 HeRA를 검토한다. 또한 representation alignment 없이 DINOv2-L을 직접 vision encoder로 사용하는 것은 효과적이지 않음을 보인다.

  • C.1 추가 절제 연구 및 결과: representation alignment 없이 DINOv2-L을 MLLM에 직접 연결하는 것은 평가된 SigLIP2 대안과 비교해 효과적이지 않다.Table 6에서는 DINOv2-L과 SigLIP2를 vision encoder로 비교하며, alignment를 생략할 수 있는지 검증한다.
  • C.1 추가 절제 연구 및 결과: 부록에서는 서로 다른 language model에 대해 LLaVA training recipe로 학습한 HeRA의 상세 VQA 결과를 제공한다.이 비교 결과는 Table 8에 요약되어 있다.
  • C.1 추가 절제 연구 및 결과: 부록에서는 상세 VQA 결과를 사용해 multimodal language model을 위한 여러 representation alignment 전략을 비교한다.전략 비교 결과는 Table 9에 요약되어 있다.
  • C.1 추가 절제 연구 및 결과: HeRA를 LLaVA recipe의 두 학습 단계 모두에 적용해 평가하며, 두 단계의 multimodal input과 objective는 서로 다르다.첫 번째 단계에서는 alignment된 image-caption pair를 사용하므로 representation alignment를 검토하기에 적합한 설정이다.
  • C.1 추가 절제 연구 및 결과: 전체 평가에서는 18개 VQA benchmark 모두에 대한 결과를 보고하며, 본문에서 강조한 vision-centric dataset을 넘어선다.보고된 benchmark 범주에는 vision-centric VQA dataset 외에도 General, Knowledge, OCR이 포함된다.
  • C.1 추가 절제 연구 및 결과: 추가 결과에는 General, Knowledge, OCR benchmark 범주와 함께 RealWorldQA, MMVP, Blink, V*, CVBench가 포함된다.본문에서는 나열된 vision-centric dataset의 상세 점수를 보고했지만, 확장 결과에서는 범주별 평균을 제시했다.

C.2 추가 분석

추가 분석 결과, HeRA의 성능 향상은 초기 정렬도가 낮은 attention head를 대상으로 하기 때문에 나타나며, HeRA만이 이들의 국소 cross-modal topology를 개선한다. 이러한 경향은 더 큰 Qwen2.5 모델에서도 유지되지만, feature-level 및 경쟁 alignment 방법은 Worst-5 head를 거의 변화시키지 못한다.

  • 추가 MKNN Head-Wise 분석: 표준 multimodal training은 base LLM의 상대적인 head alignment를 대체로 유지한다. 자연스럽게 정렬된 head는 계속 정렬된 상태를 유지하는 반면, 정렬도가 낮은 head는 계속 낮은 정렬도를 보인다.방법에 관계없이 Top-5 alignment는 대체로 증가하지만, 대부분의 score는 regularization을 적용하지 않은 LLaVA baseline과 여전히 비슷한 수준에 머문다.
  • 추가 MKNN Head-Wise 분석: Worst-5 head에 HeRA를 적용하면 Top-5 head의 성능을 희생하지 않으면서 이들의 MKNN alignment가 크게 증가한다. 반면 Top-5 head에 적용하면 Worst-5 head는 변하지 않고 성능도 최적 수준에 미치지 못한다.Worst-5와 Top-5 head는 Qwen2.5-3B의 pretraining MKNN alignment score를 기준으로 선택되며, 이 선택은 표준 multimodal training 이후에도 성능을 예측한다.
  • 더 큰 Qwen2.5 모델과의 MKNN Alignment: Qwen2.5-7B와 Qwen2.5-14B의 개별 attention head는 동일 모델의 어느 layer에서 얻은 representation보다 일관되게 더 높은 자연 시각 정렬도를 보인다.더 큰 모델에 대한 분석에서는 두 모델을 모두 MKNN metric을 사용해 DINOv2-L teacher와 비교하며, 앞선 Qwen2.5 분석을 확장한다.
  • 다양한 Representation Alignment 방법을 사용한 MKNN 분석: 비교한 방법 중 HeRA만이 초기 정렬도가 낮은 Worst-5 head의 cross-modal alignment를 유의미하게 증가시킨다. CMAR와 feature-matching 방법은 구조적으로 의미 있는 변화를 만들어 내지 못한다.CMAR는 cross-modal topology를 대상으로 하는 반면, feature matching은 feature-level similarity에 초점을 맞추므로 국소 neighborhood structure를 효과적으로 수정하지 못한다.

C.3 정성적 결과

HeRA는 General, Knowledge, OCR, Vision-Centric 범주 전반에서 LLaVA와 ROSS보다 더 정확하고 근거가 분명한 답변을 생성하며, 대표 샘플에서 지각 오류를 교정한다. 그럼에도 복잡한 장면에서는 개수, 재질, 형태, 공간적 관계를 비롯한 세밀한 시각적 세부 사항을 여전히 잘못 해석할 수 있다.

  • 정성적 비교: HeRA는 General, Knowledge, OCR, Vision-Centric 범주 전반에서 LLaVA [19]와 ROSS [38]보다 일관되게 더 정확하고 근거가 분명한 답변을 생성하며, baseline의 지각 오류를 교정한다.비교에는 Qwen3-8B와 SigLIP2를 사용한다.
  • 실패 사례: HeRA는 작은 객체의 개수를 세거나 모호한 재질과 형태를 식별하고 복잡한 장면에서 정확한 공간적 관계를 추론하는 등 세밀한 시각적 세부 사항을 간혹 잘못 해석한다.이러한 실패 사례는 모델의 정성적 개선에도 불구하고 남아 있다.

D 제한사항 및 사회적 영향

이 연구는 주로 계산적으로 다루기 쉬운 LLaVA pipeline에서 HeRA를 평가하며, 초기 Qwen3-VL-4B 연구에서는 까다로운 vision-centric task에서 유망한 성능 향상이 나타났다. 저자들은 HeRA에 특유한 직접적인 사회적 위해는 없다고 보고하며, 향상된 visual grounding과 감소한 object hallucination이 그 근거라고 본다.

  • 제한사항: HeRA는 최신 proprietary MLLM이 존재함에도, 계산적으로 다루기 쉬운 LLaVA pipeline을 통해 주로 평가된다. 이 pipeline은 광범위한 ablation과 엄격한 평가를 가능하게 하기 때문이다.이는 주요 평가의 architecture 범위를 제한한다.
  • 제한사항: FineVision [42]의 83k-sample Cambrian split으로 fine-tuning된 Qwen3-VL-4B [1]에서 HeRA는 특히 까다로운 vision-centric task에서 유망한 결과를 보인다.이 연구는 LLaVA를 넘어서는 초기 탐색으로 현대적인 multimodal architecture에 HeRA를 직접 적용한다.
  • 사회적 영향: 저자들은 HeRA에 특유한 직접적인 부정적 사회적 영향은 없다고 판단하며, 향상된 visual grounding과 감소한 object hallucination이 더 신뢰할 수 있고 사실에 부합하는 vision-language system을 뒷받침한다고 주장한다.이는 representation-alignment technique의 예상되는 사회적 영향으로 제시된다.
  • 제한사항: 정성적 비교는 Cambrian category 전반에 걸쳐 이루어지며, 별도의 예시는 VQA task에서 HeRA의 failure case를 기록한다.제공된 figure는 General, Knowledge, OCR, Vision-Centric sample과 VQA failure를 다룬다.
Loading 2606.23885v1…