Source-linked AI summary

LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant

Yikun Liu, Pingan Chen, Jiayin Cai, Xiaolong Jiang, Yao Hu, Jiangchao Yao, Yanfeng Wang, Weidi Xie

arXiv:2412.01720v1cs.CV

TL;DR

기존 multimodal retrieval 방법은 번거로운 task-specific fine-tuning을 요구하는 경우가 많지만, LamRA는 staged training과 경량 LoRA modules를 통해 generative LMMs에 통합 retrieval 및 reranking을 제공한다. 10개가 넘는 task에서 unseen task를 포함한 supervised 및 zero-shot 설정 모두에서 견고한 성능을 보였으며, InfoSeek Recall@5에서 UniIR-CLIP보다 26.3 points 높은 성능을 달성했다.

  • 문제

    기존 방법은 번거로운 task-specific fine-tuning을 통해 vision-language models를 점점 복잡해지는 retrieval task에 맞게 조정한다.

  • 방법

    LamRA는 LMMs에 경량 LoRA modules를 추가하고, two-stage retrieval training과 pointwise 및 listwise reranking의 joint training을 사용한다.

  • 결과

    10개가 넘는 retrieval scenario에서 LamRA는 supervised 및 zero-shot 설정 모두에서 견고한 성능을 보였으며, InfoSeek Recall@5에서 UniIR-CLIP보다 26.3 points 높은 성능을 달성했다.

  • 시사점 및 한계

    LamRA는 추가 training 없이 previously unseen retrieval task로 extrapolate할 수 있으며, 복잡한 zero-shot scenario도 포함한다.

  • 시사점 및 한계

    LMMs를 retrieval 및 reranking에 적용하면 inference cost가 높지만, feature pre-extraction과 low-query-rate deployment로 이를 완화할 수 있다.

Abstract

from arXiv · show

With the rapid advancement of multimodal information retrieval, increasingly complex retrieval tasks have emerged. Existing methods predominately rely on task-specific fine-tuning of vision-language models, often those trained with image-text contrastive learning. In this paper, we explore the possibility of re-purposing generative Large Multimodal Models (LMMs) for retrieval. This approach enables unifying all retrieval tasks under the same formulation and, more importantly, allows for extrapolation towards unseen retrieval tasks without additional training. Our contributions can be summarised in the following aspects: (i) We introduce LamRA, a versatile framework designed to empower LMMs with sophisticated retrieval and reranking capabilities. (ii) For retrieval, we adopt a two-stage training strategy comprising language-only pre-training and multimodal instruction tuning to progressively enhance LMM's retrieval performance. (iii) For reranking, we employ joint training for both pointwise and listwise reranking, offering two distinct ways to further boost the retrieval performance. (iv) Extensive experimental results underscore the efficacy of our method in handling more than ten retrieval tasks, demonstrating robust performance in both supervised and zero-shot settings, including scenarios involving previously unseen retrieval tasks.

1. 서론

LamRA는 대규모 멀티모달 모델을 범용 retrieval과 reranking에 재활용해 task-specific VLM fine-tuning의 한계를 해결한다. 2단계 retrieval 학습은 unseen-task generalization을 포함한 10개가 넘는 시나리오에서 평가된다.

  • 동기: 기존 VLM 방법은 task-specific fine-tuning에 의존하므로, composed image retrieval과 multimodal document retrieval처럼 난도가 높은 과제가 등장할 때의 적응이 제한된다.이러한 과제에는 composed image retrieval [34], long-text image retrieval, image/question to multimodal document retrieval [36]이 포함된다.
  • 방법: LamRA는 경량 LoRA 모듈을 삽입해 LMM에 범용 retrieval 및 reranking 역량을 부여한다.이 framework는 LMM 내부에서 정교한 retrieval과 reranking을 지원하도록 설계된다.
  • 방법: LamRA-Ret은 language-only pre-training을 수행한 뒤 multimodal instruction tuning을 적용해 retrieval 성능을 점진적으로 향상한다.첫 번째 단계에서는 summarization prompt에 응답하는 text-only embedding output을 학습하고, 두 번째 단계에서는 instruction tuning을 사용한다.
  • 실험: 실험은 text-to-image, text-image-to-image, text-image-to-text-image retrieval을 포함해 10개가 넘는 retrieval 시나리오를 다룬다.보고된 성능은 LamRA가 단순한 retrieval task와 복잡한 retrieval task를 모두 효과적으로 처리함을 보여준다.
  • 결과: LamRA는 사전에 노출되지 않은 held-out retrieval task에서도 효과적으로 수행해 강한 task-level generalization을 보인다.이는 이전에 보지 못한 retrieval challenge로의 transferability를 평가한다.

2. 관련 연구

관련 연구는 전통적인 cross-modal retrieval과 dual-encoder representation learning에서 더 복잡하고 범용적인 retrieval 설정으로 발전해 왔다. 최근 방법들은 benchmark, shared language space, LMM을 활용하지만, 복잡한 task에 대한 한계가 LamRA의 필요성을 뒷받침한다.

  • Multimodal Information Retrieval: Multimodal retrieval은 MSCOCO [29]와 Flickr30K [41] cross-modal benchmark를 넘어 composed image, long-text-to-image, image/question-to-multimodal document retrieval [2] [34] [45] [13]로 확장되었다.
  • Multimodal Representation Learning: CLIP [42]과 ALIGN [15]은 dual-encoder contrastive learning [38]을 사용해 image와 text를 정렬하지만, 이 architecture는 단순한 image-text alignment를 넘어서는 상황에서 어려움에 직면한다.
  • Multimodal Representation Learning: UniIR 은 eight retrieval tasks를 benchmark하고, E5-V [18]는 image와 text를 shared language hidden space에 매핑한 뒤 text-pair fine-tuning [11]을 통해 zero-shot retrieval을 달성한다.이러한 접근법은 generality와 adaptability를 향상시키지만, 일부 복잡한 retrieval task에서는 여전히 한계가 있다.
  • Large Multimodal Model: LMM 연구는 segmentation, object detection, general vision-language application [21] [40]을 포함한 다양한 vision-language task를 위해 visual instruction tuning을 통해 visual modality와 textual modality를 점점 더 정렬하고 있다.
  • Large Multimodal Model: 동시에 진행된 연구 [19] [28]에서는 universal retrieval을 위한 LMM의 활용도 탐구하며, 이 방향에 대한 관심이 커지고 있음을 보여준다.

3. 방법

LamRA는 임베딩 기반 retrieval로 top-K 후보를 생성한 뒤 LamRA-Rank가 pointwise 또는 listwise ranking으로 이를 정제하는 2단계 pipeline을 통해 multimodal retrieval과 reranking을 통합한다.

  • Problem Formulation: LamRA는 먼저 임의 형식의 query와 candidate를 embedding하고, cosine similarity로 순위를 매긴 뒤 top-K 결과를 후속 reranking 단계로 전달한다.Query와 candidate는 image, text 또는 image-text가 interleave된 형식을 포함할 수 있다.
  • Architecture and Feature Extraction: 모델은 image-only, text-only 및 multimodal input에 맞게 설계된 Explicit One-word Limitation prompt로 generative embedding을 추출한다.Architecture는 [17] [18]의 접근법을 따라 vision encoder, vision projector 및 language model로 구성된다.
  • Retrieval Training: LamRA-Ret은 language-only pre-training에 이어 M-BEIR의 8개 retrieval task와 10개 dataset에서 multimodal instruction tuning을 수행하며, task-specific instruction과 InfoNCE training을 사용한다.이 staged scheme은 다양한 multimodal retrieval 설정에서 embedding-based retrieval을 점진적으로 향상한다.
  • Reranking: LamRA-Rank는 lightweight LoRA module로 retriever를 조정하고, pointwise YES/NO classification과 listwise ground-truth position prediction을 joint training한다.Reranking example은 초기 retriever의 top 100 candidate로 구성하며, 최종 loss는 Lrank = Lpoint + Llist이다.
  • Inference: Inference 시 LamRA-Ret은 cosine-similarity score를 계산해 top-K candidate를 선택하고, LamRA-Rank는 pointwise 또는 listwise reranking을 제공해 최종 순서를 생성한다.Pipeline은 Φret과 Φrank를 통해 initial retrieval과 후속 reranking을 분리한다.

4. 실험

LamRA는 다양한 M-BEIR task에서 강력한 retrieval 성능을 달성하고, 학습에서 제외된 task와 dataset에도 효과적으로 일반화하며, zero-shot video retrieval에서도 경쟁력 있는 성능을 보인다. Ablation 결과는 두 training stage, model scaling, reranking이 모두 성능에 실질적으로 기여함을 보여준다.

  • 다양한 Retrieval Task에서의 범용성: LamRA-Ret은 UniIR-CLIP을 크게 능가하며, InfoSeek에서 Recall@5를 24.2 points, CIRR에서 8.5 points 향상한다.이러한 향상은 M-BEIR benchmark의 multimodal retrieval task와 pure-text retrieval task 모두에서 나타난다.
  • Unseen Dataset에서의 고도화된 일반화 능력: LamRA는 10 unseen dataset에 강하게 일반화하며, 강력한 baseline을 능가하거나 비슷한 성능을 보이고 dialog-to-image와 multi-round composed image retrieval에서 큰 폭으로 향상한다.Image-Text Matching에서는 LMM 기반 method가 dual-encoder method보다 우수하며, 저자들은 이를 복잡한 text에 대한 더 강한 이해력에 기인한다고 설명한다.
  • Unseen Retrieval Task에서의 뛰어난 일반화: 5개 task로 학습하고 제외된 task에서 평가했을 때, LamRA는 복잡한 unseen retrieval task에서 supervised method를 상대로 경쟁력 있거나 우수한 zero-shot 결과를 달성한다.이는 단순히 unseen dataset이 아니라 held-out retrieval task로의 일반화 능력을 평가한다.
  • Ablation Study: Pre-training을 제거하면 평균 M-BEIR 성능이 three points 하락하며, instruction tuning과 pre-training은 모두 retrieval quality에 유의미한 영향을 미친다.Qwen2-VL-2B에서 7B로 scaling해도 성능이 향상되며, 더 큰 LMM의 이점을 보여준다.
  • Reranking 분석: Pointwise reranking과 listwise reranking은 모두 retrieval을 유의미하게 향상하지만, pointwise reranking은 일반적으로 더 많은 연산 비용이 들고 listwise reranking은 context length의 제약을 받는다.Reranking 비교는 M-BEIR test set에서 수행되며, 상위 5개 결과에 reranking을 적용한다.
  • Video Retrieval로의 확장: Zero-shot LamRA는 MSR-VTT에서 InternVideo를 4.7 Recall@1 points, MSVD에서 UMT-L을 2.5 points 능가한다.이 결과는 평가된 video dataset에 노출되지 않았음에도 text-to-video retrieval에서 얻어진다.

5. 결론

LamRA는 경량 LoRA modules로 구현한 retrieval 및 reranking을 위한 범용 LMM 기반 framework다. 10개가 넘는 다양한 retrieval tasks에 대한 종합적인 비교를 통해 이 방법의 범용성과 효과를 입증한다.

  • LamRA는 경량 LoRA modules를 삽입해 LMM에 강건한 retrieval 및 reranking capabilities를 부여한다.
  • LamRA-Ret은 retrieval performance를 점진적으로 향상하는 two-stage training strategy를 도입한다.
  • 10개가 넘는 다양한 retrieval tasks에 대한 비교는 LamRA의 범용성과 효과를 입증한다.

부록 자료 · A. 사전학습 데이터셋 선택 분석 · B. 추가 구현 세부사항

부록 자료에서는 LamRA-Ret의 사전학습 데이터셋 선택을 분석하고 feature extraction과 reranking을 위한 추가 구현 세부사항을 제시한다. 또한 retrieval 성능을 점진적으로 향상하기 위해 사용한 2단계 학습 설정을 설명한다.

  • A. 사전학습 데이터셋 선택 분석: LamRA-Ret은 retrieval 성능을 점진적으로 향상하기 위해 language-only pre-training 후 multimodal instruction tuning을 수행한다.
  • A. 사전학습 데이터셋 선택 분석: 사전학습 분석에서는 이미지만 포함한 데이터셋, 텍스트만 포함한 데이터셋, 또는 여러 modality의 조합을 포함한 데이터셋을 비교한다.
  • A. 사전학습 데이터셋 선택 분석: Table 9에서는 평가한 사전학습 데이터셋 전반의 성능을 보고한다.
  • B. 추가 구현 세부사항: <emb> token은 새로 추가된 vocabulary 항목으로, 주로 feature extraction 중 placeholder로 사용된다.
  • B. 추가 구현 세부사항: feature embedding은 해당 token 직전에 위치한 hidden state에서 나오므로, 임의의 token으로 <emb>를 대체할 수 있다.
  • B. 추가 구현 세부사항: 구현 보충 자료에서는 pointwise and listwise reranking 방법도 함께 논의한다.

C. M-BEIR Dataset 세부 사항

M-BEIR 벤치마크는 포함된 데이터셋에 추가 처리를 적용하므로, 평가 결과가 표준 데이터셋 평가와 다를 수 있다. Table 10은 벤치마크를 요약하고, Table 12는 해당 지침을 제시한다.

  • 벤치마크 구성: M-BEIR는 포함된 데이터셋에 추가 처리를 적용하며, 이에 따라 표준 개별 데이터셋 설정과 다른 평가 결과가 나올 수 있다.벤치마크의 처리는 원래 데이터셋과 비교해 평가 조건을 변경할 수 있다.
  • 벤치마크 구성: CIRR의 경우 M-BEIR는 학습 데이터를 후보 풀에 포함하므로, 원래 CIRR 데이터셋보다 평가 난이도를 높인다.이 예시는 M-BEIR의 처리가 데이터셋의 평가 설정을 어떻게 바꾸는지 보여준다.
  • 벤치마크 개요: Table 10은 M-BEIR 벤치마크를 요약한다.

D. 미학습 데이터셋 세부 정보 · E. 추가 실험 결과

논문은 익숙한 데이터셋에서 변형된 경우에도 캡션이나 query 형식이 익숙한 데이터셋과 크게 다르면 해당 데이터셋을 미학습으로 간주한다. Table 11은 이러한 데이터셋을 요약하고, Table 12는 M-BEIR instruction을 요약한다.

  • D. 미학습 데이터셋 세부 정보: 미학습 데이터셋은 MSCOCO 또는 FashionIQ에서 변형될 수 있지만, 캡션이나 query 형식이 크게 다르기 때문에 여전히 미학습으로 남는다.논문은 이러한 차이가 원본 데이터셋과 비교해 상당한 격차를 만든다고 강조한다.
  • D. 미학습 데이터셋 세부 정보: Urban1K는 GPT-4V 로 생성한 확장 캡션을 사용하며, 캡션 구성 방식이 변형된 데이터셋을 미학습으로 구분할 수 있음을 보여준다.
  • D. 미학습 데이터셋 세부 정보: CIRCO는 참조 이미지와 상대적 캡션을 결합하며, 변경된 query 형식이 미학습 retrieval 설정을 정의할 수 있음을 보여준다.
  • D. 미학습 데이터셋 세부 정보: Table 11은 미학습 데이터셋을 요약한다.
  • D. 미학습 데이터셋 세부 정보: Table 12는 M-BEIR instruction을 요약한다.

E.1. Global Pool Setting에서 M-BEIR 실험 결과 … G. 한계 및 향후 연구

보충 평가에서 LamRA는 M-BEIR global-pool setting에서 UniIR-CLIP보다 우수한 성능을 보이고, 최신 SOTA 대비 KVQA retrieval을 향상시키며, pointwise와 listwise reranking을 모두 지원한다. 다만 retrieval과 reranking에 별도의 LoRA parameter를 유지해야 한다는 한계가 있다.

  • E.1. Global Pool Setting에서 M-BEIR 실험 결과: LamRA는 global pool setting의 M-BEIR에서 UniIR-CLIP보다 평균 12.5 points 높은 성능을 달성한다.global pool은 본 논문에서 사용한 dataset-restricted local pool과 달리 모든 dataset에서 후보를 통합해 구성한다.
  • E.1. Global Pool Setting에서 M-BEIR 실험 결과: Table 13은 text 및 image query/candidate type에 걸친 M-BEIR global-pool retrieval을 평가하며, FashionIQ와 Fashion200K에는 Recall@10을, 그 외에는 Recall@5를 사용한다.task abbreviation은 qt, qi, ct, ci이며, VN, F200K, InfoS, FIQ는 benchmark dataset을 나타낸다.
  • E.2. Pointwise 및 Listwise Reranking에 대한 상세 실험 결과: LamRA-Rank의 pointwise 및 listwise reranking은 다양한 application에서 모두 성능을 향상시키지만, 후보에 image가 포함될 때 listwise inference가 pointwise inference를 일관되게 능가하지는 않는다.현재 LMM은 단일 image를 표현하는 데 수백 개의 token을 요구하는 경우가 많으며, 이것이 이러한 차이에 기여한다.
  • E.2. Pointwise 및 Listwise Reranking에 대한 상세 실험 결과: Table 14는 top-5 result를 reranking한 뒤 LamRA-Rank(P)와 LamRA-Rank(L)의 Recall@1 및 query당 inference cost를 비교한다.Inference time은 batch size 32에서 8개의 A100 GPU로 측정한다.
  • F. RAG Application 탐색: KVQA 실험은 retrieval-augmented generation을 위해 동일한 LMM 내부에서 retrieval capability와 generative capability를 통합할 수 있는지 탐색한다.이 동기는 universal retriever로서 LamRA가 보인 가능성에 기반한다.
  • F. RAG Application 탐색: retrieval과 VQA를 LoRA로 joint training하면 LamRA는 세 개의 knowledge-based visual question answering dataset에서 최신 SOTA retrieval 성능을 능가한다.KVQA는 먼저 관련 document를 retrieval한 다음, retrieval된 정보를 사용해 질문에 답한다.
  • G. 한계 및 향후 연구: LamRA는 현재 retrieval task와 reranking task에 별도의 LoRA parameter set을 요구한다.향후 연구에서는 이러한 task를 joint training하거나 retrieval training을 supervised fine-tuning 단계에 통합할 수 있다.

H. 추가 정성적 결과 · H.1. 성공 사례 · H.2. 실패 사례

정성적 결과는 LamRA가 텍스트, 이미지, 멀티모달 입력에 걸쳐 다양한 retrieval task를 성공적으로 처리하는 한편, false-negative candidate나 본질적으로 어려운 query에서 실패가 발생함을 보여준다.

  • H.1. 성공 사례: LamRA는 Figures 4–12의 성공 사례에서 보이듯 다양한 retrieval task를 효과적으로 처리한다.사례에는 retrieval 후 reranking이 포함된다.
  • H.2. 실패 사례: 실패 사례에는 false-negative candidate로 인해 발생한 오류와 retrieval failure로 이어지는 본질적으로 어려운 query로 인한 오류가 포함된다.후자의 어려움은 Figure 13의 마지막 행에 예시로 제시된다.
  • H.2. 실패 사례: 실패 사례 시각화는 각 사례를 query 단서와 retrieved result로 구성한다.이 구조는 실패 사례 제시에서 명시적으로 나타난다.
  • H.1. 성공 사례: 정성적 사례는 text-to-image, text-to-text, text-to-text-image retrieval을 다루며, ground truth를 명시적으로 표시한다.Figures 4–6에서는 red box, red text 또는 둘 다를 사용해 ground truth를 식별한다.
  • H.1. 성공 사례: 추가 성공 사례는 image-to-text, image-to-image, text-image-to-image retrieval task로 확장된다.Figures 7–9에서는 red text 또는 red box를 사용해 ground truth를 식별한다.
  • H.1. 성공 사례: 결과는 text-image-to-text 및 text-image-to-text-image retrieval도 성공적으로 수행됨을 보여준다.Figures 10 and 11에서는 red text, red box 또는 둘 다로 ground truth를 표시한다.
  • H.1. 성공 사례: 정성적 섹션에는 retrieval 후 reranking 사례가 포함되며, ground truth는 red box로 표시된다.이 사례들은 Figure 12에 제시된다.
Loading 2412.01720v1…