Source-linked AI summary
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang
TL;DR
기존 RAG 시스템은 텍스트 전용 또는 단일 모달리티 코퍼스에 의존하는 경우가 많아 이질적인 정보 요구를 다루는 능력이 제한된다. UniversalRAG는 각 쿼리를 모달리티 및 세분성별 코퍼스로 라우팅하며, 10개 벤치마크에서 모달리티 특화 및 통합 baseline을 능가한다.
문제
기존 RAG 접근법은 주로 텍스트 전용 또는 단일 모달리티 코퍼스를 사용하므로, 이질적인 지식 소스를 요구하는 쿼리에 대한 지원이 제한된다.
방법
UniversalRAG는 관련된 모달리티–세분성 쌍을 예측하고, 이에 대응하는 독립 코퍼스에서 검색한 뒤, 그 결과를 공동으로 사용해 생성을 grounding한다.
결과
UniversalRAG는 다양한 모달리티와 세분성을 포괄하는 10개 벤치마크에서 모달리티 특화 및 통합 baseline을 능가하며, 분포 외 성능도 견고하다.
시사점 및 한계
결과는 이질적인 외부 지식으로 응답을 grounding하기 위한 실용적 접근으로서, 모달리티와 세분성 전반에 걸친 adaptive retrieval을 뒷받침한다.
시사점 및 한계
기존 벤치마크에는 모달리티 및 세분성의 ground-truth label이 없으므로, 라우팅 정확도는 noisy automatically annotated training data에 의존할 수 있다.
Abstract
from arXiv · showhide
Retrieval-Augmented Generation (RAG) has shown substantial promise in improving factual accuracy by grounding model responses with external knowledge relevant to queries. However, most existing approaches are limited to a text-only corpus, and while recent efforts have extended RAG to other modalities such as images and videos, they typically operate over a single modality-specific corpus. In contrast, real-world queries vary widely in the type of knowledge they require, which a single type of knowledge source cannot address. To address this, we introduce UniversalRAG, an any-to-any RAG framework designed to retrieve and integrate knowledge from heterogeneous sources with diverse modalities and granularities. Specifically, motivated by the observation that forcing all modalities into a unified representation space derived from a single aggregated corpus causes a modality gap, where the retrieval tends to favor items from the same modality as the query, we propose modality-aware routing, which dynamically identifies the most appropriate modality-specific corpus and performs targeted retrieval within it, and further justify its effectiveness with a theoretical analysis. Moreover, beyond modality, we organize each modality into multiple granularity levels, enabling fine-tuned retrieval tailored to the complexity and scope of the query. We validate UniversalRAG on 10 benchmarks of multiple modalities, showing its superiority over various modality-specific and unified baselines.
1. 서론
UniversalRAG는 modality- 및 granularity-specific corpus 간에 query를 routing해 단일 modality RAG의 한계를 극복하고, 다양한 정보 요구에 근거를 둔 응답을 가능하게 한다. 10개 dataset 모두에서 모든 baseline을 능가하는 동시에 효율성을 높이고 out-of-distribution 강건성을 유지한다.
- 동기: 기존 RAG 방법은 대체로 단일 corpus와 modality를 대상으로 하므로, 텍스트, 이미지, 비디오 또는 결합된 근거가 필요한 query에 답하는 능력이 제한된다.RAG는 query와 관련된 외부 지식에 응답을 근거 지음으로써 factual accuracy를 높인다 (Lewis et al., 2020; Gao et al., 2023; Chen et al., 2024a).
- 방법: UniversalRAG는 필요한 modality를 예측하고 해당 modality-specific corpus에서 retrieval을 수행하는 modality-aware routing을 도입하며, cross-modal query에는 여러 corpus를 함께 사용한다.retrieval된 지식은 생성된 응답의 근거로 공동 사용되므로, 모든 modality를 하나의 embedding space에 강제로 투영할 필요가 없다.
- 방법: 이 framework는 지나치게 세밀한 entry가 context를 희석할 수 있고 지나치게 거친 entry가 무관한 정보를 결합할 수 있기 때문에 각 modality를 multiple granularity levels로 구성한다.corpus에는 paragraph, document, table, image, clip, video가 포함되며, 예로 paragraph-level document segmentation과 short video clip이 있다.
- 결과: 다양한 modality와 granularity를 포괄하는 10개 dataset에서 UniversalRAG는 큰 평균 격차로 모든 baseline을 능가하고, 효율성을 높이며, out-of-distribution 환경에서도 강건성을 유지한다.보고된 향상은 modality-aware retrieval과 적절한 granularity 선택에 기인한다.
2. 방법
UniversalRAG는 targeted retrieval 전에 각 query를 가장 적절한 modality–granularity pair로 라우팅해, 통합 multimodal corpus에서 발생하는 modality gap을 피한다. 또한 trained router와 training-free router를 모두 지원하며, query complexity에 맞는 resolution에서 retrieval을 수행한다.
- Modality-Aware Retrieval: Unified-space retrieval은 필요한 modality 대신 text item을 선호할 수 있지만, modality bias가 충분하면 modality-aware routing은 해당 modality의 content를 retrieval할 확률을 높인다.Proposition 2.1은 modality bias가 semantic-relevance variance를 초과할 때 이 결과가 성립함을 보인다.
- Modality-Aware Retrieval: UniversalRAG는 먼저 relevant modality를 식별한 뒤, 보존된 modality-specific corpus 내에서 targeted retrieval을 수행한다.이 two-stage design은 heterogeneous corpus를 하나의 shared embedding space로 집계할 때 발생하는 modality gap을 해결한다.
- Granularity-Aware Retrieval: UniversalRAG는 여러 granularity level로 routing을 확장해, query complexity와 information scope에 따라 fine-grained detail 또는 broader context를 retrieval할 수 있게 한다.Router는 modality–granularity pair를 예측하고, 이후 modality-specialized retriever가 LVLM generation을 위한 content를 확보한다.
- Router: Central router는 각 query에 필요한 knowledge의 optimal modality와 granularity를 결정한다.이 routing decision은 UniversalRAG의 universal, one-for-all retrieval framework를 가능하게 하는 핵심 component다.
- Router: UniversalRAG는 benchmark-derived target을 이용하는 training-based routing과 Gemini (Gemini Team, 2023) 같은 frontier model에 prompt를 입력하는 training-free routing을 지원한다.Training-based approach는 benchmark task의 inductive bias를 활용해 ground-truth routing label의 부재를 보완한다.
3. 실험
UniversalRAG는 다양한 modality와 granularity에 걸쳐 평가되며, 일관되게 가장 높은 평균 성능을 달성한다. 결과는 modality-aware, cross-modal, granularity-aware routing을 뒷받침하는 동시에 효율성과 일반화 측면의 이점도 보여준다.
- Dataset과 Method: UniversalRAG는 no-retrieval, text, table, image, clip, video, cross-modal RAG 시나리오를 포함해 7개 modality와 granularity를 아우르는 benchmark에서 평가된다.실험에서는 naïve, unimodal, unified-embedding multimodal, UniversalRAG 관련 범주로 구성된 12개 baseline과 비교한다.
- 종합 결과: UniversalRAG는 다양한 RAG 시나리오와 LVLM 전반에서 일관되게 가장 높은 평균 성능을 달성하며, unimodal 및 unified-embedding baseline을 능가한다.검색된 modality와 granularity가 query의 정보 요구와 일치할 때 성능이 가장 높으며, 불일치하면 성능이 크게 저하된다.
- Cross-modal Retrieval의 효과: Cross-modal retrieval은 HybridQA의 table-text reasoning과 WebQA의 text-image reasoning을 비롯해 상호 보완적인 증거가 필요한 task의 성능을 향상한다.일부 query는 하나의 modality로만 routing해서는 충분히 해결할 수 없기 때문에 이러한 향상이 나타난다.
- Modality Routing의 효과: Modality routing은 unified-embedding의 modality bias를 완화한다. VLM2Vec-V2와 GME는 필요한 modality와 관계없이 거의 전적으로 또는 주로 text를 검색한다.분석에서는 각 benchmark마다 200개의 query를 sampling하고, VLM2Vec-V2, GME, UniversalRAG를 Qwen3-VL-2B와 비교한다.
- Multigranularity의 효과: Granularity-aware corpus selection은 multi-hop reasoning에 불충분한 context와 관련 없는 전체 video 같은 과도한 context를 피함으로써 일관되게 성능을 향상한다.Granularity level을 추가하면 추가적인 향상이 가능하지만, context 충분성과 noise 간의 trade-off 때문에 개선 폭이 반드시 단조롭게 증가하지는 않는다.
- Modality-Specific Retrieval의 효율성: Modality- 및 granularity-aware routing은 unified mega-corpus 전체를 검색하는 대신 관련 source로 retrieval을 제한해 효율성을 높이며, corpus size가 증가할수록 sub-linear latency growth를 보인다.Scale이 커질수록 routing overhead는 search space 감소에 비해 작다.
4. 관련 연구
기존 연구는 언어 모델과 retrieval-augmented generation을 텍스트에서 시각 및 멀티모달 영역으로 확장했지만, 대체로 고정된 modality 또는 retrieval granularity를 가정한다. 반면 UniversalRAG는 다양한 정보의 구체성에 대응하면서 query 수준에서 modality 간 routing을 수행한다.
- 대규모 Vision Language Model: 대규모 vision-language model은 언어 표현과 정렬된 image 또는 video encoder를 사용해 언어 모델을 visual inputs와 video로 확장한다.이러한 발전은 CLIP 기반 image encoding에서 시작해 다양한 encoder를 사용하는 model과 video extension으로 이어졌다.
- Retrieval-Augmented Generation: 기존 RAG는 textual corpus에서 정보를 검색하는 반면, 최근 방법은 image와 video 같은 multimodal source를 통합하지만 고정된 single-modality retrieval을 가정한다.이러한 고정 modality 가정은 서로 다른 knowledge source를 요구하는 실제 query에 대한 적응성을 제한한다.
- Retrieval Granularity: 대부분의 RAG system은 고정된 retrieval granularity를 사용하지만, query의 요구는 구체성에 따라 달라지며 text와 video retrieval 전반의 성능과 효율성에 영향을 준다.UniversalRAG는 query 수준에서 modality 간 routing을 수행해 이러한 설정에 대응한다.
5. 결론
UniversalRAG는 adaptive routing을 통해 다양한 modality와 granularity를 지닌 corpus에서 지식을 검색한다. 이론적·실증적 결과는 10개 benchmark에 걸쳐 heterogeneous knowledge grounding을 뒷받침한다.
- 결론: UniversalRAG는 다양한 modality와 granularity를 포괄하는 corpus에서 검색해 modality gap과 고정된 granularity retrieval의 한계를 해결한다.modality- 및 granularity-aware routing은 각 query에 가장 적합한 knowledge source를 동적으로 선택한다.
- 결론: 이 framework의 routing mechanism은 theoretical results를 통해 추가로 정당화된다.
- 결론: 10개 benchmark에 대한 empirical evaluation은 heterogeneous external knowledge로 LVLM을 grounding하는 adaptive solution으로서 UniversalRAG의 잠재력을 입증한다.저자들은 이를 분산된 corpus-specific RAG system을 통합하는 one-for-all RAG로 나아가는 단계로 본다.
제한점
UniversalRAG의 routing mechanism은 핵심적이지만, 기존 datasets와 benchmarks에는 쿼리별 이상적인 modality 또는 granularity에 대한 ground-truth label이 없어 고품질 training sample이 필요할 수 있다.
- 핵심 routing mechanism에는 고품질 training sample이 필요할 수 있지만, 기존 datasets와 benchmarks에는 각 쿼리의 이상적인 modality 또는 granularity를 식별하는 label이 없다.
윤리적 고려사항 · A. 데이터셋 추가 세부사항
UniversalRAG는 corpus-specific routing을 통해 환각을 줄이면서 LVLM 및 호환 가능한 retrieval corpus와 통합되도록 설계되었지만, 검색되거나 생성된 콘텐츠는 프라이버시, 유해성, 편향 위험을 초래할 수 있다. 또한 이 논문은 실험 데이터셋, 각 데이터셋의 대상 modality와 corpus/query 규모, 그리고 3:7 학습-테스트 분할을 기록한다.
- 윤리적 고려사항: UniversalRAG는 corpus-specific routing을 통해 모든 LVLM 및 호환 가능한 retrieval corpus와 통합될 수 있다.이 통합은 환각을 줄이는 것으로 설명된다.
- 윤리적 고려사항: corpus-specific routing은 UniversalRAG를 LVLM 및 retrieval corpus와 통합할 때 환각을 줄이는 메커니즘으로 제시된다.
- 윤리적 고려사항: 검색된 출력에는 기반 corpus에 따라 사적이거나 유해하거나 편향된 콘텐츠가 포함될 수 있다.
- 윤리적 고려사항: 생성된 출력에도 기반 corpus 또는 LVLM의 내재화된 지식에 따라 사적이거나 유해하거나 편향된 콘텐츠가 포함될 수 있다.
- 윤리적 고려사항: 이 논문은 이러한 위험을 완화하기 위해 검색과 생성 과정 모두에서 안전장치 메커니즘과 필터링 기법을 사용할 것을 권고한다.
- A. 데이터셋 추가 세부사항: Table 7은 각 실험 데이터셋과 이에 대응하는 knowledge corpus를 요약하며, 대상 modality 유형과 query 및 corpus 규모를 포함한다.각 데이터셋은 3:7 학습-테스트 비율로 나뉜다.
A.1. 도메인 내 데이터셋 · A.2. 도메인 외 데이터셋 · A.3. 평가 지표
평가는 text, tables, images, videos 전반의 도메인 내·외 벤치마크를 아우르며, 각 modality와 reasoning 요구사항에 맞춰 corpus를 구성한다. 성능은 과제에 적합한 accuracy, overlap, semantic similarity 및 custom metric으로 보고한다.
- A.1. 도메인 내 데이터셋: 도메인 내 평가는 retrieval-free MMLU (Hendrycks et al., 2021)부터 text, multimodal, video 벤치마크까지 다양한 retrieval 설정을 포괄한다.평가군에는 MMLU, Natural Questions, HotpotQA, HybridQA, MRAG-Bench, WebQA, InfoSeek, LVBench, VideoRAG 벤치마크가 포함된다.
- A.1. 도메인 내 데이터셋: Text-corpus 구성은 query complexity에 맞춘다. NQ는 최대 100 words의 paragraph를 사용하고, HotpotQA는 multi-hop reasoning을 위해 4K tokens를 초과할 수 있는 관련 documents를 묶는다.NQ는 2,000 development QA pairs를 sampling하고, HotpotQA는 2,000 test QA pairs를 sampling한다.
- A.1. 도메인 내 데이터셋: HybridQA는 modality-specific routing을 평가하기 위해 tables와 textual evidence를 분리하고, MRAG-Bench는 수집한 모든 images를 포함하는 corpus에 대해 multimodal image queries를 평가한다.HybridQA는 2,000 development QA pairs를 sampling하는 반면, MRAG-Bench는 전체 1,353 questions를 평가한다.
- A.1. 도메인 내 데이터셋: Video 평가는 LVBench와 VideoRAG 벤치마크를 포함하며, long videos와 더 짧은 relevant clips에 대한 retrieval을 지원하도록 queries를 재구성하거나 timestamp를 부여한다.LVBench는 주로 five minutes보다 짧은 segments에 초점을 두고 이용 가능한 videos를 사용한다. VideoRAG-Wiki와 VideoRAG-Synth에는 timestamp annotations가 없어 GPT-4o로 video evidence를 식별한다.
- A.2. 도메인 외 데이터셋: 도메인 외 preprocessing은 retrieval modality와 reasoning scope에 맞춰 조정하며, text에는 paragraph 또는 document corpora를, Visual-RAG에는 sampled image pools를, CinePile에는 재구성한 video queries를 사용한다.2WikiMultiHopQA는 annotated candidate contexts를 집계하고, Visual-RAG는 category마다 five images를 sampling하며, CinePile는 이용 가능한 144 videos 각각에서 10 questions를 sampling한다.
- A.3. 평가 지표: Metric은 answer format에 따라 선택한다. multiple choice에는 Top-1 Accuracy, short answers에는 Exact Match와 F1, custom InfoSeek accuracy, longer answers에는 ROUGE-L 또는 BERTScore를 사용한다.Top-1 Accuracy는 정답 여부를 측정하고, Exact Match와 F1은 exact agreement와 word-level overlap을 측정한다. ROUGE-L과 BERTScore는 sequence overlap과 semantic similarity를 포착한다.
B. 추가 구현 세부사항 · C. UniversalRAG의 이론적 분석
UniversalRAG는 visual 및 textual retrieval 신호를 결합하고, 구현을 위해 scene detection과 설정 가능한 training-based routing을 사용하며, routing effectiveness, multigranularity, efficiency를 형식적으로 분석한다.
- B. 추가 구현 세부사항: Retrieval ensemble은 visual similarity에 0.8의 가중치를 부여하고 textual similarity를 결합해 visual element를 검색한다.Textual input으로 이미지는 image caption을, 비디오는 script를 사용한다.
- B. 추가 구현 세부사항: Textual similarity는 이미지에 image caption을, 비디오에 script를 사용한다.
- B. 추가 구현 세부사항: PySceneDetect는 콘텐츠 변화로부터 scene boundary를 감지해 장시간 비디오 처리를 지원한다.
- B. 추가 구현 세부사항: Training-based router는 multi-label logits, multi-hot target, binary cross-entropy loss를 사용하는 경량 classifier head로 구성된다.
- B. 추가 구현 세부사항: Router는 learning rate 2e-5, LoRA rank r=32로 5 epochs 동안 학습한 뒤, inference threshold 0.8을 초과하는 modality와 granularity를 선택한다.
- C. UniversalRAG의 이론적 분석: 이론적 분석은 modality-routing effectiveness, multigranularity, modality-aware routing의 efficiency를 다룬다.
C.1. Modality Routing의 효과 … D.1. 서로 다른 LVLM을 사용한 추가 결과
UniversalRAG의 modality-aware routing은 modality bias를 방지하는 이론적 근거를 가지며, multigranularity는 query별 응답 품질을 높이고 modality-specific retrieval은 점근적 latency를 줄인다. InternVL3.5-8B와 Molmo2-4B를 사용한 10개 benchmark에서 UniversalRAG는 모든 baseline을 능가하며 Oracle 성능에 근접한다.
- C.1. Modality Routing의 효과: modality bias α가 semantic-relevance variance에 비해 충분히 크면, unified retrieval은 modality-aware routing보다 required-modality retrieval probability가 낮다.이 분석은 unified similarity를 modality-bias term과 semantic relevance 및 noise의 합으로 모델링한다.
- C.1. Modality Routing의 효과: α/σ가 충분히 크면, unified embedding retrieval은 routing 이후의 modality-specific retrieval보다 명확히 나쁘며, 이때 routed retrieval의 top-1 required-modality probability는 routing accuracy r과 같다.unified-retrieval bound는 α/σ가 증가함에 따라 0으로 수렴하는 반면, routed retrieval은 probability r을 유지한다.
- C.1. Modality Routing의 효과: |R| = |S| = 10^12, p = 0.8, σ = 0.01일 때, routing accuracy p ≃ 0.17만으로도 routed retrieval이 unified retrieval을 능가하기에 충분하다.이 결과는 multimodal encoder가 본질적인 modality bias를 보이므로 modality-aware routing이 중요함을 강조한다.
- C.2. Multigranularity의 효과: 서로 다른 query가 서로 다른 granularity를 선호한다면, 각 query를 선호 granularity로 routing하는 방식은 고정 granularity 정책보다 기대 응답 품질이 명확히 더 높다.이 이론적 결과는 Tables 4와 9에 보고된 실증적 향상을 뒷받침한다.
- C.3. Modality-Specific Retrieval의 효율성: 크기가 N인 modality-granularity corpus에 대해 UniversalRAG의 latency는 C + T(N)인 반면 unified retrieval은 T(kN)이므로, 점근적 latency가 명확히 더 낮다.이점은 exact retrieval에서 k에 선형인 speedup을 제공하며, T(m) = Θ(log m)일 때 constant-factor 점근적 speedup을 제공한다.
- D.1. 서로 다른 LVLM을 사용한 추가 결과: UniversalRAG는 InternVL3.5-8B와 Molmo2-4B를 사용한 10개 benchmark 전반에서 모든 baseline을 능가하며, Oracle과 comparable한 평균 score를 달성한다.이 결과는 서로 다른 LVLM generator에 걸쳐 robustness와 generalizability를 보인다.
D.2. Multigranularity에 대한 추가 결과 · D.3. Out-of-Domain Dataset에 대한 상세 결과 · E. Unified Embedding Space의 Modality Gap
추가 결과는 multigranularity가 router 성능을 향상시키며 UniversalRAG가 out-of-domain dataset에 강하게 일반화함을 보여준다. Unified multimodal embedding space에서는 modality별 clustering이 나타나며, 이는 modality alignment의 필요성을 뒷받침한다.
- D.2. Multigranularity에 대한 추가 결과: 세 가지 router model에 대한 결과에 따르면, granularity를 통합할 때 training-based router가 일관되게 더 나은 성능을 보인다.이 분석은 두 training-free model에 대한 결과를 보완하며, labeled data가 없는 설정에서 granularity를 검토한다.
- D.2. Multigranularity에 대한 추가 결과: 두 training-free model에 대해 Table 4는 granularity level의 수와 end-to-end 성능 사이의 상관관계를 검토한다.이 분석은 labeled data가 없는 시나리오에서 UniversalRAG의 유연성을 활용한다.
- D.3. Out-of-Domain Dataset에 대한 상세 결과: UniversalRAG는 out-of-domain dataset 전반의 평균에서 모든 baseline을 일관되게 능가하며, training-free router는 보지 못한 query에 대해서도 강한 일반화 성능을 보인다.Trained router는 in-domain dataset보다 상대적으로 낮은 성능을 보이지만 여전히 견고하다.
- D.3. 도메인 외 데이터셋의 상세 결과: 도메인 외 생성 결과는 각 데이터셋별로 별도 보고되어 UniversalRAG 변형과 baseline 방법을 상세히 비교할 수 있다.이 구절은 전반적으로 평균 우수성을 보고하지만, 여기서는 개별 데이터셋 값을 제시하지 않는다.
- E. Unified Embedding Space의 Modality Gap: Figure 7은 여섯 multimodal encoder의 unified embedding space를 시각화하고 modality별 clustering을 보여준다.초록색으로 표시된 text embedding은 다른 modality의 embedding보다 더 멀리 떨어져 있다.
- E. Unified Embedding Space의 Modality Gap: E5-V, GME, Qwen3-VL-Embedding을 포함한 최근 method는 modality를 더 긴밀하게 align하고 embedding-space gap을 좁히는 것을 목표로 한다.이 부분은 PCA visualization에서 관찰된 modality separation에 대한 대응으로 이러한 method를 제시한다.
F. 정성적 결과
정성적 사례 연구는 UniversalRAG가 필요에 따라 여러 소스의 조합을 포함해 쿼리를 적절한 modality와 granularity level로 라우팅함으로써 retrieval을 개선함을 보여준다. 또한 modality 요구사항이 모호하거나 여러 modality에 걸쳐 있을 때의 실패 사례도 드러낸다.
- Granularity 선택: Clip-level retrieval은 더 작고 관련성 높은 video segment에 집중해 full-video retrieval의 무관한 콘텐츠와 균일하게 샘플링된 frame에서 증거를 놓치는 문제를 피한다.이러한 targeted retrieval은 특정 video segment만 필요한 쿼리에 대해 더 정확한 답변을 생성한다.
- 실패 사례: 일부 모호하거나 cross-modal인 사례에서는 routing이 실패하며, GPT-5의 사전 지식이 training-free prediction을 inductive ground-truth label에서 벗어나게 하는 경우도 포함된다.이러한 실패는 정보 요구사항이 불분명하거나 여러 modality에 분산되어 있을 때 modality selection이 보편적으로 신뢰할 수 없음을 보여준다.
- Modality routing: UniversalRAG는 WebQA 쿼리를 image modality로 라우팅하고 풍선을 red, white, and blue로 정확히 식별하며, TextRAG와 VideoRAG와 대조된다.TextRAG는 관련 시각적 세부사항이 부족한 반면, VideoRAG는 temporal reasoning task에 더 적합하다.
- Granularity 선택: Document-level retrieval은 여러 entity에 대한 reasoning에 더 풍부한 context를 제공하는 반면, paragraph-level retrieval은 한 entity에만 초점을 맞춰 잘못된 답변을 생성할 수 있다.HotpotQA 사례는 여러 source의 정보를 결합해야 하는 reasoning에서 적절한 text granularity가 필요함을 보여준다.
- Cross-modal retrieval: UniversalRAG는 여러 modality-granularity combination을 선택해 factual information에는 paragraph를, numerical value와 같은 structured knowledge에는 table을 결합할 수 있다.이러한 cross-modal capability는 쿼리가 주로 하나의 modality에 의존하더라도 다른 modality의 도움을 받을 때 더 포괄적인 evidence를 제공한다.