Source-linked AI summary
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang
TL;DR
기존 benchmark는 visual evidence가 이후 retrieval을 이끄는 중간 신호로 사용되는지를 평가하지 않는다. InterLV-Search는 interleaved language-vision agentic search를 위한 3단계 benchmark를 제시하며, 평가 결과 현재 multimodal agent는 견고한 open-world interleaved search를 수행하기에 여전히 큰 격차가 있음을 보인다.
문제
기존 benchmark는 대체로 visual evidence를 입력에 한정하거나, 검색된 visual을 이후 retrieval 결정을 이끄는 신호가 아니라 answer endpoint로 취급한다.
방법
InterLV-Search는 visual evidence seeking, controlled interleaved search, open-web search를 포괄하는 점진적으로 어려워지는 3개 level에 걸쳐 2,061 examples를 제공한다.
결과
현재 multimodal agent는 견고한 open-world interleaved search를 수행하기에 여전히 큰 격차가 있으며, level 간 및 single-chain과 multi-branch task 간에도 상당한 차이가 존재한다.
시사점 및 한계
InterLV-Search는 성공을 위해 visual evidence를 찾고, 이를 search pivot으로 사용하며, 길거나 분기되는 trajectory 전반에서 일관된 state를 유지해야 함을 보여준다.
Abstract
from arXiv · showhide
Existing benchmarks for multimodal agentic search evaluate multimodal search and visual browsing, but visual evidence is either confined to the input or treated as an answer endpoint rather than part of an interleaved search trajectory. We introduce \textbf{InterLV-Search}, a benchmark for Interleaved Language-Vision Agentic Search, in which textual and visual evidence is repeatedly used to condition later search. It contains 2,061 examples across three levels: active visual evidence seeking, controlled offline interleaved multimodal search, and open-web interleaved multimodal search. Beyond existing benchmarks, it also includes multimodal multi-branch samples that involve comparison between multiple entities during the evidence search. We construct Level 1 and Level 2 with automated pipelines and Level 3 with a machine-led, human-supervised open-web pipeline. We further provide InterLV-Agent for standardized tool use, trajectory logging, and evaluation. Experiments on proprietary and open-source multimodal agents show that current systems remain far from solving interleaved multimodal search, with the best model below 50% overall accuracy, highlighting challenges in visual evidence seeking, search control, and multimodal evidence integration. We release the benchmark data and evaluation code at https://github.com/hbhalpha/InterLV-Search-Bench
1 서론
InterLV-Search는 중간 시각 증거가 텍스트와 시각 양쪽 modality에서 후속 검색 결정을 이끄는 interleaved multimodal search를 대상으로 한다. 세 단계의 점진적으로 어려운 수준에 걸쳐 multi-branch 비교를 포함한 2,061개 예제를 제공하며, InterLV-Agent로 현재 multimodal agent를 평가한 결과 최상위 모델의 overall accuracy가 50% 미만임을 보인다.
- 동기: 초기 입력에 시각 정보를 대체로 제한했던 기존 benchmark와 달리, InterLV-Search는 검색 중 visual evidence acquisition을 평가한다.기존 multimodal agentic search benchmark는 주로 textual evidence acquisition에 초점을 맞추는 반면, visual browsing benchmark는 시각 증거를 interleaved search trajectory가 아니라 browsing의 일부로 다룬다.
- 동기: InterLV-Search는 중간 시각 증거가 단순히 답변의 출처로만 쓰이지 않고 이후 검색 행동을 이끌도록 요구한다.Agent는 시각 증거와 텍스트 증거를 동적으로 오가며, 한 modality가 다른 modality에서 이어질 검색 행동을 결정한다.
- Benchmark: 이 benchmark는 세 가지의 점진적으로 어려운 수준에 걸쳐 2,061개 예제를 포함한다: active visual evidence seeking, offline interleaved multimodal search, open-web interleaved multimodal search.이 수준들은 visual evidence seeking과 offline 및 open-web interleaved multimodal evidence search를 평가한다.
- Benchmark: Multi-branch 예제는 agent가 여러 entity를 비교하고, 대안 branch를 탐색하며, multimodal evidence를 수집하고, 하나의 branch를 선택하도록 요구한다.이는 기존의 single-chain multimodal search benchmark를 넘어 비선형 search control을 평가한다.
- 평가: 최상위 모델의 accuracy는 여전히 overall 50% 미만으로, 현재 multimodal agent가 interleaved search와 evidence integration에 여전히 어려움을 겪음을 보여준다.평가는 tool use를 활용해 proprietary 및 open-source multimodal agent를 모두 다룬다.
- 방법: InterLV-Agent는 unified tool use, trajectory logging, model comparison을 표준화하며, 구축에는 Level 1–2에 automated pipeline을, Level 3에 machine-led, human-supervised process를 사용한다.Level 1–2는 multimodal entity data와 knowledge-graph chain을 활용하는 반면, Level 3는 interleaved multimodal evidence search가 필요한 open-world question-answering pair를 생성하기 위해 web-capable agent를 사용한다.
2 InterLV-Search 벤치마크
InterLV-Search는 시각적 증거 탐색부터 제어된 multi-hop 검색과 open-web 실행까지, 점진적으로 난도가 높아지는 세 단계로 interleaved multimodal search를 구성한다. 이 벤치마크는 다양한 도메인에 걸친 2,061개 예제로 구성되며, 후반 단계에는 multi-hop 및 multi-branch 사례가 포함된다.
- 벤치마크 설계: 세 단계는 누락된 시각적 증거를 획득하는 과정에서 시작해, 시각적 증거를 multi-hop pivot으로 활용하고, 최종적으로 open web에서 interleaved search를 실행하는 과정으로 이어진다.이러한 진행에는 시각적 증거 탐색, 증거에서 query로의 전환, 그리고 궁극적으로 open-web 환경에서 동일한 검색 패러다임을 수행하는 과정이 필요하다.
- 데이터 구축: Level 3는 semi-automated open-web pipeline을 사용하고, Levels 1과 2는 완전 자동화된 생성, 구성, 검증, 품질 필터링 pipeline으로 구축된다.실제 웹페이지는 더 잡음이 많은 증거를 제공하므로, Level 3는 web-search-capable 생성 agent와 PhD 수준의 인간 감독을 결합한다.
- Level 1: 시각적 증거 탐색: Level 1은 암묵적 target entity를 검색한 뒤 이미지를 검사해 세밀한 시각적 속성 질문에 답하는 Search-to-VQA task다.벤치마크는 standalone search, standalone VQA, commonsense 추측, metadata 조회, leakage 또는 모호한 target만으로 해결 가능한 사례를 제외한다.
- Level 2: 제어된 Interleaved Search: Level 2는 최소 두 차례의 시각적 증거 검색을 요구하며, 초기 시각적 단서를 후속 retrieval target으로 변환한 뒤 최종 이미지를 grounding한다.MMKG-W의 entity-relation annotation을 재사용해 검증 가능한 multi-hop 경로를 발굴하고, initial-visual-probed 및 intermediate-visual-probed 구성을 지원한다.
- 벤치마크 개요: 2,061개 예제는 다양한 시각 및 open-web 도메인에 걸쳐 Level 1 975개, Level 2 225개, Level 3 861개 instance로 구성된다.Level 2와 Level 3의 평균 추정 chain length는 각각 6.0 hop과 6.9 hop이다.
- 벤치마크 개요: Level 3의 39.5%에 해당하는 340개 예제는 증거 검색 중 여러 entity 간 비교를 평가하도록 설계된 multi-branch 사례다.이 예제들은 단일 chain 기반 interleaved search를 넘어 벤치마크의 범위를 확장한다.
3 InterLV-Agent
InterLV-Agent는 통합 멀티모달 도구, trajectory logging, 모델 비교를 갖춘 reason–act–observe 프레임워크를 통해 InterLV-Search 평가를 표준화한다. 또한 이후 검색 수준을 위해 통제된 오프라인 retrieval과 2단계 memory를 지원한다.
- 3 InterLV-Agent: InterLV-Agent는 reason–act–observe loop, 통합 도구 사용, trajectory logging, 모델 비교를 통해 평가를 표준화한다.도구에는 image search, reverse image search, web search, 웹페이지 탐색, image cropping, code execution이 포함된다.
- 3 InterLV-Agent: Level 1과 Level 2에서는 오프라인 멀티모달 retriever가 benchmark corpus에 대한 통제된 retrieval을 지원한다.
- 3 InterLV-Agent: Level 2와 Level 3에서는 2단계 memory가 최근 interaction round를 저장하고 과거 observation을 간결한 history note로 요약한다.
4 실험
실험 결과, 검색 없이는 InterLV-Search가 여전히 어렵고, tool use가 도움이 되지만 복잡한 multimodal search의 약점을 해소하지는 못한다. 분석 결과 visual-evidence retrieval, search topology, memory, interleaved tool use가 성능을 좌우하는 중요한 요인으로 나타났다.
- 주요 결과: 도구 없이 모든 모델의 정확도는 제한적이며, 최고 Level 3 모델도 20.00%에 그친다. 반면 tool use는 proprietary 모델에서 일관된 성능 향상을 가져온다.이는 InterLV-Search가 parametric knowledge만으로는 안정적으로 해결될 수 없음을 보여준다.
- 주요 결과: Level 3에서 모든 모델은 single-chain examples보다 multi-branch examples에서 성능이 크게 낮으며, 이는 복잡한 search topology에 대한 제한적인 robustness를 드러낸다.이는 더 단순한 search chain만이 아니라 비선형 multimodal search control을 평가해야 함을 뒷받침한다.
- Retrieval–answer decomposition: Acc.|Ret.는 Acc.|UnRet.보다 일관되게 높으며, 특히 Level 2에서 그 차이가 크다. 반면 제한적인 Ret. R@5—특히 Level 2에서—로 인해 target-evidence localization이 주요 병목으로 남는다.성공적인 retrieval은 정답에 크게 기여하지만, retrieval recall은 여전히 제한적이다.
- Component ablations: image search를 제거하면 Level 2 performance drop이 크게 나타나며 Direct baseline보다 낮아질 수도 있다. 반면 Level 3에서의 영향은 더 작지만 여전히 일관되게 부정적이다.open web의 더 풍부한 textual evidence는 visual signal을 부분적으로 대체할 수 있지만 visual retrieval은 여전히 유용하다. 또한 trajectory가 일반적으로 더 긴 Level 3에서는 memory의 효과가 더 뚜렷하다.
- Tool use and trajectories: Level 2 tool use는 image-related retrieval이 지배적인 반면, Level 3는 여전히 image-related tools를 상당히 사용하면서 web/text retrieval에 더 많이 의존한다.실행된 trajectory의 상당 부분에는 visual pivot이 포함되며, 여기서 visual evidence는 최종 답변에만 사용되는 것이 아니라 후속 검색을 안내한다.
5 결론 … B 상호작용 예산의 효과
결론은 interleaved multimodal search가 기존 agentic-search benchmark를 넘어 시각적 증거 탐색, 검색 전환, 장기 또는 분기형 trajectory 전반에서 일관된 상태 유지라는 과제를 드러낸다고 설명한다. 제공된 발췌문에는 multimodal search agent와 multimodal agentic-search benchmark에 관한 related-work 하위 절도 나열되어 있지만, Appendix나 상호작용 예산 절에 대한 실질적인 내용은 없다.
- 5 결론: InterLV-Search는 단순히 외부 도구에 접근하는 것을 넘어, 기존 agentic-search benchmark로는 포착되지 않는 과제를 드러낸다.결론은 이러한 과제를 benchmark의 각 level에 걸쳐 제시하고, retrieval–answer decomposition, tool-use analysis, trajectory inspection을 통해 benchmark 설계를 검증한다.
- 5 결론: 성공하려면 의도된 시각적 증거를 찾아 이를 검색 전환점으로 활용하고, 장기 또는 분기형 trajectory 전반에서 일관된 검색 상태를 유지해야 한다.
- A 관련 연구: related-work 개요에는 multimodal search agent에 관한 하위 절이 포함되어 있다.
- A 관련 연구: related-work 개요에는 multimodal agentic-search benchmark에 관한 하위 절이 포함되어 있다.
C Agentic Framework 세부 사항 … A.1 Multimodal Search Agent
이 논문은 전용 memory, tool, prompt 구현을 갖춘 agentic framework를 제시하며, 세 benchmark level 전체를 아우르는 case study와 Level 3의 성공 및 실패 분석을 함께 다룬다. 또한 관련 연구 논의에서는 multimodal search agent의 필요성을 제시하는 한편, text 중심의 evidence acquisition이 여전히 지속되는 한계를 지적한다.
- C Agentic Framework 세부 사항: agentic framework의 memory 구현은 subsection C.1에서 자세히 설명한다.
- C Agentic Framework 세부 사항: subsection C.2에서는 framework의 tool 구현을 설명한다.
- C Agentic Framework 세부 사항: subsection C.3에서는 agentic framework가 사용하는 prompt를 명시한다.
- D Case Study: case study에서는 Level 1, Level 2, Level 3의 예시를 다룬다.
- D Case Study: 또한 case study에서는 Level 3의 성공 및 실패 사례를 분석한다.
- A.1 Multimodal Search Agent: Multimodal search agent는 open-domain task를 위해 tool 사용, web browsing, image search, iterative evidence acquisition을 통해 정적인 multimodal reasoning을 확장한다.
- A.1 Multimodal Search Agent: 기존 agent는 여전히 대체로 text 중심이다. visual information은 흔히 초기 입력으로만 사용되는 반면, 이후 evidence acquisition은 주로 textual query와 webpage reading에 의존한다.
A.2 멀티모달 에이전틱 검색 벤치마크
기존 멀티모달 검색 벤치마크는 사용자가 제공하거나 검색된 시각적 증거에 대한 추론을 평가하는 반면, InterLV-Search는 시각적 증거를 능동적으로 확보하고 이를 이후의 텍스트 검색과 인터리브하는 에이전트를 평가한다. 이 설정은 시각적 발견이 후속 쿼리, 페이지, 도구 또는 분기 결정을 이끄는 open-web 정보 탐색을 대상으로 한다.
- 기존 browsing 벤치마크: BrowseComp과 같은 초기 browsing 벤치마크는 어려운 다단계 웹 검색, 텍스트 증거 종합, browsing 깊이, 최종 답변의 정확성을 강조한다 (Wei et al., 2025; Zhang et al., 2026a).
- 기존 멀티모달 검색 벤치마크: MMSearch와 FVQA-Test는 외부 증거와 함께 사용자가 제공한 이미지에 대한 추론을 요구하지만, 시각 정보는 대체로 검색 중 능동적으로 탐색하기보다 사전 지정된다 (Wu et al., 2025; Jiang et al., 2024; Li et al., 2025a).
- 기존 멀티모달 browsing 벤치마크: BrowseComp-VL과 VDR-Bench는 더 풍부한 시각 입력, 영역 수준 검사, cropping, 노이즈가 있는 웹 환경을 추가하지만, 주로 주어지거나 검색된 시각적 증거의 해석을 평가한다 (Zeng et al., 2026).
- InterLV-Search: InterLV-Search는 에이전트가 시각적 증거를 능동적으로 확보하고, 이를 사용해 이후 검색을 유도하며, 텍스트 증거와 시각적 증거 사이를 반복적으로 오가도록 요구한다.browsing 중 발견한 시각적 단서는 다음 쿼리, 엔티티, 페이지, 도구 호출 또는 분기 결정을 좌우할 수 있다.
B 상호작용 예산의 효과 · C Agentic Framework 세부 사항
상호작용 예산은 통제된 오프라인 Level 2보다 오픈 웹 Level 3에서 훨씬 더 중요하며, Level 2에서는 몇 번의 상호작용 후 성능 향상이 포화된다. InterLV-Agent는 reason-act-observe loop, 멀티모달 도구, 제한된 예산, two-level memory를 통해 이 검색을 구현한다.
- B 상호작용 예산의 효과: Level 2는 더 작은 상호작용 예산을 사용하는 반면, Level 3는 오픈 웹 검색, branch 탐색, 오류 복구를 위해 더 큰 예산을 요구한다.이는 Level 2의 더 짧은 통제된 오프라인 chain과 Level 3의 더 폭넓은 검색 요구를 반영한다.
- B 상호작용 예산의 효과: Level 2 정확도는 직접 응답에서 몇 번의 tool interaction으로 전환할 때 향상되지만, evidence path가 고정되어 있어 약 5–7번의 상호작용에서 포화된다.주요 과제는 대체 source를 반복해서 탐색하는 것이 아니라 의도된 evidence-to-query chain을 따라가는 것이다.
- B 상호작용 예산의 효과: Level 3는 예산을 5번의 상호작용으로 늘릴 때 큰 향상을 보이며, 더 큰 예산은 webpage 탐색, noisy evidence 복구, branch 비교를 지원한다.추가 tool call이 distractor를 유입할 수 있으므로 모든 model에서 향상이 엄밀히 단조적이지는 않다.
- C Agentic Framework 세부 사항: InterLV-Agent는 제한된 상호작용 예산하에서 tool을 선택하고, 결과를 관찰하며, 다음 단계 전에 memory를 업데이트하는 reason-act-observe loop를 실행한다.workflow는 user query와 현재 search state에 대한 reflection으로 시작한다.
- C Agentic Framework 세부 사항: 경량 two-level memory는 최근 상호작용을 저장하고, 이후 검색 단계에서 누적된 evidence와 해결되지 않은 subgoal을 요약한다.Short-term memory는 최근 context를 처리하고, long-term memory는 요약된 evidence와 미해결 open subgoal을 보존한다.
- C Agentic Framework 세부 사항: 이 framework는 text-to-image, image-to-image, web-search, webpage-browsing, screenshot-browsing, image-cropping, code-execution tool을 통합한다.이 tool들은 agentic search 중 멀티모달 evidence acquisition을 지원한다.
C.1 메모리 구현
InterLV-Agent는 이전 메모리, 현재 tool query, 반환된 observation으로부터 갱신되는 경량 running memory를 사용한다. 2단계 설계는 최근 상호작용의 세부 정보를 보존하면서 장기 검색 상태를 간결하게 요약한다.
- C.1 메모리 구현: running memory는 각 step마다 이전 memory, 현재 tool query, tool이 반환한 result로부터 갱신된다.이 memory-update 과정은 다음 step에 최신 상호작용 상태를 제공한다.
- C.1 메모리 구현: Short-term memory는 최근 상호작용 라운드를 저장하고, long-term memory는 entity, evidence, visual clue, 미해결 subgoal을 요약한다.최근 라운드는 tool 이름, query, observation을 직접 보존하는 반면, long-term summary는 확장된 interleaved trajectory에서 context를 간결하게 유지한다.
C.2 도구 구현 · C.3 에이전트 프레임워크 프롬프트
InterLV-Agent는 온라인 open-web 검색과 오프라인 제어형 retrieval을 통합하며, 에이전트 프레임워크는 반복적 멀티모달 도구 사용, 증거 기반 상태 업데이트, answer-equivalence 평가를 조율한다. 이 프레임워크는 검색 결정, 실행 메모리 압축, gold reference와의 최종 답변 대조를 유도하기 위해 특화된 prompt를 사용한다.
- C.2 도구 구현: InterLV-Agent는 benchmark의 모든 level에서 온라인 open-web 검색과 오프라인 제어형 retrieval을 위한 통합 도구 인터페이스를 제공한다.오프라인 도구는 고정 corpus 평가를 지원하고, 온라인 도구는 실제적인 open-web 환경에서 동일한 agentic search loop를 재현한다.
- C.2 도구 구현: 온라인 Level 3 도구는 image search, web search, reverse image search, webpage browsing, screenshot browsing, image cropping, code execution을 결합한다.SerpAPI는 web search와 image search를 구현하고, Playwright는 screenshot browsing을 지원하며, observation에는 검색 결과 상위 5개가 사용된다.
- C.3 에이전트 프레임워크 프롬프트: 에이전트 prompt는 검색을 web search 또는 image search, page inspection, cropping, code execution, summarization, final answering 사이의 반복적 결정으로 규정한다.충분한 증거가 수집되면 간결한 도구 지향 action, 짧은 사전 검색 성찰, 단일 done block을 요구한다.
- C.3 에이전트 프레임워크 프롬프트: prompt는 visual evidence 또는 text retrieval이 불충분할 때 에이전트가 webpage를 inspection하고, 검색 결과의 relevance와 reliability를 비판적으로 평가하도록 지시한다.적절한 경우에는 모든 질문을 검색하기보다 기존 지식만으로 직접 답할 수 있다.
- C.3 에이전트 프레임워크 프롬프트: running-memory prompt는 이전 memory를 superseded, speculative, irrelevant information을 제거한 짧은 evidence-backed state snapshot으로 대체한다.구조화된 field에는 goal, status, blocking gap, confirmed facts, best candidates, dead ends, useful key images가 포함된다.
- C.3 에이전트 프레임워크 프롬프트: answer-equivalence judge는 gold answer와 비교하여 predicted final answer만 평가하며, 동등한 표현, alias, 숫자 표기, specificity, 무해한 서술적 추가를 허용한다.명확히 일치하는 답변에는 정확히 YES를, 명확히 다른 답변에는 NO를 반환하며, 외부 지식을 사용하지 않는다.
D 사례 연구 … D.2 Level 2 사례
사례 연구는 단일 체인 및 다중 분기 trajectory를 통해 interleaved multimodal search를 보여준다. 여기서는 시각적 증거가 이후의 텍스트·관계·세밀한 시각 추론을 반복적으로 뒷받침한다. Level 1은 능동적 이미지 검색을 강조하는 반면, Level 2는 최종 VQA 이전의 중간 pivot으로 시각적 증거를 사용한다.
- D 사례 연구: 한 Level 2 chain은 호수와 정자가 있는 스카이라인에서 Hangzhou를, 랜드마크 파노라마에서 Wuhan을 식별하고, 자매도시 관계를 통해 Galați를 찾은 뒤 최종 건물 세부 정보를 질의한다.검색은 시각적 설명과 텍스트 기반 지리적 또는 관계적 제약을 번갈아 사용한다.
- D 사례 연구: 한 Level 3 single-chain 사례는 Ariana Grande의 Eternal Sunshine에서 Wicked, Harriet, Glass Onion, Almost Famous를 거쳐 Nomadland의 차량이 van임을 식별한다.trajectory의 중간 출력에는 Harriet → Leslie Odom Jr. → Glass Onion 및 Almost Famous → Frances McDormand → Nomadland가 포함된다.
- D 사례 연구: 사례에는 single-chain과 multi-branch Level 3 trajectory가 모두 포함되며, 후자는 최종 시각적 해석을 수행할 branch를 선택하기 전에 여러 entity를 비교해야 한다.multi-branch 예시는 서로 다른 Amazon 및 World Wetlands Day 페이지에서 시작해 공식 국기를 통해 수렴한다.
- D.1 Level 1 사례: Level 1은 텍스트 정보 요구로 시작해 의미적 추론을 통해 local collection에서 일치하는 이미지를 검색하고, 세밀한 시각 질문으로 끝난다.답변하기 전에 검색된 이미지가 질문 맥락과 일치하는지 검사해야 한다.
- D.2 Level 2 사례: Level 2 사례는 여러 visual-search block과 텍스트 관계 제약을 interleave하며, 랜드마크 설명을 사용해 도시를 식별한 뒤 최종 이미지로 돌아가 세밀한 VQA를 수행한다.이 trajectory는 최종 VQA의 source로만 시각적 증거를 사용하는 것이 아니라 중간 검색 pivot으로 활용한다.
D.3 Level 3 사례
Level 3 사례에서는 open-web search 전반에 걸쳐 agent가 visual localization과 textual verification을 번갈아 수행해야 한다. multi-branch route comparison과 visual evidence가 이후 search를 반복적으로 재지정하는 긴 single-chain trajectory를 다룬다.
- Multi-branch 사례: Multi-branch 사례에서는 candidate image 또는 webpage를 localize하고, title·year·runtime을 검증하며, route 간 textual evidence를 비교한 뒤 살아남은 branch를 유지해야 한다.각 route는 서로 다른 film page에 연결된 여러 visual clue에서 시작해 comparison 결과에 따라 이어진다.
- Single-chain 사례: Single-chain 사례는 시각적으로 묘사된 music clue에서 시작해 긴 interleaved trajectory 동안 film poster, cast member, film page를 거치며 반복적으로 전환한다.한 예에서는 pastel-toned breakup album에서 artist를 식별하고, textual evidence를 사용해 Wicked로 이어간 다음, poster와 green-skinned co-lead를 단서로 다시 전환한다.
- Level 3 사례: Level 3는 continuation 전에 parallel route를 비교하는 multi-branch 사례와, 반복되는 visual pivot에 의해 진행되는 긴 open-web trajectory가 필요한 single-chain 사례를 결합한다.두 패턴 모두 image를 고정된 input이나 최종 VQA endpoint로 취급하지 않고 visual localization과 textual verification을 번갈아 수행한다.
D.4 Level 3 성공 및 실패 사례
Level 3에서 성공하려면 visual evidence가 multi-branch open-web search를 이끌고, search state를 보존하며, 경로를 비교하고, 선택한 branch로 돌아가 terminal inspection을 수행해야 한다. 실패는 visual pivot을 근거화하지 않은 채 광범위한 textual search에 의존할 때 발생하며, 이로 인해 올바른 branch recovery와 최종 visual answer가 불가능해진다.
- 성공 사례: 성공적인 trajectory는 vision을 endpoint로 취급하는 대신 image search, official-page text lookup, branch comparison, terminal visual inspection을 번갈아 수행한다.이 workflow는 visual clue에 근거를 부여하고, textual runtime을 복원하며, 선택한 branch를 보존하고, 최종 visual question answering 단계를 수행한다.
- 실패 사례: Tate/Picasso와 Berlinale/Niigata 실패 사례는 어느 branch도 해당 local-symbol system에 시각적으로 근거화하지 못해, 올바른 purple border color 대신 blue라고 답한다.제공된 failure trace에서 model answer는 Blue이고, correct answer는 Purple로 식별된다.
- 실패 사례: 또 다른 실패 사례는 bus graphic을 근거화하지 않은 채 광범위한 textual search를 사용해 COP30 guardian identity와 Pará branch를 놓치고, flag의 red field를 올바른 white diagonal band와 혼동한다.model answer는 Red이고, correct answer는 White다.