Source-linked AI summary
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai, Quanxin Shou, Yunlong Lin, Xiangyu Yue, Shenghua Gao, Tianyu Pang
TL;DR
Frontier 멀티모달 검색 에이전트는 고품질 학습 데이터, 투명한 파이프라인, 상세한 레시피를 이용하기 어려워 재현이 어렵다. OpenSearch-VL은 정제된 multi-hop 데이터, 다양한 도구, fatal-aware agentic reinforcement learning을 결합한 공개 학습 레시피를 제공하며, 7개 벤치마크에서 평균 13.8점 향상을 달성한다. 저자들은 재현 가능한 연구를 지원하기 위해 데이터, 코드, 모델을 공개할 예정이다.
문제
Frontier 멀티모달 검색 에이전트는 고품질 학습 데이터, 코드, 학습 레시피가 충분히 공개되지 않아 여전히 재현하기 어렵다.
방법
OpenSearch-VL은 Wikipedia 기반 multi-hop 데이터 큐레이션, 다양한 멀티모달 도구 환경, 멀티모달 deep search 에이전트를 위한 fatal-aware GRPO 학습을 결합한다.
결과
7개 멀티모달 deep search 벤치마크에서 평균 13.8점 향상을 OpenSearch-VL-30B-A3B가 달성한다.
시사점 및 한계
OpenSearch-VL은 멀티모달 agentic search의 재현 가능한 연구를 위한 공개 기반을 제공한다.
시사점 및 한계
신뢰할 수 없는 외부 호스팅 도구 API와 비용이 높고 버전에 의존하는 GPT-4o 평가로 인해 학습 안정성과 정확한 수치 재현성이 영향을 받는다.
Abstract
from arXiv · showhide
Deep search has become a crucial capability for frontier multimodal agents, enabling models to solve complex questions through active search, evidence verification, and multi-step reasoning. Despite rapid progress, top-tier multimodal search agents remain difficult to reproduce, largely due to the absence of open high-quality training data, transparent trajectory synthesis pipelines, or detailed training recipes. To this end, we introduce OpenSearch-VL, a fully open-source recipe for training frontier multimodal deep search agents with agentic reinforcement learning. First, we curated a dedicated pipeline to construct high-quality training data through Wikipedia path sampling, fuzzy entity rewriting, and source-anchor visual grounding, which jointly reduce shortcuts and one-step retrieval collapse. Based on this pipeline, we curate two training datasets, SearchVL-SFT-36k for SFT and SearchVL-RL-8k for RL. Besides, we design a diverse tool environment that unifies text search, image search, OCR, cropping, sharpening, super-resolution, and perspective correction, enabling agents to combine active perception with external knowledge acquisition. Finally, we propose a multi-turn fatal-aware GRPO training algorithm that handles cascading tool failures by masking post-failure tokens while preserving useful pre-failure reasoning through one-sided advantage clamping. Built on this recipe, OpenSearch-VL delivers substantial performance gains, with over 10-point average improvements across seven benchmarks, and achieves results comparable to proprietary commercial models on several tasks. We will release all data, code, and models to support open research on multimodal deep search agents.
1 서론
OpenSearch-VL은 멀티모달 deep search agent를 학습하기 위한 완전 공개 recipe를 제시하며, 공개 데이터·도구·agentic reinforcement learning을 통해 재현성을 확보하는 것을 목표로 한다. 독점 학습 자원, 장기 horizon tool-use 실패, 불완전한 시각 입력의 병목을 해결하고, 강력한 agentic baseline 대비 benchmark 성능을 향상한다.
- 동기: 이 연구는 독점 학습 자원을 재현성의 핵심 병목으로 지적한다. 데이터 출처, filtering 기준, demonstration, tool-use trajectory가 일반적으로 비공개이기 때문이다.이로 인해 agentic search behavior에 어떤 데이터 속성이 필수적인지 체계적으로 연구하기 어렵다.
- 과제: 장기 horizon agentic RL은 malformed call, timeout, 무관한 query, 반복되는 실패로 인해 이후 rollout 단계가 무효화될 수 있고, 이를 버리면 실패 이전의 유용한 reasoning까지 소실되기 때문에 어렵다.완전히 실패한 rollout을 그대로 학습하면 의미 없는 failure 이후 token에서 비롯된 noisy gradient가 발생한다.
- 데이터 큐레이션: OpenSearch-VL은 Wikipedia hyperlink graph에서 entity path를 sampling하고 중간 entity를 fuzzy description으로 rewriting하여 고품질 image-grounded multi-hop data를 구축한다.이 pipeline은 sampling된 multi-hop path를 multi-hop VQA instance로 변환한 뒤 추가 curation 단계를 적용한다.
- 결과: OpenSearch-VL은 Qwen3-VL-30B-A3B agentic baseline의 average score를 47.8에서 61.6으로 향상하며, VDR에서 +13.3, MMSearch에서 +24.5, FVQA에서 +10.2, InfoSeek에서 +16.2의 향상을 달성한다.이 실험은 멀티모달 deep search benchmark 전반에서 수행된다.
- 기여: 이 recipe는 멀티모달 agentic search 연구를 위해 training data, code, model을 공개하여 재현성을 목표로 한다.이 연구는 frontier 멀티모달 deep search agent를 학습하기 위한 완전 공개 recipe로 제시된다.
2 사전 지식
OpenSearch-VL은 multimodal search를 시각 및 retrieval 도구에 대한 reasoning, tool call, environment observation의 ReAct 스타일 교차 수행으로 정식화한다. 사전 지식에서는 multimodal history 축적, trajectory likelihood와 generation masking, 세 기능으로 구성된 search-tool suite를 정의한다.
- 문제 정식화: 에이전트는 축적된 이미지, action, observation을 대상으로 시각 또는 retrieval tool call과 reasoning을 교차 수행하며 질문에 답한다.각 action은 reasoning trace와 tool invocation을 포함하거나, 마지막 단계에서는 ReAct (Yao et al., 2022) 관례에 따라 response를 포함한다.
- Multimodal Observation과 능동적 Visual Context: 초기 이미지와 이전의 모든 image observation을 보존함으로써 visual context가 단조롭게 증가하고, 여러 hop에 걸친 변환 간 상호 참조가 가능해진다.environment는 tool family에 따라 command를 결정론적으로 라우팅하고, 이미지와 텍스트로 구성된 multimodal observation을 반환한다.
- Trajectory Likelihood: Trajectory likelihood는 policy가 생성한 action에 확률을 할당하고, environment observation은 이후 history에 영향을 미치는 외생 입력으로 처리한다.이 factorization은 SFT로 학습되며 RL objective에 필요한 토큰별 importance ratio를 제공한다.
- Token-level Generation Mask: Generation masking은 최적화를 policy가 방출한 reasoning 및 tool-call token으로 제한하고, 텍스트 observation span과 이미지값 observation은 token-level loss에서 제외한다.OCR 이외의 visual tool에서 나온 image observation은 visual backbone에 직접 입력된다.
- Search Tools: Tool suite는 TextSearch, ImageSearch, Sharpen, SuperResolution, PerspectiveCorrect, Crop, OCR을 통해 retrieval, image enhancement, attention 또는 parsing을 결합한다.이 기능들은 각각 외부 evidence를 확보하고, 저품질 입력을 개선하며, 세밀한 content를 위치 지정하거나 해독한다.
3 데이터셋 큐레이션
OpenSearch-VL은 도구 사용이 필요한 멀티모달 질문을 구성하고, 이를 필터링·개선하며, 학습용 전문가 trajectory를 합성하는 확장 가능한 무주석 큐레이션 파이프라인을 구축한다. 이 설계는 multi-hop Wikipedia 경로, fuzzy entity rewriting, source-anchor visual grounding을 결합해 단일 검색에 의존하는 shortcut을 억제한다.
- 파이프라인 개요: 이 파이프라인은 VQA 구성, 단계적 필터링 및 개선, 전문가 trajectory 합성을 통해 무주석 데이터 생성을 확장한다.이 세 단계에서 후속 학습에 사용되는 최종 데이터셋이 생성된다.
- Fuzzy Rewriting 및 Visual Grounding: Fuzzy entity rewriting과 answer obfuscation은 개체명 shortcut을 방지하고, source-anchor visual grounding은 경로의 초기 개체를 시각적 지시 표현으로 대체한다.Anchor 이미지는 Wikimedia Commons 또는 Wikipedia infobox에서 검색하고 CLIP similarity로 필터링해 시각적 증거와 답변 개체를 분리한다.
- Wikipedia 경로 샘플링: Wikipedia에서 제약된 multi-hop walks를 수행해 anchor 및 bridge 역할을 할당하고, cycle, hub, disambiguation page, list page를 피하는 reasoning chain을 생성한다.경로 길이는 h ∈ {2, 3, 4}이며, source node가 시각적 진입점 역할을 하고 이후 node들이 중간 reasoning을 뒷받침한다.
- 필터링 및 개선: Wikipedia에서 파생된 instance를 LiveVQA, FVQA, WebQA와 병합한 뒤, 도구 사용이 필요하고 visual enhancement가 필요한 저화질 이미지 사례를 유지하도록 필터링한다.Frozen Qwen3-VL-32B가 도구 없이 해결 가능한 예시를 제거하고, 필터링된 pool의 10%에는 enhancement tool과 함께 blur, downsampling 또는 perspective distortion을 적용한다.
- Trajectory 합성: 평균 6.3 tool-invocation turns를 갖는 36,592개의 고품질 전문가 trajectory가 2단계 rejection filtering 후 SFT corpus를 구성한다.Claude Opus 4.6은 생존한 각 instance에 대해 실제 실행 환경에서 독립적인 multi-turn ReAct rollout 5개를 생성했다.
4 학습
OpenSearch-VL은 두 단계로 학습된다. SFT는 기초 추론과 tool-use 행동을 확립하고, search-augmented RL은 시연 범위를 넘어 탐색할 수 있게 한다. RL recipe는 multimodal rollout, composite reward, fatal-aware masking, one-sided advantage clamping을 결합해 연쇄적 실패 이전의 유용한 추론을 보존한다.
- 학습 개요: 두 단계 학습은 기초 추론과 tool-use 행동에 SFT를 적용한 뒤, search-augmented RL로 더 효과적인 탐색 전략을 발견한다.SFT는 엄선된 multi-turn expert trajectory 36,592개로 학습하며, 추론 중에는 tool observation을 context로 사용하고 이후의 tool invocation 또는 terminal response를 지도한다.
- 강화학습: RL은 multimodal environment E에서 multi-turn exploration을 최적화해 SFT의 제한적인 시연 범위를 보완하며, GRPO와 search-augmented GRPO를 기반으로 한다.각 prompt에 대해 현재 policy가 E와 상호작용하며 생성한 multi-turn rollout 그룹을 sampling한다.
- Composite Multi-Turn Reward: Composite trajectory reward는 formatting, terminal accuracy, process-level search quality 사이의 균형을 맞춰 structural integrity, end-task correctness, 더 조밀한 feedback을 함께 반영한다.Format reward는 구조적으로 유효한 trajectory를 통과시키고, accuracy는 ground truth를 기준으로 GPT-4o가 판정하며, query quality는 GPT-5.4가 연속적으로 평가해 terminal accuracy가 0일 때 feedback을 제공한다.
- Fatal-Aware Token Masking: Fatal-aware masking은 연속된 도구 실행 오류 세 건이 처음 연쇄적으로 발생한 이후 생성된 토큰을 영으로 마스킹해, 전체 trajectory를 폐기하거나 무분별하게 학습하는 대신 유효한 prefix를 보존한다.Process reward는 valid prefix에 대해서만 계산하며, 실패 이후의 구조적 붕괴는 페널티 대상에서 제외한다.
- Fatal-Aware Token Masking: One-sided advantage clamping은 fatal trajectory에 max(e_ri, 0)을 할당하므로, viable prefix는 부분 reward가 group mean을 초과할 때만 reinforcement를 받고 그렇지 않으면 gradient가 0이 된다.모든 trajectory는 여전히 group-normalized reward statistics에 기여하며, clamping은 실패 이전의 유효한 추론을 penalize하지 않고 hard masking보다 더 유용한 signal을 복원한다.
5 실험
OpenSearch-VL은 7개 멀티모달 지식 집약형 benchmark에서 평가되었으며, direct-reasoning 및 RAG baseline을 일관되게 능가한다. Ablation 결과, tool-demanding data pipeline과 fatal-aware GRPO, 특히 one-sided advantage clamping이 성능을 크게 향상시키는 것으로 나타난다.
- 실험 설정: 평가에는 SimpleVQA, VDR, MMSearch, LiveVQA, BrowseComp-VL, FVQA, InfoSeek에서의 Pass@1이 사용되며, 정답 여부는 GPT-4o가 판정한다.모델로는 Qwen3-VL-8B-Instruct, Qwen3-VL-30B-A3B-Instruct, Qwen3-VL-32B-Instruct가 포함된다.
- 주요 결과: 56.6 평균 점수를 기록한 OpenSearch-VL-8B는 가장 강력한 8B agent로, SenseNova-MARS-8B를 3.9점 앞서며 모든 규모에서 direct-reasoning 및 RAG baseline을 능가한다.Table 2는 7개 멀티모달 지식 집약형 QA 및 web-search benchmark를 다룬다.
- Training recipe ablation: 동일한 Qwen3-VL-8B SFT 초기화 후, Fatal Masking + One-sided Clamp의 71.8 평균 정확도는 Vanilla GRPO의 67.6과 Fatal Masking only의 69.1을 웃돈다.SFT는 base model을 53.7에서 64.6으로 높이고, vanilla GRPO는 이를 다시 67.6까지 높인다. 전체 recipe는 Vanilla GRPO 대비 +4.2-point delta를 제공한다.
- Data pipeline ablation: data pipeline에서 source-anchor grounding, fuzzy entity rewriting, staged filtering을 각각 제거하면 11.5, 10.3, 8.2-point drops가 발생한다.전체 pipeline은 64.6 평균 점수를 달성하며, shortcut 방지와 실제로 tool-demanding한 query가 모두 중요함을 보여준다.
- Training recipe ablation: One-sided clamping은 그룹 평균을 웃도는 fatal prefix에 대해서는 양의 업데이트를 보존하고, 지배된 실패에서 발생하는 잡음이 섞인 음의 신호는 제거한다.10,000개 그룹에서 대부분의 fatal trajectory는 무효화되며, 보존된 tail은 non-fatal rollout의 오른쪽 mode와 분포적으로 유사하다.
6 관련 연구
기존 연구는 text-only RL 시스템에서 visual retrieval과 dynamic tool orchestration을 통합하는 multimodal pipeline으로 agentic search를 발전시켜 왔다. 그러나 장기 추론과 다중 도구 환경에서 작동하는 multimodal agent에게 perception fidelity와 연쇄적 실패는 여전히 핵심 과제다.
- 관련 연구: Active-search 연구는 LLM을 정적 지식 베이스에서 벗어나 dynamic multi-turn retrieval을 사용하는 agentic reasoner로 발전시켰으며, visual search를 포함하는 multimodal 시스템도 등장했다.Search-R1은 RL 기반 자율 질의를 확립했으며, MMSearch-R1과 Vision-DeepResearch는 이 패러다임을 multimodal agent pipeline으로 확장했다.
- 관련 연구: Multimodal-agent 성능은 초기 perception fidelity에 의해 제한되는 경우가 많으며, 기존 RAG 및 tool-augmented 시스템은 검색된 시각 정보에 대한 능동적 제어를 제한적으로만 제공한다.VisRAG는 시각적 구조를 보존하지만 모델을 수동적 관찰자로 취급하며, 기존 toolset은 대체로 동질적이다.
- 관련 연구: 다양한 도구 상호작용을 포함하는 장기 추론 agentic rollout에 GRPO를 적용하는 일은 여전히 어렵다. 초기 도구 오류가 연쇄적 trajectory 실패를 촉발할 수 있기 때문이다.GRPO는 language-model reasoning trajectory를 효과적으로 정렬하지만, 이를 다중 도구 환경에 적용하면 실패 처리 문제가 발생한다.
7 결론
OpenSearch-VL은 agentic reinforcement learning을 통해 multimodal deep search agent를 학습하기 위한 완전 공개 recipe를 제시한다. 이 recipe는 Wikipedia 기반 데이터 큐레이션, 다양한 retrieval·visual-processing tool environment, 그리고 multi-turn fatal-aware GRPO algorithm을 결합한다.
- OpenSearch-VL은 agentic reinforcement learning을 통해 multimodal deep search agent를 학습하기 위한 완전 공개 recipe다.
- Wikipedia 기반 데이터 큐레이션 pipeline은 one-step retrieval shortcut을 완화하고 SearchVL-SFT-36k와 SearchVL-RL-8k를 생성한다.
- 다양한 tool environment는 retrieval, image enhancement, attention-and-parsing tool을 아우르며, fatal-aware GRPO는 failure 이전의 유용한 reasoning을 보존한다.
한계와 향후 연구 … B 다중 턴 검색 fatal-aware GRPO 세부 사항
이 논문은 외부 도구의 불안정성과 독점적 reward judging을 중요한 한계로 지적하며, 부록에서는 표준 및 search-engine GRPO의 예비 지식과 fatal-aware 다중 턴 학습 세부 사항을 정리한다.
- 한계와 향후 연구: 외부 도구 실패, ranking drift, summarization hallucination은 보상 분산을 증가시키며, 이는 향후 on-policy reliability estimation 연구의 동기가 된다.영향을 받는 도구로는 TextSearch와 ImageSearch가 있다.
- 한계와 향후 연구: 복합 보상은 비용이 크고 버전에 따라 달라지는 proprietary GPT-4o judges에 의존하며, 이 judge들은 현재 텍스트 질의만 평가하고 중간 시각 연산은 무시한다.
- Reinforcement Learning의 예비 지식: 부록에는 예비 reinforcement-learning 방법으로서 standard GRPO를 다루는 절이 포함된다.
- Reinforcement Learning의 예비 지식: 부록에서는 또 다른 reinforcement-learning 예비 지식으로 search engine을 활용한 GRPO를 별도로 다룬다.
- B 다중 턴 검색 fatal-aware GRPO 세부 사항: 부록에서는 다중 턴 검색 fatal-aware GRPO 절차를 위한 fatal-step detection logic을 명시한다.
- B 다중 턴 검색 fatal-aware GRPO 세부 사항: 부록에서는 다중 턴 검색 fatal-aware GRPO 절차를 위해 one-sided clamping을 사용하여 advantage를 도출한다.
C 구현 세부 사항
이 절에서는 supervised fine-tuning (SFT) 및 reinforcement-learning (RL) 학습 구성의 구현 세부 사항을 제시한다.
- C.1 SFT 학습 구성: SFT 학습 구성은 Section C.1에 설명되어 있다.
- C.2 RL 학습 구성: RL 학습 구성은 Section C.2에 설명되어 있다.
D 데이터 큐레이션 세부사항 … B.1 치명적 단계 감지 로직
부록에서는 데이터 큐레이션 세부사항을 정리하고, 다중 턴 검색 증강 학습을 위한 강화학습 기반과 fatal-aware 로직을 전개한다. 또한 standard 및 search-augmented GRPO를 검토하면서 도구 실패를 감지하고 처리하는 방식을 명시한다.
- D 데이터 큐레이션 세부사항: 데이터 큐레이션 세부사항에는 경로 샘플링 하이퍼파라미터, Australia_Zoo 실행 예시, 반사실적 설계 선택이 포함된다.이 주제들은 큐레이션 부록의 D.1–D.3 하위 절에 나열된다.
- A.1 Standard GRPO: GRPO (Shao et al., 2024)는 PPO (Schulman et al., 2017)의 actor-critic 변형으로, 학습된 value function 없이 그룹 내 응답 보상으로부터 advantage를 추정한다.보상 신호에 KL regularization을 통합하지 않고 loss에 명시적으로 적용한다.
- A 강화학습 예비 사항: 부록의 예비 절에서는 다중 턴 학습 목적의 기반으로 standard GRPO와 그 search-augmented 확장을 검토한다.이 정식화는 policy 생성과 외부 검색을 교차 수행하는 배경을 확립한다.
- A.2 검색 엔진을 사용한 GRPO: Search-R1 은 policy 생성과 외부에서 검색된 증거가 번갈아 수행되는 interleaved rollout으로 GRPO를 확장한다.그 목적 함수는 환경 토큰을 마스킹하고, 생성된 토큰을 기준으로 정규화하며, policy가 작성한 위치에만 KL regularization을 적용한다.
- A.2 GRPO with Search Engine: Figure 5는 fatal rollouts 47,978개 중 91.8%가 clamping으로 zeroed되고, 8.2%는 보존됨을 보여준다.fatal rollouts는 G=16인 10,000개 그룹에 걸쳐 있으며, clamp 이전 평균 점수는 zeroed rollouts에서 −0.68, preserved rollouts에서 +0.57이다.
- B 다중 턴 검색 fatal-aware GRPO 세부사항: 다중 턴 RL 부록에서는 fatal execution cascade를 정의하고, one-sided clamping을 적용한 fatal-aware advantage estimation을 유도하며, 보상 구성 요소를 Sec. 4.2로 참조한다.목적 함수에는 fatal-aware token mask가 포함되며, rfmt, racc, rquery는 Sec. 4.2에서 직접 정의된다.
- B.1 치명적 단계 감지 로직: Fatal 감지는 연속적인 도구 실행 오류를 추적하고 K = 3으로 설정하며, 임계값에 도달하지 않으면 비치명적 trajectory에 fi = Li + 1을 할당한다.한 단계에서 도구 실행 오류가 발생하지 않으면 카운터가 초기화되어, 고립된 일시적 실패가 이후 추론을 조기에 마스킹하지 못하게 한다.
B.2 One-Sided Clamping을 적용한 Advantage Derivation · C 구현 세부사항 · C.1 SFT Training Configuration
OpenSearch-VL은 유효한 prefix에서의 유용한 학습을 보존하면서 fatal 이후 및 invalid-token gradient를 제외하는 fatal-aware one-sided advantage를 도출하고, multimodal tool-interleaved SFT 인프라로 학습을 구현한다. Clamping은 non-negative bias를 도입하지만, fatal rollout의 91.8%는 normalized return이 음수이므로 clamping된다.
- B.2 One-Sided Clamping을 적용한 Advantage Derivation: fatal trajectory를 포함한 모든 G trajectory는 group mean과 standard-deviation 추정에 기여하여, 샘플링된 cohort 전반의 상대적 성능을 고정한다.정규화된 통계량은 stop-gradient constant로 취급되므로, gradient는 masking되지 않은 policy-generated token의 importance ratio를 통해서만 흐른다.
- B.2 One-Sided Clamping을 적용한 Advantage Derivation: Fatal-aware clamping은 post-fatal suffix를 통한 gradient 전파를 차단하고, viable prefix에 불이익을 주지 않으며, fatal trajectory가 group baseline을 초과할 때 positive reinforcement를 추출한다.이는 모든 fatal trajectory를 버리는 hard-masking보다 weakly informative-dominant하며, positive fatal trajectory는 viable-prefix gradient를 유지한다.
- B.2 One-Sided Clamping을 적용한 Advantage Derivation: 이 방법은 invalid credit assignment를 안전하게 무시하는 동시에, 조기에 잘렸지만 품질이 높은 exploratory rollout에서 positive reinforcement를 선택적으로 수집한다.비대칭 clamp는 negative fatal-trajectory normalized return을 0으로 매핑하여, zero-mean GRPO baseline에 비해 non-negative bias를 만든다.
- B.2 One-Sided Clamping을 적용한 Advantage Derivation: fatal rollout의 91.8%는 negative standardized return을 가지며 0으로 clamp되는 반면, 나머지 8.2%는 competitive non-fatal rollout의 score regime에 속한다.그 결과 발생하는 non-negative bias는 viable prefix에서 non-zero gradient를 유지하는 것과 상충한다.
- C 구현 세부사항: 구현은 LlamaFactory (Zheng et al., 2024)를 multi-turn 및 tool-interleaved collator와, visual-tool observation을 그대로 처리하는 Qwen3-VL-aware vision/text packing으로 확장한다.지원되는 tool에는 Crop, Sharpen, SuperResolution, PerspectiveCorrect, OCR이 포함된다.
- C 구현 세부사항: RL pipeline은 rLLM 과 Vision-DeepResearch (Huang et al., 2026)에 공동으로 기반하며, 전자로부터 asynchronous agent training infrastructure를 채택한다.제공된 본문은 이 두 system을 RL pipeline의 기반으로 제시하지만, 나머지 구현 설명은 중간에 끊겨 있다.
- C.1 SFT Training Configuration: Table 4는 8B dense, 32B dense, 30B-A3B mixture-of-experts variant 전반의 SFT hyperparameter를 통합하며, 이들은 base checkpoint path만 다르다.모든 variant는 vision tower와 multimodal projector를 포함한 full-parameter fine-tuning을 사용하고, 256개에 걸친 DeepSpeed ZeRO-3 및 Ray orchestration을 적용한다.
C.2 RL 학습 구성
다중 턴 fatal-aware GRPO 단계는 8B dense 및 30B-A3B MoE OpenSearch-VL 변형 전반에서 shared rollout, actor, algorithmic framework를 사용하지만, 일부 학습 설정은 model type에 따라 달라진다.
- RL 학습 구성: 두 RL-finetuned 변형은 모두 async SGLang rollout, Megatron-parallel actor, GRPO에서의 RLOO leave-one-out advantage, low-variance KL controller, critic 없음 설정을 사용한다.이 shared algorithm template은 Qwen3-VL-8B-Instruct와 Qwen3-VL-30B-A3B-Instruct에 적용된다.
- RL 학습 구성: Table 5는 dense 실행과 MoE 실행 사이에서 response budget, mini-batch size, parallelism, MoE routing coefficient, save cadence, total epoch을 다르게 설정한다.Expert parallelism은 dense 8B model에는 적용되지 않는다.
D 데이터 큐레이션 세부사항 … G 사례 연구
OpenSearch-VL은 누수 없는 증거 기반 추론을 함께 강제하는 엄격한 Wikipedia 경로 샘플링 파이프라인, 도구 우선 멀티모달 에이전트 인터페이스, 보상 유도 검색 행동을 명시한다. 사례는 shortcut 해법을 방지하고 답을 검증하려면 시각적 grounding, fuzzy rewriting, hub 회피, 연쇄 검색이 필요함을 보여준다.
- D.1 경로 샘플링 하이퍼파라미터: 이 파이프라인은 disambiguation, 목록형, 비문서, redirect 대상을 필터링하고, 실패한 walk를 최대 10회까지 재시도하며, descriptor·고유성·답변 길이 제약을 끝내 충족하지 못한 seed를 제거한다.4 hop보다 긴 walk는 대규모 resampling 없이는 고유성 및 비누수 검사를 통과하는 경우가 드물다.
- D 데이터 큐레이션 세부사항; D.1 경로 샘플링 하이퍼파라미터: sampler는 시각적으로 grounding 가능한 5개 도메인의 균형을 맞추면서, infobox가 있고 이미지가 연결된 비막다른길 entity로 seed를 제한하고 hub node 중 대략 상위 0.03%를 거부한다.Seed에는 최소 512 × 512 해상도의 Wikimedia Commons 이미지와 [50, τhub]의 in-degree가 필요하며, τhub = 10,000이다. 경로는 h ∼ Categorical({2, 3, 4}; (0.4, 0.4, 0.2))를 사용한다.
- D.3 반사실 설계 선택: 반사실 실험에 따르면 anchor를 답변 이미지로 교체하거나, fuzzy rewriting을 생략하거나, hub를 허용하면 multi-hop 과제가 붕괴하거나 one-step search를 통해 답이 누출된다.답변 이미지를 사용하면 reverse-image lookup이 Terri Irwin을 직접 식별한다. fuzzing이 없으면 TextSearch("Terri Irwin Australian citizenship date")가 답을 복원한다. hub Queensland는 고유성 실패 또는 identity leakage를 유발한다.
- E 시스템 프롬프트: system prompt는 도구 우선 이미지 처리, 연쇄 연산, 외부 텍스트 검증을 통해 “Verify, Don’t Guess”를 강제하며, 별도의 GPT-4o judge가 RL 중 정확도와 query quality를 평가하고 benchmark 평가는 정렬된 post-hoc judge를 사용한다.압축된 inference/SFT prompt는 원래의 행동 규칙을 유지하면서 machine-readable OpenAI-style tool schema를 노출한다.
- F 도구 정의 및 사용; Retrieval Tools: tool environment는 web retrieval과 visual grounding을 결합한다. TextSearch는 문서를 검색·읽기·요약하고, ImageSearch는 알려지지 않은 시각적 entity를 이후 교차 검증에 사용할 수 있는 검색 가능한 텍스트 identity로 변환한다.TextSearch는 Serper, JINA Reader, Qwen3-32B를 사용하고, ImageSearch는 Polaris Lens API를 사용해 유사 이미지, entity, URL, caption을 반환한다.
- Image Enhancement Tools; Attention and Parsing Tools: 이미지 enhancement 및 attention 도구는 blur를 선명하게 하고, 저해상도 입력을 upscaling하고, perspective를 보정하고, 영역을 분리하며, OCR로 layout-aware text를 추출해 perception을 위한 증거를 준비한다.Sharpening은 OpenCV Unsharp Masking을 사용하고, SuperResolution은 기본 ×4 scaling의 EDSR을 사용하며, PerspectiveCorrect는 사변형 warping을 수행하고, Crop은 주변 noise를 억제하며, OCR은 reading-order text block을 반환한다.
- G 사례 연구: bridge 사례 연구는 점진적인 cross-modal verification을 보여준다. 에이전트는 도로 표지판을 crop하고, image search로 Kessock Bridge를 식별한 뒤, text search로 개통일을 검색해 1982임을 확인하고 증거가 수렴하면 중단한다.이 trajectory는 정렬된 도구 chaining과 조기 종료를 유도하는 visual–retrieval action space, query-quality reward, fatal-aware masking의 공동 역할을 예시한다.