Source-linked AI summary
Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism
Haoxiang Zhang, Qixin Xu, Zhuofeng Li, Lei Zhang, Pengcheng Jiang, Yu Zhang, Julian McAuley
TL;DR
Observation masking은 장기 탐색을 개선할 수 있지만, 언제 도움이 되고 왜 그런지는 여전히 불분명하다. 이 논문은 다양한 agent regime에서 masking을 분석해, 강한 retrieval과 중간 수준의 역량을 갖춘 model의 조합에서 masking 효과가 정점에 이른 뒤 saturated system에서는 급격히 붕괴한다는 사실을 보인다.
문제
경량 observation masking이 agentic search에 언제 도움이 되는지, 그리고 그 효과가 stale evidence, model capability, retrieval과 어떻게 상호작용하는지는 여전히 불분명하다.
방법
이 논문은 최소한의 turn-based observation masking을 다양한 agentic search regime에서 context use를 분석하기 위한 diagnostic instrument로 다룬다.
결과
+11.7 pts가 masking gain의 정점이며, weak retrieval에서는 낮은 plateau를 보이고 model saturation에서는 붕괴한다.
시사점 및 한계
Observation masking은 regime-dependent하므로 default로 취급하기보다 retriever recall과 model capacity를 함께 고려해 조정해야 한다.
시사점 및 한계
이 연구는 최소 masking policy와 open-weight 4B–284B backbone을 평가하며, frontier proprietary model은 포함하지 않는다.
Abstract
from arXiv · showhide
Long-horizon search agents accumulate large amounts of retrieved content across many tool calls, making context-budget efficiency increasingly important. A minimal intervention is to mask stale observations from the context as the trajectory progresses, but it remains unclear when this form of context management helps and why. We study observation masking through a systematic sweep over various agent backbones (4B to 284B parameters) and three retrievers on offline and live-web agentic search benchmarks. We find that the accuracy gain from masking follows an asymmetric inverted-U shape when plotted against the model's accuracy without context management: a plateau under weak retrievers, a peak when a strong retriever meets a mid-capacity model, and a sharp collapse when the model is saturated. This pattern reflects the interaction between retriever recall and the model's implicit filtering capacity, rather than either factor in isolation. Mechanistically, masking implements a token-for-turn trade-off: it removes observations the model has largely stopped attending to and pages the agent rarely re-opens. The added turns help when they convert failures into successes, but they fail when masking removes evidence the model would otherwise have used. We therefore reframe context management as a regime-dependent intervention and provide a holistic perspective for analyzing context use in agentic deep search. We release our scaffold and trajectories here (https://github.com/i-DeepSearch/observation-masking) to support future research.
1 서론
장기 탐색 에이전트는 관찰이 과도하게 포함된 context를 축적하므로 경량 observation masking이 필요하지만, 그 효과는 backbone 역량과 retriever 품질의 상호작용에 좌우된다. 본 연구는 model size, retriever, offline benchmark, live-web 환경 전반에서 이러한 regime 의존성을 맵핑해 plateau, 최적점, collapse를 규명한다.
- 동기: 탐색 에이전트는 긴 action horizon 동안 retrieved snippet, page content, tool error, 중간 reasoning이 주를 이루는 수만 개의 context token을 축적한다.각 turn은 새로운 environment observation을 trajectory에 추가해 context-budget 문제를 만들며, context management는 이 문제를 다룬다.
- 동기: Observation masking은 주변 reasoning과 tool-call 구조를 보존하면서 오래된 tool output을 placeholder로 대체해, 경량 context-management intervention을 구현한다.이 방법은 배포된 agent system에서 널리 채택된 것으로 설명된다.
- 실험 범위: 본 연구는 scaffold, masking rule, prompt, evaluation protocol을 고정한 채 backbone model을 4B to 284B parameters로, retriever를 sparse BM25부터 dense agentic-search retriever까지 변화시킨다.구성은 다양한 retriever를 사용하는 offline benchmark와 통합된 parallel-tool-call scaffold를 적용한 live-web agentic search 환경에서 평가된다.
- 기여: Observation masking의 gain은 비단조적인 regime map을 따른다. retriever-bottleneck system은 +6–7 pts, CM sweet spot은 +11.7 pts를 얻고, model-saturated system은 ≤0 pts를 얻는다.이 패턴은 offline suite 전반에서 확인되며, 오른쪽의 collapse는 live-web 환경에서도 나타난다.
- Observation masking: Masked observation은 model의 context에서만 제거된다. underlying page는 page pool, cursor, id, 또는 URL을 통해 여전히 접근 가능하며, reasoning chain과 tool call은 계속 표시된다.가장 최근 K개의 observation은 유지되고, 이전 observation은 placeholder로 대체된다.
2 방법론
방법론은 검색을 다중 턴 trajectory로 표현하며, 누적되는 observation 중심 context를 선택적으로 마스킹할 수 있게 한다. 분리된 scaffold는 page를 외부에 보존해 과거 page를 다시 참조할 수 있게 하면서 parallel search, reading, localization을 지원한다.
- Trajectory와 context: 검색은 reasoning, parallel tool calls, returned observations로 이루어진 다중 턴 trajectory로 진행되며, 최종 action에 answer가 포함된다.context는 렌더링된 trajectory prefix이며, 턴 수에 따라 길이가 선형적으로 증가하고 observation token이 대부분을 차지한다.
- Observation masking: 마스킹은 K-turn retention window 바깥의 observation을 placeholder로 대체하되 tool-call error와 구조적 call 정보는 유지한다.Operational staleness는 마스킹 대상이 될 수 있음을 뜻할 뿐, 반드시 무관함을 보장하지는 않는다. 오래된 observation이 이후 유용해질 수 있기 때문이다.
- Observation masking: 마스킹은 token이나 model call을 추가하지 않는 최소 진단 개입으로, stale-observation content가 성능에 영향을 미치는 조건을 분리해 분석한다.이는 더 정교한 context-management method와 경쟁하기보다 context-use 조건을 연구하기 위한 것이다.
- Search scaffold: scaffold는 persistent page state와 변동하는 context를 분리하므로, 마스킹된 observation도 stable cursor를 통해 이전에 가져온 page를 다시 참조하는 일을 막지 않는다.append-only page pool은 URL의 중복을 제거하고 page record를 context rendering과 독립적으로 보존한다.
- Search scaffold: 세 가지로 분해된 tool이 search loop를 구현한다. search는 snippet을 검색하고, open은 지정된 범위의 page content를 읽으며, find는 저장된 page 안에서 정확한 일치 항목의 위치를 찾는다.parallel tool execution은 agent가 번거로운 URL을 다시 생성하지 않아도 장기 검색을 효율적으로 수행하게 한다.
3 실험 설정
실험은 네 가지 agentic search benchmark, 다양한 open-weight agent와 retriever, 그리고 offline 및 live-web retrieval 설정을 아우른다. 또한 scaffold는 더 강한 No-CM baseline을 확립해, 이후 masking gain을 더 보수적으로 평가하게 한다.
- Benchmark: 평가는 offline 및 live-web 설정에서 네 가지 benchmark를 대상으로 수행된다: BrowseComp-Plus, GAIA, xBench-DeepSearch, BrowseComp-ZH.BrowseComp-Plus는 고정 corpus를 사용하고, 나머지 세 benchmark는 여러 언어를 아우르는 live-web benchmark다.
- Model: 이 연구는 4B에서 284B parameters에 이르는 open-weight tool-calling agent를 평가하며, general-purpose 및 specialized agentic-search backbone을 포함한다.나열된 family에는 Qwen, GPT-OSS, OpenResearcher, DeepSeek-V4-Flash-Max, Tongyi-DeepResearch가 포함된다.
- Retriever: BrowseComp-Plus는 sparse BM25와 두 개의 dense retriever를 사용하는 반면, live-web benchmark는 Serper API를 사용한다.Dense retriever는 Qwen3(-Emb)-8B와 reasoning-tuned AgentIR-4B다.
- 평가 프로토콜: 모든 실험은 500-turn limit을 사용하고 K = 5 observations를 유지하며, GPT-5-mini를 사용한 LLM-as-Judge로 평가한다.추가적인 평가 세부사항과 설정은 Appendices §B, §C, §F.5에 제시되어 있다.
- 더 높은 baseline accuracy: 우리 scaffold는 BrowseComp-Plus에서 공개적으로 보고된 matched model–retriever accuracy 중 최고 수준을 일관되게 상회하며, 보고된 세 비교에서 11.2–12.6 points의 gain을 보인다.보고된 향상 폭은 GPT-OSS-20B에서 +11.2 points, GPT-OSS-120B에서 +12.4, Tongyi-DeepResearch-30B-A3B에서 +12.6이다.
- 동기: 더 강한 No-CM baseline은 regime map이 scaffold의 결함을 보완해서 얻은 gain이 아니라, 이미 더 강한 scaffold 위에서 masking이 보수적으로 기여하는 정도를 측정하게 한다.저자들은 더 약한 baseline이 context pruning의 겉보기 가치를 과장할 수 있다고 주장한다.
4 주요 결과
Observation masking은 BrowseComp-Plus에서 세 가지 regime의 비대칭 패턴을 보인다. retrieval이 강하지만 model accuracy가 아직 중간 수준일 때 가장 큰 도움을 주며, 포화된 model에는 오히려 해가 될 수 있다. 이 regime은 retriever recall과 model의 filtering behavior에 따라 달라지며, 더 noisy한 live-web benchmark에서는 collapse가 더 가파르게 나타난다.
- 세 가지 regime: Qwen3.5-35B-A3B+AgentIR이 62.9% No-CM accuracy에서 얻는 최대 gain은 +11.7 points이며, BM25에서는 gain이 plateau를 이루고 No-CM accuracy가 70%를 넘으면 0 아래로 collapse한다.BM25에서는 recall이 0.55를 넘지 못하기 때문에 masking gain이 +6.2에서 +6.6 사이에 머문다. Tongyi-DeepResearch-30B-A3B는 80.7% No-CM accuracy와 0.93 recall에서도 −1.1 points에 그친다.
- 크기가 아닌 불일치: Model scale만으로는 masking의 regime이 결정되지 않는다. Qwen3.5-와 Qwen3.6-35B-A3B는 AgentIR에서 각각 +11.7 points와 +3.7 points를 얻으며 큰 차이를 보인다.이 불일치는 §5.3.2에서 localization behavior를 통해 살펴본, training inherence가 형성한 attention dynamics 때문이라고 paper는 설명한다.
- Live web이 collapse를 증폭: Live-web benchmark에서는 collapse가 더 가파르게 나타난다. GPT-OSS-120B는 BrowseComp-Plus에서 +0.1 points를 얻던 것에서 GAIA에서는 −4.8 points로 이동한 반면, xBench에서는 +8.0 points를 얻는다.Paper는 이러한 더 가파른 collapse를, 더 noisy하고 통제하기 어려운 live-web context와 연결한다. 이 환경에서는 masking이 capable reader라면 원래 활용했을 signal을 제거할 수 있다.
5 연구 결과
Context masking은 query 수준에서 비대칭적인 효과를 낳는다. 더 적은 token으로 더 많은 trajectory를 복구하지만, 실패한 trajectory에서는 재검색 비용이 커진다. 이득은 오래되어 거의 attend되지 않는 observation을 제거하면서 유용한 reasoning을 보존하는 데서 발생하며, trajectory의 evidence density와 complexity로 예측할 수 있다.
- Query 수준 전이: Qwen3.5-35B-A3B에서는 +11.7 points, 포화된 GPT-OSS-120B에서는 +0.1 points의 향상이 나타나며, masking에 따른 token 증가는 주로 실패한 trajectory에서 발생한다.복구된 trajectory는 더 적은 rolling token을 소비하는 반면, correct→wrong trajectory는 재검색하고 페이지를 다시 열기 위해 추가 inference turn이 필요하다.
- 예측 진단: 두 좌표 probe는 No-CM prefix complexity와 fitted evidence-density SNR을 사용해 masking으로 복구된 trajectory와 복구되지 않은 trajectory를 구분하며, xBench에서는 cited-answer line을 proxy로 사용한다.이 proxy는 사실적 정확성의 인증서가 아니라 진단 도구다. evidence-density curve는 AgentIR의 더 명확한 초기 evidence가 페이지가 누적될수록 희석되는 반면 BM25는 retrieval 한계에 머무름을 보여준다.
- Mechanism: Reasoning은 step당 attention의 53.7%를 받는 반면 tool observation은 25.6%를 받으며, trajectory 중간의 observation은 거의 attend되지 않고 다시 열리는 경우도 드물다.Observation attention은 가장 최근 turn에 집중된 뒤 급격히 감소하는 반면, reasoning은 가장 이른 turn에도 다시 attention을 받는다.
- Mechanism: 가장 강한 masking gains는 더 강한 reasoning attention과 첫 번째 페이지를 다시 여는 빈도의 증가에서 나타나는 반면, 최근 observation에 대한 attention이 높을수록 masking의 이득은 제한된다.설정 전반에서 9B-AgentIR은 가장 강한 reasoning attention과 가장 큰 gain을 보이는 반면, 3.6-35B-AgentIR은 자신이 가장 많이 attend하는 observation을 보존한다.
- Scaffold ablation: error retention을 제거하면 4B에서 open error rate가 18.6% to 22.6%로, 9B에서 20.4% to 24.6%로 상승하며, title을 흐리면 각각 20.8%와 26.2%까지 상승한다.tool-call error를 보존하면 잘못된 call에서 복구하기 위한 feedback이 유지되며, exact URL은 agent가 target을 추론하도록 강제하지 않는다.
6 관련 연구
기존 연구는 에이전트 검색을 여러 턴에 걸쳐 상태를 유지해야 하는 장기적이고 도구가 증강된 정보 탐색으로 규정한다. 컨텍스트 관리 연구는 working memory 개념을 바탕으로 긴 이력을 처리하기 위한 truncation, eviction, compression, adaptive approach를 탐구한다.
- 장기 에이전트 검색: 장기 에이전트 검색 벤치마크에서는 에이전트가 수십 번의 tool-use 턴에 걸쳐 상태를 유지해야 한다.예로 BrowseComp, BrowseComp-Plus, GAIA, xBench-DeepSearch, HLE, BrowseComp-ZH가 있다.
- 자율 에이전트를 위한 컨텍스트 관리: 컨텍스트 관리 연구는 task logic을 방해하지 않으면서 긴 에이전트 이력을 관리하기 위해 static truncation, heuristic eviction, online compression을 연구한다.이 연구 흐름은 MemGPT (Packer et al., 2023)에서 영감을 받은 working memory 개념을 바탕으로 한다.
- 자율 에이전트를 위한 컨텍스트 관리: AgentFold (Ye et al., 2025), ReSum (Wu et al., 2025)과 같은 adaptive method는 유연성을 높이는 한편 추가 비용을 초래한다.
7 결론
Observation masking은 기본 개입이 아니라 regime-dependent tool이며, 그 유용성은 baseline capability에 의해 좌우된다. 향상된 retrieval recall이 모델의 고유한 noise filtering capacity를 앞설 때 가장 큰 효과를 낸다.
- 7 결론: Observation masking은 기본 개입이 아니라 regime-dependent tool이다.그 유용성은 시스템의 baseline capability에 의해 엄격하게 좌우된다.
- 7 결론: Masking은 향상된 retrieval recall이 모델의 고유한 noise filtering capacity를 앞서는 중간의 sweet spot에서 가장 잘 작동한다.
- 7 결론: 이러한 불일치 regime를 벗어나면, masking은 weak retriever에서는 드러낼 evidence 자체가 부족하거나, capable model이 그렇지 않았다면 활용할 수 있었던 정보를 버릴 위험이 있다.
한계
연구 결과는 여러 벤치마크에서 견고하게 나타나지만, 연구 범위는 의도적으로 최소화한 masking policy와 포괄적이지 않은 모델 범위에 의해 제한된다.
- Policy 범위: 이 연구는 최소한의 turn-based observation-masking policy를 분리해 분석하며, learned·attention-guided·semantic-adaptive 대안은 향후 과제로 남긴다.이러한 policy는 model–retriever mismatch regime에서 성능 향상을 유지하면서 model-saturated setting에서의 붕괴를 피할 수 있을 가능성이 있다.
- 모델 범위: 계산량, inference, attention analysis의 제약으로 인해 모델 범위는 넓지만 포괄적이지 않다.
윤리적 고려사항 … B 평가 세부사항
이 논문은 장기 에이전트 검색의 맥락에서 context management를 다루면서, 비용이 낮아진 자동화와 핵심 맥락의 억제로 인해 발생할 수 있는 윤리적 위험을 강조한다. 또한 관련 에이전트 설정과 기존 stale-context pruning 전략을 검토한다.
- 윤리적 고려사항: Context management는 복잡한 웹 리서치 비용을 낮추는 동시에 저품질 또는 오도성 콘텐츠의 대규모 생성을 가능하게 할 수 있다.Adaptive history compression은 고급 리서치 역량을 민주화할 수 있지만, 유해한 자동 생성 콘텐츠의 생산 비용도 낮출 수 있다.
- 윤리적 고려사항: 윤리적 고지와 예외 상황의 안전 경고를 포함한 미묘한 맥락을 억제하면 후속 출력에 해를 끼칠 수 있다.이 대목은 context management가 안전과 관련된 핵심 정보를 부주의하게 제거할 수 있다는 점을 구체적인 위험으로 지적한다.
- 관련 연구 추가: 장기 에이전트 상호작용은 language model의 사용을 단일 턴 생성에서 지속적인 상호작용이 필요한 복잡한 과업으로 확장한다.대표적인 응용으로 문헌 조사, 컴퓨터 사용 과업, 자율 소프트웨어 엔지니어링, adaptive self-refinement를 포함한 멀티모달 tool use가 있다.
- 관련 연구 추가: Deep agentic search는 복잡한 질문에 답하기 전에 외부 근거를 수집하기 위해 검색, 읽기, 위치 특정 행동을 반복적으로 결합한다.초기 시스템은 검색을 주요 외부 도구로 사용한 반면, 최신 deep-research agent는 이 과정을 구조화된 tool-calling loop로 구성한다.
- 관련 연구 추가: 기존 context-management 시스템은 stale observation 폐기, trajectory 압축, 최신 tool result만 보존하는 방식 등 다양한 pruning policy를 사용한다.관련 연구에서는 DeepSeek-V3.2, Claude Code, Kimi Researcher를 경계 pruning 접근법의 사례로 제시한다.
- 관련 연구 추가: 다른 시스템은 특정 milestone에서 중간 reasoning trace를 제거하거나 여러 context-management 전략 사이에서 라우팅한다.GLM-5와 AgentSwing은 단순한 경계 pruning과 다른 접근법을 보여준다.
B.1 벤치마크 · B.2 검색기 • · B.3 비교 기준선 •
이 연구는 4개의 offline 및 live-web 벤치마크, 3가지 retrieval 접근법, 다양한 open-weight baseline model을 통해 deep-research agent를 평가한다. 실험 설정은 통제된 corpus 기반 평가와 지속적인 web-search 과제, agent 지향 model 비교를 결합한다.
- B.1 벤치마크: BrowseComp-Plus는 고정 corpus, 사람이 검증한 문서, mined hard negative, 830개의 multi-document research question을 사용해 통제된 offline 평가를 제공한다 (Chen et al., 2025c; Wei et al., 2025).BM25 및 Qwen3-Embedding-8B FAISS index는 live web access에 대한 의존성을 제거하면서 deep retrieval과 multi-hop reasoning을 평가한다.
- B.1 벤치마크: 벤치마크 suite에는 289개의 BrowseComp-ZH question을 사용한 중국어 multi-hop browsing, 103개의 example을 사용한 text-only GAIA, 100개의 open-web xbench-DeepSearch example도 포함된다 (Zhou et al., 2025; Mialon et al., 2024; Chen et al., 2025a).이 과제들은 분산된 중국어 web retrieval, real-world reasoning과 tool use, 지속적인 multi-turn evidence gathering을 아우른다.
- B.2 RETRIEVERS •: 검색 baseline은 lexical BM25, dense Qwen3-Embedding-8B, 그리고 agent의 내부 reasoning trace와 search query를 함께 임베딩하는 추론 인식형 AgentIR-4B로 구성된다 (Zhang et al., 2025b; Chen et al., 2026).BM25와 Qwen3-Embedding-8B는 BrowseComp-Plus retrieval agent에 사용되며, AgentIR는 다중 턴 문제 해결 맥락을 활용하도록 설계됐다.
- B.3 비교 기준선 •: 비교 대상인 Qwen3.5/3.6 model은 Gated Delta Network와 sparse mixture-of-expert routing을 결합하고 최대 1M input token을 지원하는 open-weight Alibaba Cloud foundation model이다 (Team, 2026; QwenTeam, 2026b).평가된 family는 agentic capability, multimodal understanding, multilingual coverage, long-context input을 중점적으로 다룬다.
- B.3 비교 기준선 •: GPT-OSS-120B와 GPT-OSS-20B는 128K-token context, 조정 가능한 reasoning effort, instruction following, browser-tool use를 지원하는 open-weight reasoning baseline을 제공한다 (Agarwal et al., 2025).두 model은 동일한 browser-tool interface를 통해 평가한다.
- B.3 비교 기준선 •: DeepSeek-V4는 1M-token context, long-context support, agent-oriented post-training을 갖춘 Pro 및 Flash open-weight mixture-of-expert baseline을 제공한다.평가에서는 확장된 deep-research trajectory를 위해 parallel browser-tool access를 사용한다.
- B.3 비교 기준선 •: OpenResearcher-30B-A3B는 fully open trajectory-synthesis pipeline으로 학습되고 Nemotron-3-Nano-30B-A3B를 기반으로 구축된 open long-horizon deep-research model이다 (Li et al., 2026a; Blakeman et al., 2025).비교 대상 agentic baseline에 포함된다.
C 실험 설정
실험은 모델–retriever 구성 전반에서 일관된 multi-GPU serving, model-native tool-call formatting, 고정된 decoding 설정을 사용한다. LLM이 판정한 결과에 대해 15%를 사람이 감사한 결과, 일치율은 99.9%를 초과했다.
- Model serving: 모델은 8개의 NVIDIA H100 GPU에서 serving되며, tensor parallelism은 4B–9B 모델의 TP=1부터 DeepSeek-V4-Flash-Max의 TP=8까지 확장된다.20B–35B 모델에는 TP=2를, 120B 모델에는 TP=4를 사용해 더 큰 모델을 수용하면서도 inference를 일관되게 유지한다.
- Tool-call formatting: 각 모델은 고유한 chat 및 tool-calling template을 사용하며, tool specification과 observation은 해당 모델별 format을 통해 주입된다.이를 통해 template 불일치로 모델에 불이익을 주는 일을 방지하고, 의도된 deployment 설정을 더 잘 반영한다.
- Generation configuration: 별도로 명시하지 않는 한, 평가는 모델–retriever 구성 전반에서 turn당 최대 generation 길이를 8192 output tokens로, sampling temperature를 1.0으로 고정한다.decoding hyperparameter를 고정하면 backbone capability, retrieval quality, context management에 따른 차이를 분리할 수 있다.
- Human Audit Evaluation: 사람 annotator가 LLM이 판정한 실험 결과의 무작위 15% 표본을 검증했으며, 일치율은 99.9%를 초과했다.이 감사는 evaluation reliability를 뒷받침하는 데 사용되었다.
D 회귀 프로브: 실험 설정 … D.6 라이브 웹 xBench 프록시
회귀 프로브는 샘플링한 prefix, trace-shape feature, 그룹화 ridge regression, 2차원 separability probe를 통해 BrowseComp-Plus trajectory를 분석한다. xBench에는 gold-document qrels가 없으므로, 동일한 downstream procedure를 적용하는 더 약한 citation-overlap proxy를 사용한다.
- D.1 BROWSECOMP-PLUS TRACE와 LABEL: 이 프로브는 공개된 BrowseComp-Plus model–retriever 설정 5개를 사용하며, feature와 SNR target을 No-CM trajectory에서만 계산한다.Gold URL은 recall evaluator의 exact-match URL normalization을 사용한 BrowseComp-Plus qrels에서 가져온다.
- D.2 PREFIX SAMPLING: 각 trajectory는 최대 8개의 prefix를 제공하며, 이 prefix는 final turn 이전 구간에서 균등하게 샘플링하되 최종 evidence state는 항상 유지한다.그 결과 830-query configuration마다 대략 6.5k개의 prefix example이 생성된다.
- D.3 INPUT FEATURE: Feature는 hidden state가 아니라 trace shape를 기술하며, normalized position, URL count와 증가량, observation length, tool-call indicator, budget variable을 포함한다.지정된 경우 cumulative count와 turn-local count는 log-transform한다.
- D.4 REGRESSION MODEL과 TWO-DIMENSIONAL PROJECTION: 각 model–retriever configuration에서 standardized feature를 second-degree interaction으로 확장하고, query-grouped fold를 사용하는 crossvalidated ridge regression으로 fitting한다.Prediction은 [0, 1]로 clipping하며, 세로 좌표는 min–max normalized fitted SNR이다.
- D.4 REGRESSION MODEL과 TWO-DIMENSIONAL PROJECTION: 첫 번째 principal component는 trace scale과 강한 상관을 보이며, cumulative turn과 observation character에 positive loading을 가져 input complexity의 unsupervised proxy를 제공한다.표시된 representation은 fitted SNR을 세로 좌표로 사용한다.
- D.5 AUC COMPUTATION: Scatter-plot AUC는 표시된 2차원 representation에서의 linear separability를 측정하며, SNR-regression objective가 아니라 balanced query-grouped logistic probe를 사용한다.보고된 score는 held-out-fold Mann–Whitney ROC-AUC 값의 macroaverage다.
- D.6 LIVE-WEB XBENCH PROXY: CM rescue의 경우 positive는 No-CM-wrong →CM-correct query다. BrowseComp-Plus에서는 rescue되지 않은 모든 prefix를 negative로 사용하고, xBench에서는 degraded trajectory를 제외한다.xBench live-web proxy는 이용할 수 없는 gold-document SNR을 final No-CM answer가 인용한 cumulative observed browser line의 비율로 대체한 뒤, 동일한 grouped regression과 separability procedure를 적용한다.
E ATTENTION ANALYSIS: 실험 설정 … G 추가 실험 결과
Attention analysis는 세 가지 browsing-agent 설정에서 full-attention layer를 대상으로 분석하고, reasoning step에서 role- 및 turn-level attention을 계산하며, trajectory별 패턴과 집계된 positional decay를 시각화한다. 설정에는 동일하게 맞춘 150개 trajectory 샘플, causal single-pass query/key capture, interaction history 전반의 role-aware aggregation이 사용된다.
- E ATTENTION ANALYSIS: 실험 설정: 이 절차는 모든 full-attention module에서 query/key tensor를 기록하며, 4B 및 9B model에서는 8개 layer, 35B model에서는 10개 layer를 다룬다.모든 model은 네 개의 transformer layer마다 하나의 full-attention layer를 두는 hybrid block을 사용하며, hook이 연결된 각 layer에는 16개 query head와 head dimension 256이 있다.
- E.1 MODELS AND TRAJECTORIES: 분석에서는 각 설정에서 동일하게 무작위 샘플링한 150개 trajectory를 사용해 4B-BM25, 9B-AgentIR, 3.6-35B-AgentIR browsing agent를 비교한다.각 model은 서로 다른 Qwen backbone과 BM25 또는 AgentIR retrieval, parallel tool call을 결합하므로 model 간 like-for-like 비교가 가능하다.
- E.2 HOOKED VLLM을 사용한 QUERY/KEY TENSOR CAPTURE: hook이 연결된 vLLM에서 수행한 한 번의 chunked-prefill pass가 모든 token position에서 layer별 tensor를 capture하며, causal masking을 통해 각 reasoning-start token에서 attention을 계산한다.35B 실행에서는 두 개의 H100 GPU에 tensor parallelism을 적용하고, head shard를 offline에서 concatenate한다.
- E.3 PER-TURN ATTENTION SCORES: 분석에서는 token을 system, user, reasoning, tool call, observation으로 labeling한 뒤, reasoning span과 그 뒤에 이어지는 tool-call/observation pair를 interaction turn으로 묶는다.첫 번째 turn에는 앞부분의 system 및 user segment도 포함된다.
- E.3 PER-TURN ATTENTION SCORES: 각 reasoning step에서 첫 번째 post-<think> query의 layer- 및 head-averaged attention을 interaction turn과 role별로 token에 대해 합산한다.이를 통해 interaction history에 대한 role-specific attention score의 step별 matrix를 생성한다.
- E.4 PER-TRAJECTORY HEATMAP: Trajectory heatmap은 reasoning attention을 lower-left triangle에, observation attention을 upper-right triangle에 표시하며, diagonal을 masking하고 color limit에서 self-attention을 제외한다.예시로 제시한 trajectory는 50-turn 9B-AgentIR trajectory다.
- E.5 AGGREGATED DECAY CURVES: 집계된 decay curve는 과거 turn을 normalized relative position에 따라 20개의 동일한 폭 bin으로 나누며, 과거 turn이 최소 5개인 reasoning step으로 분석을 제한한다.curve는 role-specific attention의 mean과 cumulative attention share를 모두 보고하며, 후자가 100% 미만에서 포화되는 것은 system, user, current-self token에 attention이 할당되기 때문이다.
- F PROMPT TEMPLATES: Prompt template은 전체 실험을 위해 web-search behavior, citation formatting, parallel tool-call instruction, exact-answer LLM judge format을 지정한다.제공된 template에는 generic, Qwen-style, DeepSeek-style parallel-call instruction이 포함되며, extracted answer, correctness reasoning, confidence output field를 정의한다.
G.1 주요 결과 분석 · H 사례 연구
Observation masking은 세 가지 regime을 따른다. retriever-bottleneck plateau, mismatch가 유발하는 gain peak, 그리고 gain이 붕괴하는 saturation이다. context를 추가 tool call과 교환해 recall을 높이며, regime 경계는 benchmark 간에도 전이된다.
- G.1 주요 결과 분석: Sparse BM25는 거의 일정한 낮은 masking-gain plateau를 보인다. Qwen3.5-4B, Qwen3.5-9B, GPT-OSS-20B에서 각각 +6.3, +6.6, +6.2다.이 retriever-bottleneck regime은 0.54 미만의 recall과 39% 미만의 accuracy ceiling을 반영한다.
- G.1 주요 결과 분석: +11.7은 가장 큰 masking gain으로, mismatch regime에서 Qwen3.5-35B-A3B+AgentIR이 달성한다.이 peak는 성능이 충분한 retriever가 모델 스스로는 noise와 분리하지 못하는 signal을 표면화할 때 나타난다.
- G.1 주요 결과 분석: parameter scale alone이 아니라 retriever–model mismatch가 regime을 결정한다. 동일한 규모의 Qwen3.5 변형은 서로 다른 training recipe에서 +11.7 대 +3.7의 gain을 보인다.이 비교는 architecture와 parameter count를 대략 고정한 채 mismatch와 saturation을 대조한다.
- G.1 주요 결과 분석: Masking은 trajectory를 늘린다. 모든 populated configuration에서 tool call이 추가되며, 그 범위는 20.3 to 91.6이고 stale observation 제거는 더 높은 recall을 가능하게 한다.추가 call은 masked observation이 제거된 뒤 agent가 다시 질의하고 재독해하기 때문에 발생한다.
- G.1 주요 결과 분석: Regime 순서는 benchmark 간에도 전이된다. Qwen3.5-9B는 GAIA-text에서 +4.8, xBench에서 +7.0의 gain을 보이는 반면, DS-V4-Flash-Max는 +0.0, +1.0, +0.0을 보인다.더 약한 backbone은 mismatch regime에 남는 반면, 가장 강한 backbone은 추가 benchmark 전반에서 saturated 상태다.
- G.1 주요 결과 분석: Qwen3.5-4B는 GAIA-text에서 +1.9만 얻는 반면 BrowseComp-Plus retriever에서는 +6–+11을 얻는다. live-web context가 더 noisy하고 활용하기 어렵기 때문이다.unconstrained web에 의해 recall이 사실상 제한되므로, 이 configuration은 retriever-bottleneck regime처럼 작동한다.
H.1 CASE: BROWSECOMP-PLUS에서의 병렬 도구 사용 … H.5 CASE: BROWSECOMP-PLUS — CM IMPROVES (CM OFF WRONG →CM ON CORRECT)
사례 연구는 parallel-search trace와 citation-heavy reasoning을 포함해 observation masking이 성공적인 장기 조사를 지원하는 경우를 보여주지만, 최종 종합에 필요한 증거를 보관 처리하면 실패를 일으키기도 한다. BrowseComp-Plus 사례 전반에서 masking은 잘못된 trajectory를 바로잡을 수도 있고, 올바른 trajectory를 오답으로 바꿀 수도 있다.
- H.1 사례: BROWSECOMP-PLUS에서의 병렬 도구 사용: Qwen3.5-9B는 병렬 search, open, find 호출을 사용해 2001년 오월의 고고학 서적, Otago Conservancy, William Larnach, 그리고 404 ha의 통합 토지를 연결했다.에이전트는 인용부호가 있는 검색을 재시도하고 유망한 문서를 열었으며, browser.find로 자살 및 통합 근거를 찾고 최종적인 전기적 맥락을 검증했다.
- H.2 CASE: TONGYI-DEEPRESEARCH-30B-A3B — ARRAY QUERY에서의 병렬 검색: DeepResearch-30B-A3B는 38-call parallel-search turn과 이후 감독, 편집자, production-design 단서 검증을 거쳐 해당 영화가 Brazuca임을 정확히 식별했다.최종 답변은 단서와 일치하는 인물로 1988년생이며 Public Administration을 전공한 Faidon Gkretsikos, Yorgos Georgopoulos, Eleni Kariori를 식별한다.
- H.3 CASE: XBENCH-DEEPSEARCH — GPT-OSS-120B: GPT-OSS-120B는 Zhao Huaiman 여름 현장 계약서와 그 643 CE 날짜, 그리고 해당 연도에 사망한 재상을 식별한 뒤 Wei Zheng에게 네 아들이 있었다고 정확히 답했다.모델은 trajectory 중반에 이미 답을 알고 있었지만, 최종 답변을 내기 전 여러 후반 라운드에 걸쳐 정확한 줄 번호 인용을 수집했다.
- H.4 CASE: BROWSECOMP-PLUS — CM IMPAIRS (OFF CORRECT →CM ON WRONG): BrowseComp-Plus qid 171에서 masking은 관계의 종료 시점과 공개 발표를 구분하는 NTV 증거를 보관 처리해 올바른 June 2023 답변을 잘못된 August 2023 답변으로 바꿨다.masking이 없을 때 agent는 관련 페이지를 다시 열어 June 2023이라고 답했지만, masking을 적용하면 live context에 Citizen Digital의 publication 및 announcement date가 남아 August 2023으로 이끌었다.
- H.5 CASE: BROWSECOMP-PLUS — CM IMPROVES (CM OFF WRONG →CM ON CORRECT): 또 다른 BrowseComp-Plus 실행에서는 masking이 올바른 Sankomota 및 Frank Leepa 답변을 회복한 반면, unmasked baseline은 잘못된 밴드 Nass el Ghiwane에 집착했다.CM-off trajectory는 잘못된 단서와 검색 엔진에 편향된 2003년 사망 결과를 반복해서 따랐지만, CM-on trajectory는 비영어권 자료를 계속 탐색해 정답에 도달했다.