Source-linked AI summary
Towards Retrieving Interaction Spaces for Agentic Search
Shengyao Zhuang, Yuansheng Ni, Hengxin Fun, Jimmy Lin, Xueguang Ma
TL;DR
Agentic search에는 context-limited snippet이나 unrestricted corpus access 대신, 경계가 정해지고 탐색 가능한 interaction space가 필요하다. RISE는 BM25와 색인된 navigation metadata로 이 공간을 구성하며, 훨씬 낮은 비용으로 DCI accuracy에 도달하고 1M documents에서도 안정적으로 유지된다.
문제
Unbounded corpus interaction은 확장성이 낮고, conventional snippet retrieval은 evidence resolution을 제한한다. 따라서 bounded interaction space를 구성하는 retrieval이 필요하다.
방법
RISE는 BM25로 interaction-space boundary를 정의하고, 선택된 documents를 shell-navigable하게 만드는 offline structural metadata를 사용한다.
결과
78% 정확도는 pure-shell DCI와 비교해 쿼리당 비용이 사분의 일인 수준이며, DCI가 저하되는 동안에도 RISE-BM25는 1M documents에서 안정적이다.
시사점 및 한계
Interaction space는 agents가 shell tools로 bounded candidates를 다시 탐색하고 sub-document evidence에 효율적으로 도달하게 하는 intermediate retrieval output을 제공한다.
시사점 및 한계
이 processing consequence는 100k corpus에서만 평가되었으므로, 1M scaling result는 주로 boundary mechanism을 측정한다.
Abstract
from arXiv · showhide
Retrieval for search agents is still inherited from non-agentic information retrieval: a retriever ranks the corpus and the agent reads a small set of returned documents. Recent direct corpus interaction (DCI) work shows that agents can instead interact with the raw corpus through shell tools such as grep and file reads. But unbounded interaction does not scale: every broad shell command is a scan over the whole corpus, and latency degrades sharply as the corpus grows. We argue that the role of retrieval for agentic search is not just to select documents that fit in the LLM context window, but to construct an interaction space: a bounded subset of the corpus the agent can explore with associated tools. Two design consequences follow. The space needs a boundary supplied by retrieval, and the objects within it should be processed for interaction. As a proof of concept, we propose RISE (Retrieving Interaction SpacE): we use BM25 to construct the interaction space; meanwhile, its documents are processed during indexing for shell-style navigation. On BrowseComp-Plus, RISE matches the pure-shell DCI baseline at 78% accuracy with gpt-5.4-mini at roughly one quarter of the per-query cost. At 1M documents, RISE-BM25 reaches 81% on gpt-5.4-mini, whereas DCI on gpt-5.4-nano degrades to 60% with 33 of 100 wall-clock failures.
1 서론
RISE는 agentic search에서 retrieval의 역할을 단순히 LLM context에 넣을 문서를 선택하는 것이 아니라, 경계가 정해지고 도구가 갖춰진 interaction space를 구성하는 것으로 재정의한다. 무제한 direct corpus interaction의 확장 비용을 해결하면서, 훨씬 낮은 비용으로 DCI 정확도를 맞추고 1M-document corpus에서도 안정적으로 동작한다.
- 배경: Agentic search는 전통적으로 non-agentic retrieval을 따랐다. 즉 retriever가 corpus의 순위를 매기고 agent의 context에 넣을 소수의 문서 또는 snippet 집합을 반환한다 [Lewis et al., 2020; Nakano et al., 2021; Yao et al., 2023].최근 연구는 대신 raw-corpus shell interaction, 반복적 lexical search, 또는 file-based manipulation을 가능하게 한다 [Li et al., 2026b; Cao et al., 2026; Sen et al., 2026].
- 동기: 무제한 direct corpus interaction은 확장되지 않는다. 광범위한 shell command가 전체 corpus를 scan하므로 tool 사용량, latency, cost가 증가하고 accuracy는 낮아진다 [Li et al., 2026b].100-query BrowseComp-Plus subset에서 100k에서 200k documents로 확장하면 평균 tool calls가 38.5에서 86.9로 증가하고, accuracy가 13.6 points 하락하며, 400k documents에서는 100개의 maximum-budget queries 중 20개가 실패해 accuracy가 37.5%에 이른다.
- 관점: RISE는 interaction space를 구성한다. 이는 agent가 관련 도구와 함께 탐색할 수 있는, 경계가 정해진 corpus subset이며 그 경계는 retrieval이 제공한다.이 관점은 LLM context window에 들어가는 문서 또는 snippet만 반환하는 retrieval과 다르다.
- 결과: 78% accuracy로 RISE는 BrowseComp-Plus에서 gpt-5.4-mini를 사용해 pure-shell DCI baseline과 일치하면서 query당 cost는 one quarter로 낮춘다.1M documents에서 RISE-BM25는 안정적으로 유지되는 반면, DCI는 33 of 100 wall-clock failures와 함께 60%로 하락한다.
- 결과: document processing을 제거하면 100k documents에서 model tier 전반의 RISE-BM25 accuracy가 1–4 points 하락해, interaction을 위한 document processing의 가치를 뒷받침한다.이는 평가된 scale에서 interaction-processing consequence의 기여를 분리해 보여준다.
2 관련 연구
관련 연구는 agentic search를 외부 정보와의 반복적 상호작용으로 규정하고, 고정 코퍼스 브라우징 벤치마크를 통해 이를 평가하며, retrieval과 코퍼스 인터페이스를 agent에 맞게 점점 더 조정한다. 본 논문은 retrieval이 초기 증거 집합을 선택한 뒤 agent에 어떤 코퍼스 인터페이스를 제공해야 하는지에 초점을 둔다.
- Retrieval-augmented 및 심층 연구 agent: Agentic search는 retrieval-augmented generation과 action–observation loop를 더 긴 시간 범위의 연구 워크플로로 확장하며, agent는 반복적으로 증거를 검색하고 점검한다 [Lewis et al., 2020] [Nakano et al., 2021, Yao et al., 2023].
- Retrieval-augmented 및 심층 연구 agent: BrowseComp과 BrowseComp-Plus는 브라우징 방식의 agent를 평가하며, BrowseComp-Plus는 retrieval 선택을 비교 가능하게 만드는 고정 코퍼스를 사용한다 [Wei et al., 2025, Chen et al., 2025].
- Agentic search를 위한 retrieval 및 ranking: AgentIR과 Agentic-R은 reasoning trace를 사용하거나 로컬 passage relevance와 전역 answer correctness를 결합해 retrieval을 agent 행동에 맞게 조정한다 [Chen et al., 2026] [Liu et al.,
- Agentic search를 위한 코퍼스 인터페이스: 코퍼스 인터페이스 연구는 context window를 통해 전달되는 ranked snippet과 candidate limit을 제거하는 접근법을 구분하며, retrieval 성공은 agent harness와 정보 전달 방식에도 좌우된다 [2026].
3 방법
RISE는 두 계층으로 agent interaction space를 구성한다. retrieval은 context window 밖에 지속적으로 유지되는 bounded candidate set을 제공하고, offline processing은 그 문서를 shell tools로 탐색할 수 있게 만든다. RISE-BM25는 boundary layer만 분리해 구현하며, full RISE는 두 가지 결과를 모두 결합한다.
- 방법 개요: RISE는 지속적인 candidate workspace와 탐색 가능한 document representations를 결합하며, RISE-BM25는 bounded-workspace layer만 구현한다.workspace는 shell tools로 다시 탐색할 수 있고, 문서는 도구가 전체 파일을 스캔하지 않고도 sub-document evidence에 접근하도록 처리된다.
- Bounded workspace: workspace boundary는 full-corpus shell scans, context-window snippet limits, 그리고 native tools로 다시 탐색할 수 없는 candidate lists를 배제한다.RISE-BM25는 가져온 candidates를 model context window 밖의 filesystem으로 취급한다.
- 탐색 가능한 객체: RISE는 retrieved documents를 offline에서 section anchors가 포함된 line-numbered tables of contents로 처리하여, 폭넓은 browsing과 특정 line-range reads를 가능하게 한다.inference 시점에는 structured counterparts가 workspace에 hardlink되며, agent는 navigation에 TOC를 사용하고 확정한 사실을 body text와 대조해 검증한다.
- Bounded workspace: bounded workspace는 하나 이상의 자연어 BM25 sub-queries에 대해 검색된 top-K documents의 합집합으로 채워지는 query별 filesystem이다.문서를 가져올 수 있는 것은 search뿐이다. workspace는 단조롭게 증가하며, 반환된 top-10 previews 밖에서도 full matches를 계속 이용할 수 있다.
- 탐색 가능한 객체: navigable-object layer는 raw end-to-end document scans와, agent에게 보이는 evidence를 사전 선택하는 retrieval-time chunking 또는 snippet delivery를 피한다.TOC는 폭넓은 browsing과 정밀한 reads를 모두 지원하는 저비용 in-place metadata 형식이므로 사용된다.
4 실험 설정
실험은 100k 및 1M 문서 코퍼스에서 고정된 100개 쿼리 BrowseComp-Plus 샘플을 대상으로 RISE와 통제된 baseline을 평가한다. 연구에서는 지정된 계산 예산하에서 agent model, 판정 정확도, 효율성, tool 사용, evidence coverage, stopping behavior를 비교한다.
- 실행 환경: 각 실행은 24GB Apple M4 MacBook Air에서 네 개의 worker로 별도로 수행되며, 실행당 동시에 처리되는 쿼리는 최대 네 개다.방법들은 공동 스케줄링되지 않으므로 실행 중 시스템 간 직접적인 contention이 줄어든다.
- 비교 시스템: 비교 대상에는 full RISE, boundary-only RISE-BM25, DCI, retrieval-agent baseline이 포함되며, RISE 변형들은 sub-query마다 1,000개 문서를 retrieval하고 top-10 preview를 보여준다.RISE는 BM25 bounding과 offline TOC processing을 사용하고, RISE-BM25는 workspace에 원본 문서를 유지한다. 두 방법 모두 bm25s defaults k1=1.5 및 b=0.75를 사용한다.
- 예산 및 stopping 조건: RISE, RISE-BM25, retrieval-agent baseline에는 100 model calls와 1시간 제한이 주어지는 반면, DCI에는 300 calls와 1.5시간 제한이 주어진다.재현된 baseline은 원래의 budget과 stopping 설정을 따르며, DCI에는 full-corpus shell scan이 I/O-bound이므로 더 큰 allowance가 주어진다.
5 결과
RISE는 agent의 interaction space를 제한하고 shell navigation을 위해 문서를 처리함으로써 낮은 비용으로 높은 정확도를 달성하며, corpus 규모가 커져도 견고하게 동작한다. 최적 configuration은 82% 정확도에 도달하며, 1M-document 결과는 boundary-only RISE-BM25가 DCI보다 더 잘 확장됨을 보여준다.
- 100k 결과: RISE-BM25는 더 큰 model tier에서 full RISE에 근접하며, interaction space를 제한하는 것이 성능 향상의 대부분을 제공하고 indexing-time processing은 더 작은 추가 개선을 준다는 점을 보여준다.gpt-5.4-mini에서 DCI는 RISE와 동률이지만 query당 비용이 4× 더 높다. mimo-v2.5-pro에서 DCI는 100회 중 18회의 wall-clock failure가 발생하며 60% 정확도에 도달한다.
- 5 결과: 82% 정확도를 달성한 gpt-5.4 medium 기반 RISE가 전체에서 가장 정확한 configuration이며, gpt-5.4-mini 및 mimo-v2.5-pro 기반 RISE는 retrieval-agent와 DCI보다 낮은 비용으로 78%에 도달한다.medium configuration의 cov_mean=92.4%이며, gpt-5.4-mini 대비 향상폭은 크지 않은 (+4 points) 반면 query당 비용은 $0.28에서 $1.25로 증가해 4.4× 더 높다.
- 확장성: 1M documents에서 RISE-BM25는 mimo-v2.5-pro에서 75%에서 83%로, gpt-5.4-mini에서 77%에서 81%로, gpt-5.4-nano에서 64%에서 65%로 향상된다.offline document processing을 추가된 900k FineWeb-Edu distractor에 확장하지 않았으므로, 이 결과는 boundary mechanism만을 측정한다.
- 확장성: 1M documents에서 nano 기반 DCI는 71%에서 60%로 하락하고 wall-clock failure는 7 query에서 33 queries로 증가하는 반면, RISE-BM25는 성능이 저하되지 않는다.DCI는 answer하기 전에 broad shell output을 선별하는 데 budget을 자주 소모하므로, 보고된 API cost가 더 낮다고 해서 효율성이 향상된 것은 아니다.
- Top-K ablation: K=1000은 gpt-5.4-mini에 가장 적합한 BM25 top-K 설정으로, 최적의 mimo-v2.5-pro 설정과 1 point 이내이며 nano에서도 최대 1 point 차이로 동률이다.누적 workspace는 대략 7.6k–10.4k files이며, 더 큰 K가 정확도를 단조롭게 향상시키지는 않는다. 주요 tradeoff는 recall과 local navigation overhead 사이에 있다.
6 사례 연구
사례 연구는 RISE 에이전트가 retrieval로 구성된 workspace와 indexing 시점에 구축한 문서 구조를 결합해 문서 내부에서 검증을 수행함을 보여준다. 난독화된 multi-clue 질문에서 에이전트는 shell tool로 표적 증거를 검증하기 전에 후보 workspace를 반복적으로 확장한다.
- 사례 연구: Figure 3은 정답을 나타내는 entity가 전혀 명시되지 않은 난독화된 multi-clue BrowseComp-Plus 질문에 대해 100k corpus에서 gpt-5.4-mini가 성공한 두 개의 trajectory를 보여준다.두 trajectory 모두 의도한 workflow를 처음부터 끝까지 따른다.
- 사례 연구: RISE-BM25 사례에서 에이전트는 unknown-target 질문을 다섯 번의 search call에 걸친 열다섯 개의 paraphrased sub-query로 분해하고, 결과를 union한 뒤 rg와 read를 사용해 workspace 안에서 검증한다.Retrieval은 workspace의 형태를 반복적으로 결정하고, shell tool은 문서 내부에서 증거를 검증한다.
- 사례 연구: RISE 사례에서는 LLM이 생성한 줄 번호가 매겨진 목차를 통해 에이전트가 단서를 Acknowledgements 항목에 대응시키고, 관련 줄을 읽은 다음 title header에서 journal을 확인한다.이 trajectory는 indexing 시점의 처리가 장문 문서를 전체 본문으로 읽지 않고도 탐색 가능한 구조로 변환하는 방식을 보여준다.
7 결론
결론은 agentic search에서 retrieval의 역할을 snippet을 추출하거나 제한 없이 corpus를 노출하는 것이 아니라, 경계가 있고 탐색 가능한 interaction space를 구성하는 것으로 규정한다. RISE는 BM25 경계와 offline document processing으로 이 설계를 구현하며, pure-shell DCI보다 유리한 accuracy–cost tradeoff와 높은 scalability를 달성한다.
- RISE 설계: RISE는 BM25로 경계를 설정하고, shell navigation을 위해 문서에 line-numbered table of contents를 offline으로 추가해 interaction space를 구성한다.이는 context만 반환하는 retrieval이 아니라 탐색 가능한 space를 반환하는 proof-of-concept 구현으로 제시된다.
- 실증 결과: RISE는 pure-shell DCI를 per-query cost의 일부만으로 재현하고 100k에서 1M documents까지 안정적으로 유지되는 반면, pure-shell DCI는 wall-clock failures와 함께 성능이 저하된다.BrowseComp-Plus에서 이 interface는 보고된 accuracy–cost tradeoff를 제공하며, 더 큰 model tier에서는 snippet retrieval-agent performance가 더 약하다.
- broader conclusion: 더 넓은 설계 목표는 intermediate retrieval output, 즉 agent가 shell tools로 다시 탐색할 수 있고 구조적으로 sub-document evidence에 저렴하게 도달할 수 있는 bounded candidates다.이는 boundary consequence와 processing consequence를 결합해 corpus interaction을 retrieval-system design의 일부로 만든다.
8 한계
이 연구는 BM25 경계와 줄 번호가 매겨진 TOC로 설계적 함의를 구현했지만, 대안적인 retrieval 및 metadata 방식은 탐색하지 않았다. 또한 평가는 하나의 benchmark family, 100 queries, closed-weight agents, 단일 judge만 다루므로, 작은 accuracy 차이는 정밀한 수치라기보다 방향성으로 해석해야 한다.
- 8 한계: RISE는 boundary mechanism을 BM25로만, document processing을 줄 번호가 매겨진 TOC로만 평가했으며, 더 넓은 design space의 검토는 향후 과제로 남겼다.자연스러운 후속 연구로는 dense, late-interaction, hybrid retriever와 section graph 또는 paragraph-level anchor가 있으며, processing consequence는 100k corpus에서만 평가됐다.
- 8 한계: 평가는 BrowseComp-Plus, 100개 쿼리, closed-weight agents, 그리고 대부분의 agent 및 structured-corpus generator와 같은 model family를 공유하는 단일 judge gpt-5.1만을 대상으로 한다.이러한 선택으로 실증적 근거의 범위가 좁아진다.
- 8 한계: 따라서 tier별 accuracy 차이가 몇 points에 불과한 경우, 이를 정밀한 수치라기보다 방향성으로 해석해야 한다.이는 benchmark, agent, query, judging setup이 제한적이라는 평가 구성에서 비롯된다.
RISE-BM25 시스템 프롬프트
RISE-BM25 시스템 프롬프트는 에이전트가 반복 검색, shell 탐색, 파일 읽기를 사용해 직접 볼 수 없는 대규모 corpus에서 연구 질문에 답하도록 설정한다. 에이전트는 검색된 문서를 축적하고 relative-path 도구로 검사하며, 확신이 들면 구조화된 최종 답변을 반환한다.
- 에이전트는 직접 볼 수 없는 대규모 문서 corpus에 관한 연구 질문에 답한다.
- 프롬프트는 문서 검색, working directory 탐색, 파일 검사를 위해 search, bash, read라는 세 도구를 제공한다.
- Search는 bag-of-words query와 매칭해 query별 top-10 preview를 반환하고, 전체 매칭 집합을 누적 working directory에 추가한다.더 넓은 coverage를 위해 query에는 여러 distinctive term을 사용해야 하며, 상호 보완적인 group으로 발행할 수 있다.
- Bash는 relative-path working directory 내에서만 rg, grep, ls, find, cat, head 같은 command를 지원하며, read는 full path로 파일을 검사한다.
- 에이전트는 search와 파일 검사를 번갈아 수행한 뒤, 설명, 정확한 답, confidence percentage를 출력하면 더 이상 tool을 호출하지 않아야 한다.
B 구조화 문서: 프롬프트와 예시
RISE는 검색된 문서에 탐색 가능한 TOC와 해당 요약을 근거가 아닌 색인으로 취급하는 프롬프트를 추가한다. 구조화 형식은 메타데이터, 섹션 범위, 본문 텍스트를 결합해 shell-style 탐색을 지원하면서 문서 본문에서의 사실 검증을 유지한다.
- B 구조화 문서: 프롬프트와 예시: RISE의 프롬프트는 TOC가 추가된 형식을 설명하고, 에이전트가 TOC 요약이 아니라 문서 본문에서 사실을 검증하도록 요구한다.이 시스템은 RISE-BM25와 동일한 search 및 shell 인터페이스를 사용하며, 구조화 파일을 탐색하기 위한 지침을 추가한다.
- B 구조화 문서: 프롬프트와 예시: 100,195개 문서 중 94.5%에는 검증된 TOC 항목이 하나 이상 포함되었고, 제안된 섹션 앵커 808,062개 중 99.3%가 위치 확인되었다.앵커가 전부 유효하지 않거나 출력을 파싱할 수 없는 문서는 빈 TOC와 함께 원문으로 대체된다.
- B.1 RISE 시스템 프롬프트 (문서 처리 포함): Search는 프리뷰를 반환하는 동시에 각 query의 전체 match set을 working directory에 추가하여, bash와 read를 사용한 반복적 탐색을 가능하게 한다.서로 보완적인 여러 query로 coverage를 넓힐 수 있으며, 검색된 문서는 turn이 진행될수록 누적된다.
- B.1 RISE 시스템 프롬프트 (문서 처리 포함): 각 구조화 문서에는 YAML 메타데이터, 줄 범위가 표시된 Table of Contents, 본문 sentinel, 그리고 나열된 섹션과 일치하는 본문 heading이 포함된다.이 형식은 섹션 수준 탐색을 지원하면서 검증을 위한 문자 그대로의 문서 본문을 보존한다.
- B.1 RISE 시스템 프롬프트 (문서 처리 포함): 에이전트는 관련 섹션을 빠짐없이 읽고, 필요하면 read 범위를 확장하며, 그럴듯한 TOC 항목만을 근거로 사실을 확정하지 않아야 한다.TOC 요약은 세부 사항을 생략하거나 뉘앙스를 잃거나 약간 부정확할 수 있으며, 짧거나 단일 주제인 문서는 일반적으로 읽는다.
- B.2 예시 구조화 문서: Bath Spa University를 다룬 예시 구조화 문서는 frontmatter, 줄 범위가 포함된 섹션 요약, 본문 heading, 그리고 이에 대응하는 역사적 텍스트를 보여준다.섹션에는 기관의 유산, Bath School of Art 시대, Locksbrook Campus 확장이 포함된다.
- B.2 예시 구조화 문서: 이 예시는 TOC 항목이 Bath Spa의 1852년 미술학교 기원과 2019년 Locksbrook Campus 개관을 포함한 다양한 본문 섹션을 탐색하도록 한다는 점을 보여준다.본문은 TOC가 요약한 역사적 세부 사항의 근거를 제공한다.
C 구조화된 코퍼스 생성 프롬프트
이 프롬프트는 변경하지 않은 문서에 대해 탐색 가능한 섹션 경계를 제안하도록 에이전트를 지시하며, 후속 삽입과 목차 생성을 위한 제목, locator, 설명을 생성한다. 정확하고 고유한 anchor를 강제하고 문서 구조와 유형에 따라 섹션을 적응적으로 나눈다.
- 프롬프트 목적: 프롬프트는 원문을 다시 쓰지 않고 섹션 경계, 내용을 짧게 설명하는 제목, 한 문장 설명을 제안한다.후속 스크립트는 원문에 제목을 삽입하고 출력 결과에서 줄 번호가 붙은 목차를 작성한다.
- Anchor 규칙: anchor는 문서에서 정확히 복사한 고유한 6–12단어 부분 문자열이어야 하며 섹션 순서대로 나열한다.첫 번째 anchor는 문서 본문을 시작하고, anchor는 바꿔 쓸 수 없으며, 그대로 인용할 anchor가 없는 섹션은 제안하지 않아야 한다.
- 섹션화 지침: 섹션은 자연스러운 주제 전환을 따르며, 일반적인 산문은 적당히 나누고 카탈로그는 독립적인 항목이나 그룹별로 적극적으로 나눈다.서로 의존하는 절차 단계는 하나의 포괄 섹션에 남기고, 앞부분 자료와 내용이 빈약한 후행 상투 문구는 제외한다.
- 출력 품질: 설명은 구체적인 10–25단어 요약이어야 하며, 관련성이 있으면 핵심 개체, 날짜, 장소 또는 숫자를 언급한다.제목은 일반적인 라벨 대신 섹션 내용을 설명해야 한다.