Source-linked AI summary

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

arXiv:2606.31179v1cs.AIcs.CLcs.CV

TL;DR

Healthcare에는 여러 task, modality, data source를 아우르는 현실적인 end-to-end clinical workflow에서 frontier system을 평가할 수 있는 광범위한 agent-native benchmark가 부족하다. HealthAgentBench는 7개 category, 54개 task로 이러한 공백을 해소하며, Codex GPT-5.5도 약 42% task success에 그치는 등 현재 agent가 여전히 큰 도전에 직면해 있음을 보여준다.

  • 문제

    기존 healthcare benchmark는 분절되어 있으며, agent의 전체 end-to-end capability보다 고립된 reasoning이나 협소한 task, modality, workflow를 평가하는 경우가 많다.

  • 방법

    HealthAgentBench는 다양한 clinical workflow와 modality를 아우르는 7개 environment에서 54개 patient-grounded task를 대상으로 통일된 success criterion을 사용해 agent를 평가한다.

  • 결과

    Codex GPT-5.5는 42% task success rate를 달성했으며, benchmark는 task category, workflow, modality 전반의 강점과 한계를 드러낸다.

  • 시사점 및 한계

    HealthAgentBench는 agentic healthcare에서 substantial room for progress가 있음을 보여주는 도전적인 testbed이며, 특히 medical imaging, large search space, compositional reasoning에서 그렇다.

  • 시사점 및 한계

    Medical imaging은 여전히 지속적인 난제로 남아 있으며, Codex agent의 평균 success는 22%, Claude Code agent는 12%다.

Abstract

from arXiv · show

As AI agents become increasingly capable of complex, long-horizon reasoning, rigorous and holistic evaluation is essential for measuring progress toward real-world healthcare applications. We introduce HealthAgentBench, a suite of 54 agentic healthcare tasks across 7 categories each with its unique environment. The benchmark suite spans diverse workflows throughout the patient journey and a broad range of modalities. Each task is designed to replicate an end-to-end clinical workflow: given minimal instructions, an agent must explore raw healthcare data, operate within a complex environment, and execute multi-step solutions that go beyond naive prompting. A final task success rate is reported to provide a single, interpretable metric for HealthAgentBench overall performance for each agent. Evaluating frontier agents on HealthAgentBench, we find that overall task success rate remains low, underscoring the difficulty of the suite. The strongest and the most cost effective agent, Codex GPT-5.5, achieves only approximately 42% success rate. Beyond aggregate performance, HealthAgentBench reveals nuanced strengths and weaknesses across task categories. Frontier agents show promise in automatically developing research modeling pipelines over EHR data, but medical imaging remains especially challenging, particularly for Claude Code models, while Codex GPT-5.5 shows emerging capability. Tasks that combine large search spaces with compositional reasoning requirements remain difficult for all current agents. Together, these results suggest that HealthAgentBench provides a challenging and realistic benchmark with substantial room for future progress. We release our benchmark at https://github.com/microsoft/HealthAgentBench.

1 서론

HealthAgentBench는 7개 범주에 걸쳐 다양한 임상 워크플로와 modality를 포괄하는 54개의 현실적인 agentic healthcare task로 구성된 통합 suite다. Frontier agent의 전반적 성능은 낮으며, Codex GPT-5.5도 약 42%의 성공률에 그친다. Medical imaging과 대규모 search space를 다루는 compositional task는 여전히 주요 병목이다.

  • 동기: Healthcare workflow에서는 3D CT volume, gigapixel pathology slide, longitudinal EHR, trial protocol, 이질적인 clinical document 등 짧은 prompt에 담을 수 없는 데이터를 대상으로 reasoning해야 한다.기존의 정적 benchmark와 최근의 agent-oriented 연구 [7] [5]는 이러한 역량을 평가하는 범위가 여전히 제한적이다.
  • Benchmark 기여: HealthAgentBench는 medical imaging, free text, structured EHR data, 다양한 clinical workflow를 포괄하는 7개 범주의 54 patient-grounded task를 도입한다.이 suite는 고유한 environment와 향후 edition에서 확장할 수 있는 task 수집 및 선정을 위한 원칙적인 workflow를 포함한다.
  • 평가 설계: 이 benchmark는 복잡한 healthcare data를 대상으로 planning, tool use, environment exploration, multi-step task execution을 요구함으로써 end-to-end agent capability를 평가한다.예를 들어 longitudinal chest radiograph를 검사하고, image를 확대·crop하며, 이전 검사를 교차 참조하고, 수정된 report를 작성해야 한다.
  • 실증적 결과: 가장 강력한 평가 agent인 Codex GPT-5.5는 약 42%의 overall task success를 달성했으며, 이는 HealthAgentBench가 여전히 saturation과 거리가 멀다는 것을 보여준다.이 benchmark는 task category, clinical workflow, data modality 전반에서 agent의 강점과 약점을 정교하게 분석할 수 있도록 한다.
  • 실증적 결과: Medical imaging과 large search space에서 complex compositional reasoning을 요구하는 task가 주요 병목인 반면, Codex GPT model은 대체로 imaging task에서 Claude Code model보다 우수하다.분석 결과 CT, X-ray, pathology-slide task가 특히 어려운 것으로 나타났으며, Codex GPT model, 특히 GPT-5.5가 대체로 더 cost-effective한 것으로 확인됐다.

2 관련 연구

기존 healthcare-agent benchmark는 medical question answering, interactive clinical dialogue, real data 기반 executable environment를 아우르지만, 전체 patient journey에 걸친 통합적이고 실행 가능하며 멀티모달인 평가를 제공하는 것은 없다.

  • 위치 설정: HealthAgentBench는 전체 patient journey에 걸친 통합적이고 실행 가능하며 멀티모달인 평가로 이 공백을 메우는 benchmark로 자리매김한다.이 논문은 선행 연구를 서로 보완적인 세 갈래로 묶고, 각각과 HealthAgentBench의 관계를 설명한다.
  • Medical question answering: 기존 benchmark는 주로 multi-agent collaboration, single-LLM prompting, conventional methods, broad clinical capability suite를 포함한 medical question answering의 agentic strategy를 평가한다 [20].MedAgentBoard는 medical task family 전반에서 이러한 접근법을 비교하고, ClinicalAgent Bench는 다섯 가지 clinical capability dimension과 풍부한 clinical toolbox를 결합한다.
  • Interactive clinical dialogue: 반면 interactive evaluation은 clinical dialogue를 중심으로 하며, 의사가 작성한 multi-turn conversation, cost-aware sequential diagnosis, 상호작용하는 medical agent를 갖춘 simulated clinic을 아우른다 [13] [26] [31].HealthBench와 HealthBench Professional은 patient 및 clinician conversation rubric을 제공하고, MAI-DxO는 난도가 높은 NEJM case를 사용하며, AgentClinic은 doctor, patient, measurement agent를 simulation한다.
  • Executable environments: 가장 가까운 선행 연구는 agent를 real clinical data 기반 executable environment에 배치하지만, benchmark는 대체로 structured EHR workflow와 같은 특정 setting에 초점을 둔다 [22] [35].MedAgentBench와 PhysicianBench는 record retrieval 및 order placement를 위해 FHIR 기반 EHR을 사용하고, PhysicianBench는 long-horizon의 execution-verified workflow를 추가하며, MedAgentGym은 확장 가능한 code-centric environment를 제공한다.

3 과제 생성

HealthAgentBench는 현실적인 agentic workflow, 폭넓은 modality 범위, 검증 가능한 결과, cheating 방지 장치를 강조하며 7개 healthcare category에 걸쳐 54개 과제를 생성하는 4단계 workflow를 사용한다. 과제는 최소한의 지시만 포함한 terminal environment로 패키징되고, 대표성 있게 sampling되며, baseline sweep과 trajectory review를 통해 검증된다.

  • 과제 범위: 이 benchmark는 실제 clinical data를 사용해 data management, diagnostics, event modelling, treatment planning을 아우르는 7개 category에 걸쳐 54개 과제를 포함한다.category에는 X-ray Report Correction, Pathology Tumor Area Selection, CT Abnormality Classification, Clinical Trial Matching, EHR Data Quality Auditing, EHR Event Modelling, EHR Format Conversion이 포함된다.
  • 설계 요구사항: 과제는 naive prompting을 넘어 planning, tool use, multi-step reasoning 또는 environment interaction을 요구하며, 다양한 clinical setting에서 5가지 input modality를 다룬다.modality는 2-D radiograph, 3-D chest CT, pathology whole-slide image, free-text clinical document, structured EHR data다.
  • 과제 생성 workflow: 각 후보 과제는 selection criteria, benchmark 또는 curated patient data에 기반한 construction, standardized design principles, cheating·ambiguity·triviality에 대한 final checks의 4단계를 거친다.기존 benchmark는 원래 평가에서 사용된 human scaffolding 없이 autonomous end-to-end exploration을 요구하는 terminal-based environment로 변환된다.
  • 설계 원칙: 이 suite는 versatile terminal environment, category별 대표성을 갖춘 5–15-sample sampling, runtime data download, opaque identifier, disabled browsing, minimalist instruction을 사용한다.이러한 선택은 heterogeneous data access를 지원하는 동시에 predefined workflow가 아니라 agent의 planning과 strategy formulation을 평가한다.
  • 평가 및 검증: 과제 성공은 binary task-specific criteria로 평가하고, F1과 recall 같은 metric은 partial progress를 정량화한다. baseline sweep과 transcript review를 통해 shortcut과 실제 ambiguity를 제거한다.gold label과 verifier code는 agent container 외부에 유지되며, 의도하지 않은 shortcut이나 여러 개의 합리적 해법이 발견되면 과제를 다시 설계한다.

4 베이스라인 및 결과

HealthAgentBench는 frontier agent에게 여전히 어렵다. Codex GPT-5.5의 전체 task success는 42%에 그치며, 성능은 harness, 비용, modality, task category에 따라 크게 달라진다. Agent는 EHR machine-learning workflow에서 가능성을 보이지만, 복잡한 retrieval과 medical imaging에서는 어려움을 겪는다.

  • Harness 효과: 42%에서 35%로: GPT-5.5의 success rate는 Codex에서 Copilot CLI로 갈 때 하락하는 반면, Opus-4.8은 Claude Code의 32%에서 Copilot CLI의 36%로 상승한다.이 차이는 harness가 agent 성능에 큰 영향을 줄 수 있음을 보여준다. Copilot CLI는 multi-agent architecture를 사용한다.
  • 전체 결과: 42%: Codex GPT-5.5는 162회 trial에서 가장 높은 task success rate를 달성했지만, HealthAgentBench에는 여전히 상당한 개선 여지가 있다.평가는 54개 task 각각에 대해 3회 시도를 포함한다.
  • 성과: EHR modelling을 위한 Machine Learning AutoResearch: 10개 agent 중 9개가 EHR Format Conversion에서 100% task success를 달성했으며, 이는 clinical-data ETL pipeline 구축 능력이 뛰어남을 보여준다.EHR Event Modelling과 EHR Format Conversion은 tabular clinical data를 대상으로 한 machine-learning research workflow를 재현하며, 이 환경에서 agent는 human performance와 경쟁력 있게 견줄 수 있다.
  • 과제: Needle in a Haystack - Complex Search Space에서의 Full Retrieval: 42%: Claude Code Opus-4.6은 EHR Data Quality Auditing에서 가장 강력한 agent지만 50%를 넘는 agent는 없으며, Clinical Trial Matching은 약 400개의 free-text protocol 검색을 요구한다.이 task들은 대규모 또는 비정형 search space에서의 retrieval과 compositional reasoning을 함께 평가한다.
  • 과제: Medical Imaging과 Codex GPT-5.5의 부상하는 capability: 17% 대 49%: imaging task의 평균 success는 text task보다 훨씬 낮으며, Codex GPT-5.5도 imaging task 전체에서 평균 약 35%에 그친다.Codex agent는 imaging에서 평균 22%, Claude Code는 12%를 기록한 반면, text task에서는 두 family가 50% 대 48%로 비슷하다.

5 결론

HealthAgentBench는 환자 여정 전반의 다양한 데이터 modality와 임상 workflow를 아우르는 healthcare AI agent용 통합 agent-native benchmark suite다. 현재 frontier agent에게 여전히 매우 어려우며, Codex GPT-5.5도 평균 성공률 42%에 그쳐 향후 발전의 여지가 크다.

  • 5 결론: 가장 강력한 agent인 Codex GPT-5.5가 전체 suite에서 42% 평균 성공률을 달성한다.이 결과는 benchmark의 난이도를 뒷받침하며 향후 발전의 여지가 크다는 점을 보여준다.
  • 5 결론: HealthAgentBench는 환자 여정 전반에 걸친 다양한 데이터 modality와 임상 workflow에서 healthcare AI agent를 평가하기 위한 통합 agent-native benchmark를 제공한다.

벤치마크 비교

Table 1은 modality와 interaction workflow를 비교해 의료 agent 벤치마크 내 HealthAgentBench의 위치를 보여주며, 이 벤치마크는 5개 modality와 4개 workflow를 포괄한다.

  • 벤치마크 범위: HealthAgentBench는 벤치마크 비교에서 5개 입력 modality와 4개 workflow를 포괄한다.modality에는 text, structured EHR data, 2D 및 3D medical image, whole-slide pathology image, GUI interaction이 포함된다.
  • Modality: 이 비교는 agent가 처리해야 하는 원시 데이터에 따라 modality를 정의하며, text, EHR, 2D, 3D, WSI, GUI input을 포함한다.EHR input은 FHIR 또는 SQL을 통해 접근하는 structured 또는 tabular record로 구성되며, imaging modality에는 radiograph, dermatology photograph, ultrasound, fundus image, blood smear, CT/MRI volume, whole-slide pathology가 포함된다.
  • Workflow: workflow taxonomy는 treatment, communication, health-data operations, research, administration을 포괄한다.이 범주에는 care planning 및 prescribing, patient 또는 clinician communication, EHR 및 data-quality operations, analytic pipeline building 및 evidence synthesis, hospital operations가 포함된다.

B HealthAgentBench 벤치마크 스위트

HealthAgentBench는 7개 healthcare benchmark category를 containerized execution, hidden label, verification, diagnostic reward를 갖춘 표준화된 Harbor task로 구성한다. 이진 success framework와 다차원적 coverage는 다양한 clinical modality, workflow, output, patient scope, data-access regime을 아우른다.

  • Task Infrastructure: 7개 benchmark category는 표준화된 container, internet access, agent-visible instruction, hidden test label, 그리고 binary reward와 diagnostic metric을 산출하는 verifier를 갖춘 Harbor task로 구현된다.첫 번째 release는 Harbor execution substrate 를 중심으로 suite를 구성한다.
  • Success Criteria: 각 trial은 category-specific success criterion을 충족할 때만 reward 1을 받고, 그렇지 않으면 0을 받는다.criterion은 verifier check, error count, accuracy, F1, recall 또는 AUROC에 기반할 수 있으며, 이러한 binary outcome 전반에 걸쳐 aggregate task success rate를 보고한다.
  • Evaluation Coverage: 이 suite는 modality, clinical workflow stage, output shape, patient 및 temporal scope, data-access regime이라는 다섯 가지 evaluation axis를 포괄한다.Figure 7은 radiology, CT, pathology, free text, structured EHR modality를 포함해 7개 task category를 이러한 차원에 따라 매핑한다.

C 비용-성능 트레이드오프 · D 범주별 성능 세부 분석

비용-성능 분석에 따르면 GPT-5 에이전트가 HealthAgentBench Pareto frontier를 형성하는 반면, Claude Code 에이전트는 동일하거나 더 낮은 성공률에서 비용이 더 높다. 부록은 이러한 종합 결과를 범주별 세부 분석으로 보완한다.

  • C 비용-성능 트레이드오프: 도표에 표시된 성능 지표는 trial 가중 task success rate의 통합값이며, Figure 4에서 사용한 지표와 동일하다.
  • C 비용-성능 트레이드오프: Section 4에서는 최고 성능 에이전트가 반드시 가장 비싼 것은 아니라고 관찰한다.
  • C 비용-성능 트레이드오프: Pareto frontier는 Codex와 Copilot CLI를 포함한 GPT-5 에이전트만으로 구성된다.Figure 8은 전체 task success rate에 대한 전체 제품군 실행 비용을 도표로 나타낸다.
  • C 비용-성능 트레이드오프: 모든 Claude Code 에이전트는 Pareto frontier의 아래쪽 및 오른쪽에 위치하며, 이는 동일하거나 더 낮은 성공률에서 비용이 더 높음을 의미한다.
  • C 비용-성능 트레이드오프: Figure 8은 54개의 HealthAgentBench task 전체를 한 번 완전히 실행하는 데 필요한 총 USD를 비용으로 측정한다.x축은 로그 스케일을 사용한다.
  • D 범주별 성능 세부 분석: 부록은 Section 4의 종합 결과를 보완하는 더 세분화된 범주별 성능 분석을 제공한다.

D.1 범주별 결과: 성공률, 시간, 비용 · D.2 과제별 점수

범주별 평가는 10개 agent와 7개 과제 범주에 걸쳐 성공, wall-clock 시간, 비용을 보고하며, 과제별 metric은 이진 성공을 넘어서는 성능을 드러낸다. 결과는 Codex, Claude Code, Copilot CLI harness에서 xhigh reasoning effort로 instance당 3회 시도의 결과를 집계한다.

  • D.1 범주별 결과: 성공률, 시간, 비용: 범주별 결과는 모든 agent–범주 cell에 대해 이진 성공률, 평균 시도 시간, 평균 시도 비용을 함께 보고한다.Figure 5는 이 수치들을 시각화하며, Tables 4–6은 정확한 값을 제시한다.
  • D.1 범주별 결과: 성공률, 시간, 비용: 각 범주 cell은 Codex, Claude Code, Copilot CLI harness의 10개 agent에 대해 xhigh reasoning effort로 instance당 3회 시도를 통합한다.Wall-clock 시간은 분 단위로, 비용은 trial당 USD로 측정한다.
  • D.1 범주별 결과: 성공률, 시간, 비용: 범주별 평가는 imaging, pathology, clinical-trial matching, EHR auditing, event modelling, format conversion을 아우르는 7개 과제를 다룬다.성공률 표에는 X-ray Report Correction, CT Abnormality Classification, Pathology Tumor Area Selection, Clinical Trial Matching, EHR Data Quality Auditing, EHR Event Modelling, EHR Format Conversion이 포함된다.
  • D.2 과제별 점수: Figure 9는 결과를 이진 성공으로 축약하기 전에 범주별 과제 metric을 보고한다. 단, EHR Format Conversion은 점수가 이미 이진값이다.Metric의 scale이 서로 다르므로 각 panel은 자체 y-axis를 사용한다.
  • D.2 과제별 점수: 과제별 점수는 CT classification의 평균 accuracy, pathology selection의 tumor-tile F1, EHR auditing의 평균 recall, trial matching의 평균 recall@top-50이다.이 metric들은 이진 scoring 이전의 과제 수준 성능 측정치를 제공한다.
  • D.2 과제별 점수: EHR Event Modelling은 평균 AUROC를 사용하며, X-ray Report Correction은 유의미한 오류의 평균 개수를 사용한다. 이 metric은 값이 낮을수록 더 우수하다.Figure 9의 다른 모든 panel은 값이 높을수록 더 우수하며, 각 panel은 해당 과제의 성공 기준을 명시한다.

D.3 EHR 데이터 품질 감사: 넓은 검색 공간의 비용 … E.5 병리 종양 영역 선택: 병리 whole-slide 추론

HealthAgentBench의 EHR, trial-matching, imaging, pathology, data-management task 전반에서 agent는 넓은 공간을 검색하거나, 복잡한 modality를 해석하거나, 정확한 structured-output 기준을 충족해야 할 때 특히 어려움을 겪는다. Workflow에 따라 성능 편차가 크다. 검색 범위를 좁히면 EHR auditing 성능이 향상되는 반면, 보고된 CT 및 pathology 결과에서는 Codex GPT-5.5가 앞서고 clinical-trial matching에서는 Copilot CLI의 opus-4.8이 선두다.

  • D.3 EHR 데이터 품질 감사: 넓은 검색 공간의 비용: EHR Data Quality Auditing은 불가능한 값, demographic conflict, cross-table conflict 또는 duplicate, 그리고 이를 결합한 scenario를 아우르는 eight tasks로 구성되며, 각 task에는 base variant와 clue variant가 있다.clue variant는 추가로 주입된 sub-type과 검사할 table 또는 tables를 식별하지만, data, label, scoring은 동일하게 유지된다.
  • D.3 EHR 데이터 품질 감사: 넓은 검색 공간의 비용: 공개된 table로 검색 범위를 좁히면 EHR auditing recall이 크게 향상되며, Claude Code Opus-4.8은 clue variant에서 0.97에 도달한다.Benchmark는 eight tables와 800k개가 넘는 row를 사용하며, 검색 범위를 좁히면 동일한 data를 더 쉽게 해결할 수 있어 search-space size가 지배적인 bottleneck임을 보여준다.
  • D.4 EHR Event Modelling: AUROC 대 human engineered baseline: EHR Event Modelling은 동일한 first-prediction-time test cohort를 사용해 six new-onset diagnosis targets에서 가장 강력한 네 agent를 CLMBR 및 count+GBM과 비교한다.count+GBM model은 수작업으로 설계한 count feature에 대한 gradient-boosted classifier인 반면, CLMBR은 frozen clinical-language-model representation을 logistic regression과 함께 사용한다.
  • E.1 EHR Format Conversion: EHR ETL pipeline customization: frontier model 열 개 중 Nine of ten이 EHR format-conversion task를 3/3으로 완벽하게 완료했지만, claude-opus-4-6은 $0.88에서 세 번의 시도 모두 실패했다.통과한 model의 비용은 gpt-5.4-mini의 $0.29에서 claude-opus-4-7의 $2.34까지였으며, 동일한 reliability에서 약 8×의 범위다.
  • E.3 Clinical Trial Matching: patient–trial eligibility matching: 0.667의 평균 success rate로 Copilot CLI의 opus-4.8이 clinical-trial-matching leader가 되었으며, gpt-5.5의 0.519와 claude-opus-4-8의 0.481을 앞섰다.동일한 네 leading agent는 0.82에서 0.93 사이의 soft recall_top_50 값을 기록한 반면, 다른 모든 agent의 success는 0.259 이하였다.
  • E.4 CT Abnormality Classification: chest CT interpretation: CT abnormality classification에서 Codex gpt-5.5가 통과한 trial은 10/30으로, 보고된 success rate 중 가장 높았으며 gpt-5.4의 9/30 (0.300)을 앞섰다.Claude-family agent는 나열된 model에서 각각 5/30, 5/30, 4/30을 기록했다.
  • E.5 병리 종양 영역 선택: 병리 whole-slide 추론: Pathology tumor selection에서는 평균 약 100,000 × 100,000 pixels인 gigapixel whole-slide image에서 tumor area가 최소 20%인 모든 grid tile을 식별해야 한다.Task는 downsample 16에서 고정된 256 × 256 grid를 사용하며, hidden mask와 비교한 tile-F1 ≥0.90에 대해 보상한다.
  • E.5 병리 종양 영역 선택: 병리 whole-slide 추론: Pathology tumor-area selection에서 gpt-5.5가 통과한 trial은 12/30으로, 0.400의 평균 success rate와 0.845의 최고 tile-F1을 기록했다.0.30을 넘은 유일한 agent였으며, claude-opus-4-8이 0.200 (6/30)으로 뒤를 이었다.

E.6 ehrshot: 종단 임상 사건 예측

EHRSHOT tasks는 agent가 라벨된 timeline에서 종단 임상 사건 predictor를 학습하고, 이를 leakage가 차단된 부분 관측 test timeline에 적용할 수 있는지 평가한다. 6개 new-onset diagnosis task 전반에서 성능 편차가 상당하며, 가장 강한 agent는 0.778 mean pass rate를 달성했고 overfitting, leakage, resource exhaustion으로 실패가 발생한다.

  • E.6 ehrshot: 종단 임상 사건 예측: 이 benchmark는 hidden test labels, one-click data download, mechanical leak-proofing을 갖춘 재현 가능한 Harbor-first workflow로 EHRSHOT을 패키징한다.Test patient에는 첫 prediction time 이전의 event만 남고, 미래 end value는 blank 처리되며, label은 main agent가 접근할 수 없는 격리된 /tests/ mount에 유지된다.
  • E.6 ehrshot: 종단 임상 사건 예측: Agent는 train 및 validation timeline에서 6개 new-onset diagnosis를 예측한 뒤, AUROC로 score가 산출되는 unlabeled test set에 대해 환자별 연속 확률을 제출한다.선정된 target은 hyperlipidemia, celiac disease, acute myocardial infarction, pancreatic cancer, systemic lupus, essential hypertension이며, 성공하려면 각 task의 count+LightGBM baseline을 충족해야 한다.
  • E.6 ehrshot: 종단 임상 사건 예측: 0.778 mean pass rate는 claude-opus-4-7 (14/18)이 가장 높았고, Codex gpt-5.5와 Copilot의 opus-4.8이 0.722 (13/18)로 뒤를 이었다.claude-opus-4-8과 Copilot의 gpt-5.5는 0.667 (12/18)에 도달했으며, gpt-5.4-mini와 claude-opus-4-6은 각각 0.389 (7/18)와 0.333 (6/18)을 기록했다.
  • E.6 ehrshot: 종단 임상 사건 예측: 희귀한 outcome은 심각한 overfitting을 유발할 수 있다. GPT-5.5의 celiac model 중 최고 성능은 validation AUROC ∼0.74에서 test 0.30으로 하락했다.fold 간 ensemble score가 유출되는 경우를 포함한 자체 유발 validation leakage는 held-out generalization gap을 가릴 수 있다.
  • E.6 ehrshot: 종단 임상 사건 예측: Resource exhaustion도 또 다른 failure mode다. 성능이 낮은 agent는 ∼2.1 GB events.csv file을 streaming하는 동안 timeout되고 submission을 생성하지 못한다.이 task는 16 CPUs, 64 GB RAM, 65 GB storage를 사용하며 suite에서 가장 비용이 높은 task로 설명된다.

E.7 EHR 데이터 품질 감사: EHR 데이터 품질 감사

이 범주는 결정론적 비공개 합성 오류를 사용한 EHR 데이터 품질 감사를 평가하며, 현실적인 공개 및 부정행위 방지 제약 아래 임상적으로 타당하지 않은 행을 표시하도록 요구한다. 성능은 낮다. 최고 agent의 평균 성공률은 0.417에 불과하며, 고재현율 실행도 불완전하면 엄격한 통과 기준을 충족하지 못한다.

  • Benchmark 설계: 이 suite는 8개 MIMIC-IV demo table [16] 전반에 숨겨진 label을 포함한 결정론적 seeded synthetic errors를 사용하며, 불가능한 값, 불일치, 인구통계학적 모순을 다룬다.Gold label은 corruption과 함께 생성되며, 실제 오류인지 수작업으로 검토된다.
  • Task와 출력: Agent는 flagged_rows.csv 파일에 table과 _row_id 쌍을 제출하며, base task에는 주입된 하위 유형과 검사할 table을 공개하는 variant가 함께 제공된다.Benchmark에는 impossible-value, inconsistency, demographic-conflict, combined task가 포함되며, 각 task에 추가 _clues variant가 있다.
  • 보상과 평가: Benchmark는 cluster-level recall이 1.0이고 precision이 최소 0.01일 때만 통과하므로, 불완전한 고재현율 실행은 0점을 받는다.Cluster-level recall은 주입된 모든 오류 cluster에 적어도 하나의 표시된 구성원이 있는지를 측정한다.
  • 부정행위 방지와 정보 유출 차단: 정보 유출 방지는 난독화된 source name과 upstream dataset을 가져오지 말라는 지시에 의존하며, 계획된 /etc/hosts egress block은 비활성 상태다.현재 clean copy 검색을 막는 실제 방어 수단은 instruction-level prohibition과 source-name obfuscation이다.
  • Baseline 관찰: 0.417 평균 성공률 (10/24)이 최고 결과이며, claude-opus-4-6과 Copilot’s gpt-5.5가 공동 달성했다. 어떤 agent도 0.42를 넘지 못한다.claude-opus-4-7, claude-opus-4-8, Copilot’s opus-4.8은 0.333 (8/24)에 도달하고, Codex gpt-5.5는 0.250 (6/24)에 도달한다.
  • Baseline 관찰: Agent는 대체로 미묘하게 충돌하거나 중복된 record를 under-flag하며, 0.01 precision 하한에 근접할 만큼 over-flag하는 agent는 없다.이 패턴은 실패가 과도한 false positive보다 주입된 오류 cluster를 놓친 데서 주로 비롯됨을 보여준다.

F 성공한 Trial의 Trajectory Analysis … F.6 X-ray Report Correction: read priors, let the image decide

성공적인 HealthAgentBench trajectory는 맹목적인 code나 answer generation보다 orientation, verification, 그리고 raw data와 environment에 대한 절제된 interaction을 일관되게 우선한다. Task category 전반에서 agent는 변경 범위를 설정하고, evidence를 triage한 뒤 재확인하며, 적절한 view나 feature를 구성하고, 최종 output을 검증된 observation에 근거해 산출함으로써 성공한다.

  • F 성공한 Trial의 Trajectory Analysis: 7개 category 모두에서 반복적으로 나타나는 특징은 가장 강력한 agent가 대부분의 step을 orientation, verification, workspace 열거, data 읽기, intermediate output 점검에 사용한다는 점이다.Trajectory는 맹목적 generation이 아니라 orient → scope → execute → verify → clean workflow를 강조한다.
  • F.1 EHR Format Conversion: minimal scoped config override: Codex GPT-5.5는 최소한의 copied-config override를 적용하고 parquet content를 검증하며 default YAML은 수정하지 않음으로써, 표본 EHR conversion trial에서 100% success를 달성했다.Agent는 먼저 repository wiring, configuration, staged input을 점검한 뒤 편집했고, 이후 최종 git-status sweep을 수행했다.
  • F.2 Clinical Trial Matching: triage, then parallel eligibility adjudication: Opus-4.8은 code에서 301개 XML을 triage하고, 5개 subagent에 걸쳐 adjudication을 병렬화하며, 경계 사례를 중앙에서 재확인함으로써 gold-eligible trial 4개를 모두 recall 1.0으로 복원했다.Structured patient profile에는 부재한 condition과 device도 명시적으로 포함되어 exclusion criteria가 일관되게 적용되었으며, 차선의 Codex agent는 52% task success를 기록했다.
  • F.3 EHR Event Modelling: leakage-safe ML pipeline: Claude Code Opus-4.7은 29M event에 대해 leakage-safe pipeline을 구축하고, cutoff 이전 data만 사용해 patient-level prediction feature를 구성함으로써 78% success를 달성했다.Codex GPT-5.5도 29.3M row에 대한 Polars lazy join과 feature table 내부에서 강제되는 anti-leakage cutoff를 포함한 유사한 engineering을 사용했다.
  • F.4 CT Abnormality Classification: multi-window rendering and noise control: Codex GPT-5.5는 33% task success를 달성했고, 보수적으로 label을 결정하기 전에 multi-window, multiplanar, z-slab view를 rendering하여 표본 CT trial을 1.0 accuracy로 통과했다.Rendered view에 voxel-spacing 및 HU measurement를 보완적으로 사용한 뒤, 요청된 모든 label이 yes/no value와 함께 정확히 한 번씩 나타나는지 확인했다.
  • F.5 병리 종양 영역 선택: 다중 해상도 tiling 및 형태 기반 판정: Codex GPT-5.5는 다중 해상도 병리학 뷰를 정렬하고, 형태학적으로 추론하며, 모호한 경계를 정제하고, 외부 패스를 실행해 tile-F1 0.967을 달성했다. true-positive 타일은 163개였고 누락은 없었다.trajectory는 저조직 과대 판정을 피하기 위해 조직 및 염색 비율만 사용했다. 학습된 classifier는 훈련하지 않았으며, Figure 13은 spurious 타일 2개와 함께 결과를 보여준다.
  • F.6 X-ray Report Correction: read priors, let the image decide: Codex GPT-5.4는 prior report를 읽고, image를 사용해 모순을 해결하며, 영향을 받은 sentence만 편집하는 24-step, $0.314 trajectory를 통해 X-ray correction task에서 40% task success를 달성했다.JSON read-back으로 workflow를 완료했으며, 이는 각 correction을 image에 근거하게 하면서 다른 text를 보존해야 하는 edit-only scoring requirement에 부합했다.

F.7 EHR Data Quality Auditing: 스크립트 기반 탐지와 반복적 recall 복구 · F.8 공통 주제

EHR auditing은 스크립트 기반 검사 후 반복적 recall 복구를 수행할 때 성공하며, task 전반에서 agent는 검증을 우선시하고 각 workflow의 병목에 맞춰 전략을 조정한다. 병리학 예시는 두 개의 spurious tile이 있었음에도 종양 영역 전체를 recall한 사례로 이러한 패턴을 보여준다.

  • F.7 EHR Data Quality Auditing: 스크립트 기반 탐지와 반복적 recall 복구: 샘플링된 인구통계 충돌 trial에서 Claude Code Opus-4.6은 42% success rate를 달성했으며, 8개의 gzipped table을 검사한 뒤 오류를 full recall했다.Agent는 인구통계 모순을 탐지하는 Python detector를 작성하고 반복적으로 개선했다.
  • F.7 EHR Data Quality Auditing: 스크립트 기반 탐지와 반복적 recall 복구: 반복적 recall 복구를 통해 누락된 Hemoglobin 모순을 포착하고, gender가 불일치하는 또 다른 환자를 발견했으며, 재제출 전에 표시된 모든 row ID를 source와 대조해 검증했다.Detector는 초기 pass에서 gender-specific lab, reference range, height에 대한 심층 검사로 진행했다.
  • F.7 EHR Data Quality Auditing: 스크립트 기반 탐지와 반복적 recall 복구: EHR auditing workflow는 반복적인 스크립트 sweep이 처음에 놓친 오류를 복구할 수 있음을 보여주지만, 제시된 passage는 이러한 패턴이 더 넓은 benchmark 전반에서 지속되지는 않는다고 주의한다.Passage는 이 결과가 단일 오류 family에 적용된다고 명시적으로 한정한다.
  • F.8 공통 주제: 7개 task 모두에서 성공한 agent는 artifact를 다시 읽고, 경계적인 결정을 재검토하며, diff를 sweep함으로써 verification을 일급 활동으로 취급했다.이들은 작성보다 검증에 훨씬 더 많은 step을 사용했다.
  • F.8 공통 주제: Agent는 criterion-level reasoning을 포함한 scripted triage, leakage-safe join, multi-resolution imaging view, image-grounded edit, iterative auditing 등 각 task의 병목에 맞춰 방법을 구성했다.예시는 ETL, trial retrieval, prediction, medical imaging, report correction, data-quality auditing을 아우른다.
  • F.8 공통 주제: 성공한 Codex GPT-5.5 pathology trial에서 Recall 1.00을 달성했으며, true-positive tile은 29개, false positive는 2개, false negative는 0개였다.Predicted tile은 하부 lymph-node fragment에 metastasis를 국소화했으며 종양 영역 전체를 복구했다.
Loading 2606.31179v1…