Source-linked AI summary
Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory
Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Yankai Jiang
TL;DR
의료 agent는 역동적이고 다단계인 임상 의사결정 전반에서 경험을 재사용해야 하지만, 기존 memory는 유용한 기억과 잡음이 많은 과거 trace를 구분하지 못한 채 원시 기록을 보존하는 경우가 많다. SkeMex는 상호작용을 utility-aware skill로 distill하고 repository를 지속적으로 관리해, 다양한 임상 task에서 성능을 일관되게 향상시키며 model backbone과 task setting 전반으로 일반화한다.
문제
기존 의료 agent 평가와 memory는 역동적이고 다단계인 임상 의사결정을 충분히 지원하지 못하며, 유용한 경험과 잡음이 많은 과거 trace도 구분하지 못한다.
방법
SkeMex는 상호작용 trajectory를 structured skill로 distill하고, context-dependent utility에 따라 이를 retrieve하며, Read–Write–Assess–Govern lifecycle을 통해 repository를 진화시킨다.
결과
SkeMex는 다양한 임상 task에서 성능을 일관되게 향상시키고, model backbone과 task setting 전반으로 일반화하며, transferable skill memory를 지원한다.
시사점 및 한계
SkeMex는 model weight를 업데이트하지 않고 임상 경험을 축적하고 재사용하는 post-deployment 접근법을 제공한다.
시사점 및 한계
평가에 사용된 benchmark는 실제 임상 환경의 복잡성과 다양성을 완전히 포착하지 못한다.
Abstract
from arXiv · showhide
Medical agent systems are increasingly expected to support interactive clinical decision making rather than only static question answering. In such settings, effective agents must reuse prior experience across evolving cases, yet existing memory mechanisms often retain raw historical traces that are redundant, noisy, and difficult to govern. More importantly, they rarely distinguish which memories are truly useful for future reasoning. This limits their ability to accumulate compact and reliable experience for long-horizon clinical reasoning. To close this gap, we propose SkeMex, a post-deployment self-evolution framework that improves medical agents through a skill-based memory without updating model weights. SkeMex distills informative interaction trajectories into structured skills that encode reusable procedural knowledge, and organizes them into a multi-branch repository spanning general, task-specific, and action-level experience. To determine which memories should be reused and retained, SkeMex estimates context-dependent utility from environment feedback and uses it to guide value-aware retrieval and repository governance. A closed-loop ``Read--Write--Assess--Govern" lifecycle further supports continual evolution by writing new skills, updating utilities, promoting useful memories, and removing harmful entries. Experiments across diverse clinical tasks show that SkeMex consistently outperforms representative memory-based agents in both offline and online settings. It also generalizes across model backbones and supports transferable skill memory. All data and code will be released publicly.
1 서론
SkeMex는 model weights를 업데이트하지 않고 유익한 임상 trajectory를 구조화되고 재사용 가능한 skill로 변환해 raw memory와 intra-task memory의 한계를 해결한다. value-aware Read–Write–Assess–Govern 프로세스는 지속적인 memory evolution을 지원하고 임상 task, model backbone, 이질적 setting 전반의 성능을 향상한다.
- 1 서론: Medical agent는 interaction, evidence gathering, hypothesis revision, multimodal interpretation, uncertainty하의 action adjustment를 포함하는 multi-step clinical decision making을 지원해야 한다.
- 1 서론: SkeMex는 유익한 interaction trajectory를 structured, actionable skill로 변환하고, 이를 general reasoning, task-specific knowledge, action-level experience에 걸쳐 조직한다.
- 1 서론: SkeMex는 clinical feedback으로부터 context-dependent memory utility를 non-parametric reinforcement process로 추정해 skill retrieval과 repository governance를 모두 유도한다.
- 1 서론: Read–Write–Assess–Govern lifecycle은 trajectory를 reusable skill로 변환하는 동시에 governed memory repository를 유지한다.
- 1 서론: SkeMex는 다양한 clinical task 전반에서 일관되게 성능을 향상하고, model backbone 전반으로 일반화하며, 이질적인 task setting 간 transferable skill memory를 지원한다.
2 관련 연구
관련 연구는 이질적인 임상 근거를 바탕으로 추론하는 LLM 기반 의료 에이전트와 context window의 한계를 넘어 경험을 보존·재사용하는 self-evolving memory mechanism을 다룬다.
- LLM 기반 의료 에이전트: Lingshu [80], Hulu-Med [19], MedGemma [49]와 같은 medical foundation model은 텍스트, 영상, multimodal data 전반으로 의료 추론을 확장한다.
- LLM 기반 의료 에이전트: 의료 에이전트는 이질적인 임상 근거를 처리하기 위해 retrieval, tool use, multi-agent collaboration을 결합한다.
- LLM 기반 의료 에이전트: i-MedRAG 와 MedRAG [90]는 iterative search와 knowledge-guided reasoning을 통해 의료 retrieval을 개선한다.
- Self-Evolving Memory: Agent memory는 static buffer와 retrieval-augmented generation을 통한 context 한계 대응에서, 환경 경험을 요약하고 재사용하는 structured store로 발전했다.
3 방법
SkeMex는 모델 파라미터를 업데이트하는 대신 구조화된 스킬을 검색하고 진화시키는 memory-based decision process로 post-deployment medical-agent improvement를 모델링한다. Read–Write–Assess–Govern lifecycle은 value-aware retrieval, trajectory-based skill writing, utility valuation, repository governance를 체계화한다.
- 3.1 정식화: SkeMex는 memory unit을 retrieval key, 재사용 가능한 content, utility statistics를 갖춘 구조화된 스킬로 표현하여 parameter update가 아닌 memory retrieval과 evolution을 통한 개선을 가능하게 한다 [39] [46].에이전트는 decision 전에 스킬을 검색하고, environment feedback을 받은 뒤 interaction 후 skills repository를 업데이트한다.
- 3.2 Skills Repository: Skills repository는 general, task-level, action-level branch를 사용해 transferable reasoning, clinical-task pattern, operational tool-use knowledge를 분리한다.이러한 구성은 서로 다른 abstraction level의 스킬이 retrieval과 valuation 중 경쟁하는 것을 방지한다.
- 3.3 Value-Aware Retrieval: SkeMex는 episode 시작 시 한 번 스킬을 검색하고, clinical category에 따라 라우팅한 뒤 semantic similarity, category-conditioned historical utility, temporally decayed memory strength로 후보의 순위를 정한다.Episode-level retrieval은 안정적인 context를 제공하고, context fragmentation을 줄이며, episodic return을 통한 utility estimation의 noise를 제한한다.
- 3.4 Skill Writing: Gated trajectory buffer는 informative multi-step reasoning과 failure를 보존하면서 infrastructure error, repetition, trivial success를 필터링하고, two-pass writer는 보존된 trajectory를 재사용 가능한 스킬로 distill한다.Retention score는 더 긴 reasoning과 injected-skill use에 보상을 주고, 과도하게 대표되는 clinical category에는 패널티를 부과한다.
- 3.5 Skill Assessment and Governance: Window-level valuation은 trajectory 간 relative advantage를 사용해 skill utility를 업데이트하고, closed-loop lifecycle은 연속적인 task window에 걸쳐 retrieval, writing, assessment, repository governance를 조정한다.각 window가 끝날 때 writing은 스킬을 생성하거나 업데이트하고, valuation은 adoption signal을 반영해 스킬을 업데이트하며, governance는 repository를 관리한다.
4 실험 및 결과
9개의 다양한 medical benchmark에서 SkeMex를 specialist, memory-free, reflection-based, self-improving memory baseline과 offline 및 online으로 평가한다. 전반적으로 가장 높은 성능을 달성하며, ablation 결과 gated skill encoding, adaptive utility valuation, complementary memory branch가 repository 품질에 중요함을 보인다.
- Offline Mode: SkeMex는 두 backbone 모두에서 가장 우수한 offline 성능을 달성하며, DeepSeek-V3.2 ReAct를 48.20%에서 56.08%로 (+7.88 points) 향상시키고 가장 강력한 non-SkeMex memory baseline을 3.84 points 앞선다.보지 못한 benchmark family에서 ReAct 대비 +13.78 points의 향상을 보인 반면, 가장 강력한 경쟁 memory baseline은 약 +8.24 points 향상되었으며, AgentClinic-Text에서는 +34.11-point 향상을 달성한다.
- Online Mode: Online streaming evaluation에서 SkeMex는 epoch@1부터 가장 우수한 성능을 보이며, epoch@3에서는 76.39%에서 78.56%로 향상되어 Evolver의 76.97%를 웃돈다.text 및 multimodal setting 전반에서 +0.98 및 +1.19 points의 안정적인 epoch별 향상을 유지한다.
- Buffer management 및 skill encoding: Buffer gating을 제거하면 평균 성능이 53.22%에서 47.56%로 감소하고, single-prompt encoding 및 draft review 제거 시 각각 50.97%와 48.82%로 감소한다.이 결과는 noisy하거나 관련 없는 experience가 skill extraction을 오염시키는 것을 막기 위해 trajectory selection과 encoding 품질이 핵심임을 보여준다.
- Utility-driven skill valuation: Baseline correction을 제거하면 LiveMedBench에서 최대 7.00%, MedXpertQA-MM에서 6.09%의 utility valuation 하락이 발생하며, fixed learning rate는 전반적으로 성능을 낮춘다.이 결과는 새로운 skill과 mature skill 모두에 category-aware reward normalization과 adaptive update가 필요함을 뒷받침한다.
- Multi-branch memory structure: 세 branch로 구성된 full memory design은 평균 53.22%를 기록해 가장 우수한 partial General + Action variant보다 4.57 points 높으며, two- 및 single-branch variant는 뒤처진다.따라서 General, task-level, action-level branch는 상호 보완적인 signal을 제공하며, task-specific medical knowledge는 general reasoning 및 action guidance와 함께 여전히 필요하다.
5 결론 … A.3 에이전트 루프에 Skill Memory 통합
SkeMex는 model weights를 업데이트하지 않고 skill-based memory, utility-driven valuation, closed-loop governance를 통해 배포 후 medical-agent를 개선한다. 부록에서는 runtime에 retrieved skills를 주입하고 행동 증거를 skill evolution에 피드백하는, 제한적이고 감사 가능한 ReAct 실행 backbone을 자세히 설명한다.
- 5 결론: SkeMex는 model weights를 업데이트하지 않고 재사용 가능한 skill distillation, utility-driven valuation, closed-loop memory governance를 통해 medical agents를 개선한다.이 framework는 다양한 clinical tasks에서 신뢰할 수 있는 experience 축적과 재사용을 지원하며, 실험에서 ReAct 및 대표적인 memory-based agents보다 일관된 개선을 보인다.
- 부록 내용: 부록은 핵심 agent loop의 task execution 책임을 유지하면서 SkeMex의 skill memory를 제한적인 ReAct execution backbone에 연결한다.Runtime skill-injection interface가 evolution module을 execution backbone에 연결한다.
- A.1 Runtime Components: 각 task는 model interaction, dataset-specific tools, structured reasoning, memory rendering, context control을 조정하는 구성 요소들로 이루어진 AgentLoop를 통해 실행된다.Language-model interface는 system 및 step prompts를 수신하고, tool registry는 호출 가능한 tools를 노출하며 그 사용 가능성을 렌더링한다.
- A.1 Runtime Components: 각 benchmark sample은 conversation 및 step histories를 초기화하여 task 독립성을 보장하고 sample 간 information leakage를 방지한다.Vision inputs의 경우 images는 첫 model call에서만 제공되며, 이후 steps에서는 textual conversation history를 사용한다.
- A.2 Stepwise Execution Protocol: Structured protocol은 실행을 deterministic하게 만든다. 모든 turn은 reasoning 뒤에 정확히 하나의 tool call 또는 terminating response를 포함한다.Multistep problems에서는 optional planning이 허용되지만, 필수적인 reasoning-and-action format이 model behavior를 제한하고 감사 가능하게 한다.
- A.2 Stepwise Execution Protocol: 유효한 tool outputs는 parsing 및 execution되고, observations는 conversation memory에 추가되며, response outputs는 complete trajectories를 저장하면서 tasks를 종료한다.이 processing loop는 지속적인 stepwise execution과 이후 trajectory analysis를 지원한다.
- A.3 에이전트 루프에 Skill Memory 통합: 각 sample 전에 evolution runner는 task category를 할당하고 relevant skills를 retrieval한 뒤, 렌더링된 context와 identifiers를 agent loop에 주입한다.주입된 skill context는 task 전반에 걸쳐 렌더링되지만 agent policy를 대체하지 않는다.
- A.3 에이전트 루프에 Skill Memory 통합: 기록된 reasoning traces, tool calls, observations, final answers는 주입된 skills가 채택되었는지, 무시되었는지, 또는 유해했는지를 보여 주어 후속 skill evolution을 가능하게 한다.Execution backbone은 behavioral evidence를 제공하고, evolution loop는 compact task-specific guidance를 제공한다.
A.4 태스크 내 컨텍스트 제어 · B 도구 모음 · C SkeMex 추가 세부사항
SkeMex는 실행 중 컨텍스트 제어, 모듈형 임상 도구 모음, 형식화된 skill-memory lifecycle을 결합해 안정적이고 재사용 가능한 medical-agent reasoning을 지원한다. 이 구성요소들은 중복 탐색을 줄이고, 관련 증거를 보존하며, 이질적인 도구 사용을 표준화하고, 유용한 경험을 시간에 따라 관리한다.
- A.4 태스크 내 컨텍스트 제어: Loop breaking은 동일한 도구 동작의 반복을 감지하고, 에이전트가 전략을 바꾸거나 다른 도구를 사용하거나 충분한 증거가 있으면 답변하도록 유도한다.이는 연속 반복 횟수가 설정된 수에 도달한 뒤에만 활성화되므로 개입이 보수적이다.
- A.4 태스크 내 컨텍스트 제어: Confirmed-finding pinning은 태스크마다 한 번 검증된 초기 관찰을 요약해 이후 history에 덧붙이며, token 사용량이 설정된 budget fraction을 초과하면 trimming이 오래된 내용을 압축한다.최근 단계는 더 풍부하게 유지되며, notice는 에이전트가 pinned finding과 최근 컨텍스트를 우선하도록 유도한다.
- A.4 태스크 내 컨텍스트 제어: SkeMex의 context guard는 loop breaking, confirmed-finding pinning, budget-aware history trimming을 결합해 외부 태스크 인터페이스를 변경하지 않고 긴 medical-agent trajectory를 안정화한다.각 메커니즘은 각각 중복 탐색을 줄이고, 중요한 초기 증거를 보존하며, 실행 중 컨텍스트 주입을 통해 prompt 길이를 제어한다.
- B 도구 모음: 모듈형 도구 모음은 외부 증거 검색, 구조화된 의학 지식, 정량 계산, 멀티모달 인식, 추론 제어, benchmark별 상호작용의 six categories로 구성된다.모든 도구는 구조화된 payload를 받고, 간결한 observation을 반환하며, 공유 execution protocol을 통해 parameter schema를 노출한다.
- B 도구 모음: 임상 도구 범위에는 web 및 의학 검색, 약물 정보와 상호작용 확인, 생의학 개념, 계산기, 단위 변환, 임상 점수, 이미지 분석, OCR, reflection, verification이 포함된다.이 도구들은 증거 수집, 약물 안전성, 수치 정확성, 멀티모달 해석, 추론 제어, 최종 답변 감사를 지원한다.
- B 도구 모음: Benchmark별 AgentClinic 도구는 환자 병력, 객관적 검사, 이미지 접근을 별도로 제공하면서 hidden information leakage를 방지하고 데이터 검색과 해석을 분리한다.환자 응답에는 hidden diagnosis와 객관적 결과가 포함되지 않으며, 검사 요청에는 존재하지 않는 소견을 만들어내지 않고 이용 불가능한 결과를 보고하고, 이미지 요청에는 해석 없이 asset을 반환한다.
- C SkeMex 추가 세부사항: SkeMex는 skill을 memory unit으로 표현하고 nontrivial success, 유용한 failure, retrieved skill이 성능을 개선했는지 또는 저해했는지에 대한 증거를 포함한 informative trajectory만 기록한다.운영적 정식화는 external skill memory, trajectory window, Read–Write–Assess–Govern lifecycle을 갖춘 M-MDP를 사용한다.
D 데이터셋 세부사항 · E 베이스라인 및 평가 지표
SkeMex는 대화형 의사결정, 환자 중심 추론, 의학 질의응답, 멀티모달 이해를 아우르는 9개의 이질적 의료 벤치마크에서 평가된다. 통합 전처리 파이프라인을 통해 12개 데이터셋 구성에 걸쳐 3,278개 샘플을 확보하며, 메타데이터가 허용하는 경우 어렵거나 추론 집약적인 사례를 우선한다.
- D 데이터셋 세부사항: 9개 벤치마크는 이질적인 형식과 평가 프로토콜에 걸쳐 대화형 임상 의사결정, 환자 중심 추론, 지식 집약적 질의응답, 멀티모달 의료 이해를 다룬다.평가는 다양한 임상 환경에서 텍스트 전용 및 멀티모달 추론을 모두 검증한다.
- D 데이터셋 세부사항: AgentClinic [48]은 환자 질문, 검사, 멀티모달 증거를 통해 순차적 정보 수집과 이미지 지원 임상 추론을 평가한다.텍스트 전용 및 멀티모달 설정을 모두 사용한다.
- D 데이터셋 세부사항: LiveClin [67]은 지속적으로 업데이트되는 동료 심사 사례 보고서를 사용해 최신의 임상 근거 기반 사례와 복잡한 텍스트 전용 및 멀티모달 사례에서의 추론을 검증한다.이 설계는 데이터 누출과 지식 노후화를 줄이는 동시에 현실적인 임상 경로를 반영하는 것을 목표로 한다.
- D 데이터셋 세부사항: 벤치마크 모음은 환자 중심 워크플로, 루브릭 기반 임상 완결성, 의사가 작성한 건강 관련 응답, 불확실성 하의 정보 탐색, 전문가 수준의 전문과 추론도 평가한다.이러한 차원은 각각 MedJourney, LiveMedBench, HealthBench [3], MediQ [30], MedXpertQA [96]로 대표된다.
- D 데이터셋 세부사항: 통합 전처리 파이프라인은 공식 난이도 라벨, 메타데이터 또는 부분집합 주석을 이용할 수 있는 경우 어렵거나 추론 집약적인 샘플을 우선한다.이 파이프라인은 스킬 축적의 유용성을 높이고, 평가 신뢰도를 개선하며, 불필요한 실험 비용을 줄이기 위한 것이다.
- D 데이터셋 세부사항: 전처리 후 평가 풀은 9개 벤치마크에서 도출된 12개 데이터셋 구성에 걸쳐 3,278개 샘플로 구성된다.AgentClinic, LiveClin, MedXpertQA는 텍스트 전용 및 멀티모달 구성으로 분할하고, MMMU와 MMMU-Pro는 Health & Medicine 부분집합으로 제한한다.
E.1 Baselines · E.2 Metrics
평가는 specialist model과 memory-based agent를 대상으로 no-memory, reflective, experience-distillation, skill, persistent, clinical-memory 패러다임을 아우르며 SkeMex를 비교한다. Metric은 dataset별로 정해지며, deterministic accuracy, semantic-equivalence 또는 rubric-based scoring이 utility update를 위한 reward도 제공한다.
- E.1 Baselines: Vanilla ReAct는 skill memory, retrieval, utility estimation, governance를 제거한 채 SkeMex와 동일한 prompt와 tool을 사용하여, evolving skill memory의 기여를 분리해 평가한다.Lingshu [80], Hulu-Med [19], MedGemma [49]는 medical 및 multimodal reasoning을 위한 specialist reference를 제공한다.
- E.1 Baselines: Baseline은 specialist model과 memory agent를 아우르며, no-memory, reflective, experience-distillation, skill/workflow, persistent, graph-structured clinical-memory method를 포함한다.이 taxonomy에는 Vanilla ReAct, Reflexion, CRITIC, Voyager, DILU, ExPeL, GenerativeMemory, Memp, SkillWeaver, AgentWorkflowMemory, AgentKB, Evolver, DynamicCheatsheet, MobileE, CerebraFusionMemory가 포함된다.
- E.2 Metrics: Metric은 각 benchmark의 answer format을 따른다. standard close-ended task는 주로 successfully evaluated sample에 대한 accuracy를 사용한다.Correctness는 sample별 binary indicator로 나타내며, missing input이나 invalid record 같은 failure는 evaluated sample set에서 제외한다.
- E.2 Metrics: Multiple-choice prediction과 reference는 option letter로 normalize하며, parse할 수 없는 response는 denominator에서 제거하지 않고 incorrect로 처리한다.Single-answer question은 A, (A), [A], A., A :와 같은 format을 normalize한 뒤 option을 exact matching한다.
- E.2 Metrics: Open-ended AgentClinic Text와 MedJourney example은 semantic-equivalence judge를 사용하여 reference-prediction 비교를 binary accuracy verdict로 변환한다.Judge는 prediction이 correct한지 또는 reference answer와 semantically equivalent한지를 판정한다.
- E.2 Metrics: HealthBench와 LiveMedBench는 free-form clinical response에 weighted rubric-based scoring을 적용하며, unsafe advice, unsupported claim, clinically inappropriate content에 대한 penalty도 포함한다.Gemini-3-Flash 는 각 sample의 모든 rubric criterion을 한 번의 call로 평가한다. HealthBench는 mean sample score를, LiveMedBench는 mean case score를 보고한다.
- E.2 Metrics: 동일한 scoring function은 outcome을 memory evolution을 위한 reward로 변환하여, 보고된 benchmark metric과 Assess-stage utility update를 정렬한다.Accuracy dataset은 binary reward를 제공하는 반면, rubric-based dataset은 [0, 1] 범위의 continuous reward를 제공한다.
F 구현 세부사항
SkeMex는 동일 도메인의 held-out 및 전혀 보지 못한 out-of-domain 테스트 데이터를 사용해 평가하며, 공통 primary backbone과 고정된 ReAct-style 실행 및 retrieval 설정을 사용한다. Skill memory는 windowed experience filtering, utility valuation, periodic repository governance를 통해 업데이트된다.
- F 구현 세부사항: In-domain 샘플은 experience accumulation과 held-out testing에 거의 동일한 비율로 분할하고, out-of-domain benchmarks는 처리된 모든 샘플을 testing에 할당한다.이 프로토콜은 관련 held-out 사례에서의 성능과 repository construction에서 제외된 benchmark families로의 transfer를 모두 평가한다.
- F 구현 세부사항: DeepSeek-V3.2 [32]는 reasoning, skill distillation, classification, utility judgment, repository governance를 위한 primary backbone으로 사용하며, Qwen3.6-Plus 는 변경하지 않은 repository를 사용해 transfer를 테스트한다.이 cross-model 설정은 DeepSeek-V3.2가 축적한 skills를 재-distillation이나 repository rewriting 없이 재사용할 수 있는지 평가한다.
- F 구현 세부사항: 각 episode는 bounded ReAct-style trajectory를 따르며, agent는 tools와 retrieved skills를 받은 뒤 reasoning, structured tool calls, final answering을 번갈아 수행한다.Tool outputs는 이후 단계의 observations가 되며 trajectory-to-skill distillation에도 사용된다.
- F 구현 세부사항: Retrieval은 episode당 한 번 수행되며 기본 budget은 K = 6이다. 이 과정에서는 category-aware routing, semantic similarity, utility, memory strength, maturity bonuses, branch-aware selection을 결합한다.시스템은 minimum similarity threshold 0.2를 사용하고 general, task-level, action-level branches 전반에서 retrieval한다. Pre-screening은 5 candidates 초과 시 활성화되며 branch당 최대 5개를 고려한다.
- F 구현 세부사항: Experience learning은 30-trajectory windows와 20-trajectory retained capacity를 사용하고, reuse가 낮은 traces를 필터링하며, normalized rewards와 adoption-aware credit으로 skills를 평가하고, 매 2 windows마다 repository를 governance한다.Governance는 유사한 skills를 병합하고, utility가 낮은 entries를 deprecate하며, 안정적인 high-utility skills를 promote하고, branch capacities를 강제한다. Mature status에는 utility가 최소 0.75이고 usage count가 최소 15여야 한다.
G 민감도 분석
SkeMex는 HealthBench와 LiveMedBench에서 광범위한 hyperparameter 범위에 걸쳐 안정적으로 작동하며, retrieval 규모가 지나치게 작거나 memory 중심 가중치를 사용하거나 utility를 지나치게 공격적으로 업데이트할 때만 성능이 완만하게 저하된다. 기본 configuration은 retrieval, learning window, baseline, utility update 선택지 전반에서 균형 잡힌 operating point를 제공한다.
- Retrieval budget: K = 9에서 42.93 average score는 K = 6의 42.80을 상회하지만, retrieval을 K = 12로 늘리면 성능이 42.70으로 하락한다.K = 3의 42.52에서 성능이 상승하므로, skill이 너무 적으면 guidance가 불충분하고 너무 많으면 중복되거나 관련성이 낮은 정보가 추가된다.
- Retrieval weights: semantic-similarity weighting을 높였을 때의 42.85 average score는 기본값 42.80을 소폭 상회하는 반면, memory 중심 가중치를 사용하면 42.57로 낮아진다.utility weighting을 높이면 42.79를 기록하며, 테스트한 설정 중 HealthBench에서 가장 높은 score를 보인다. 이는 retrieval에서 memory strength만 사용하는 것보다 semantic relevance와 estimated utility가 더 신뢰할 만함을 나타낸다.
- Learning window size: learning-window 크기 L = 10, 20, 30, 40, 60에서의 average scores는 각각 42.78, 42.82, 42.80, 42.78, 42.64로, 단조 추세가 나타나지 않는다.최적 window는 training data의 양과 분포에 따라 달라지며, 더 작은 window는 최근 feedback에 더 빠르게 반응한다.
- Category baseline update coefficient: α = 0.10에서 42.86 average score는 기본값 42.80을 상회하며, 더 큰 baseline-update coefficient를 사용하면 score가 소폭 낮아진다.성능 저하는 제한적이지만, 지나치게 민감한 category baseline은 단기 변동을 지나치게 밀접하게 추적할 수 있다.
- Utility update step: ηmax = 0.30에서 42.83 average score는 기본값 42.80에 가깝지만, maximum update step을 0.40으로 늘리면 성능이 42.54로 하락한다.지나치게 큰 utility update는 단기 feedback noise를 증폭하고 skill valuation을 불안정하게 만들 수 있다.
- Overall sensitivity: SkeMex는 광범위한 hyperparameter 선택 범위에서 안정적으로 작동하며, retrieval이 지나치게 작거나 memory strength가 과도하게 강조되거나 utility update가 지나치게 공격적이어도 변동 폭이 작다.기본 configuration은 retrieval coverage, retrieval precision, adaptation speed 사이의 균형을 맞춘다.
H 절제 연구 · I 추가 분석 · I.1 오프라인 OOD 일반화
SkeMex의 value-aware retrieval과 closed-loop repository governance는 각각 성능을 실질적으로 향상시키며, 고정된 skill repository는 model backbone 전반에서 보지 못한 benchmark family로 효과적으로 전이된다. 오프라인 OOD 결과는 memory-free 및 경쟁 memory-based baseline 모두에 대해 일관된 향상을 보인다.
- H 절제 연구: 전체 value-aware retrieval 모델은 평균 53.22% 점수를 달성해, memory-strength 제거의 50.76%와 LLM-only ranking의 50.93%를 능가한다.이 결과는 효과적인 skill 선택에 피상적인 semantic matching 이상의 요소가 필요함을 보여준다.
- H 절제 연구: Similarity만 사용하면 평균이 47.64%로 낮아지고, utility만 사용하면 48.30%에 도달한다. 이는 relevance와 historical usefulness가 skill value의 상호보완적 측면을 포착함을 보여준다.Similarity는 contextually mismatched skill을 검색할 수 있는 반면, utility만 사용하면 지나치게 일반적인 procedure를 선호할 수 있다.
- H 절제 연구: Prescreening은 retrieval quality를 향상시킨다. 이를 제거하면 관련 없거나 약하게 매칭된 candidate가 최종 ranking에 도달할 수 있어 평균 점수가 50.69%로 낮아진다.Skill repository가 성장하고 noisy candidate가 누적될수록 early filtering의 중요성이 커진다.
- H 절제 연구: 전체 closed-loop lifecycle은 평균 53.22% 점수를 달성하는 반면, maturation을 제거하면 47.60%로 가장 크게 하락한다. 이는 skill 생성 이후 repository governance의 중요성을 보여준다.Maturation을 제거하면 5.62-point decline이 발생한다.
- H 절제 연구: Deprecation을 제거하면 평균이 49.27%로 낮아지고, memory merging을 비활성화하면 49.67%로 낮아진다. 이는 harmful skill을 잊고 redundancy를 줄이는 것이 reliable retrieval을 뒷받침함을 보여준다.Obsolete 또는 low-utility entry는 noise를 유입할 수 있고, redundant skill은 repository storage 및 retrieval burden을 증가시킨다.
- H 절제 연구: Capacity limit을 제거하면 평균 점수가 51.05%로 낮아진다. 이는 다른 lifecycle operation이 계속 활성화되어 있어도 unconstrained repository growth가 retrieval quality를 약화시킴을 나타낸다.Branch-wise capacity regulation은 skill이 누적될 때 low-value candidate를 제한한다.
- I.1 오프라인 OOD 일반화: SkeMex는 두 backbone 모두에서 최고의 오프라인 OOD 평균 성능을 달성하며, DeepSeek-V3.2에서는 ReAct를 13.78 points 향상시켜 75.79%에 도달하고 Qwen3.6-Plus에서는 13.91 points 향상시켜 78.18%에 도달한다.이러한 향상은 가장 강력한 경쟁 memory baseline을 각각 5.44 및 2.97 points 초과하며, model family 간 transfer를 보여준다.
- I.1 오프라인 OOD 일반화: SkeMex는 DeepSeek-V3.2에서 5개 OOD benchmark 중 4개, Qwen3.6-Plus에서 5개 모두에서 best score를 달성하며, MediQ, AgentClinic-Text, MMMU-Pro, AgentClinic-MM을 포함한다.DeepSeek-V3.2에서 ReAct 대비 보고된 최대 향상은 AgentClinic-Text에서 +34.11 points, MMMU-Pro에서 +12.50 points다.
I.2 Backbone 간 일반화 · I.3 Backbone 간 Skill Transfer · I.4 실행 비용과 상호작용 깊이
SkeMex는 backbone model 전반에 일반화되고 architecture 간 고정 skill repository를 transfer하여 강력한 benchmark 향상을 달성한다. 이러한 확장된 능력은 평균적으로 더 큰 상호작용 깊이와 runtime을 수반하지만, 관련 skill이 실행을 간소화하는 경우도 있다.
- I.2 Backbone 간 일반화: SkeMex는 Qwen3.6-Max-Preview, Kimi-2.6, GLM-5.1 전반에서 가장 강력하며, 앞의 두 backbone에서 6개 benchmark 모두 최고 성능을 기록한다.GLM-5.1에서는 다섯 벤치마크에서 최고 성능을 보이고 AgentClinic-MM에서는 공동 최고이며, 여섯 데이터셋 모두에서 비음수 이득을 낸다.
- I.2 Backbone 간 일반화: 18개의 backbone–dataset 쌍에서 SkeMex는 17개에서 최고 성능을 기록하고 한 차례 공동 최고를 기록하며, ReAct 대비 pooled average performance를 48.88%에서 59.13%로 높인다.pooled improvement는 10.25 points이며, 보고된 데이터셋 전반에서 평균 이득이 양수다.
- I.3 Backbone 간 Skill Transfer: DeepSeek-V3.2로 학습한 고정 skill repository를 Claude Sonnet-4.6으로 transfer하면, SkeMex는 7개 benchmark 모두에서 앞서고 ReAct average를 49.59%에서 60.27%로 향상한다.평균 향상은 10.68 points이며, SkeMex는 가장 강력한 경쟁 memory baseline인 CFM을 평균 3.31 points 앞선다.
- I.3 Backbone 간 Skill Transfer: Qwen3.6-35B-A3B에서는 transfer된 repository가 ReAct average를 47.71%에서 58.23%로 높이고, 평균적으로 CFM을 2.93 points 앞선다.SkeMex는 MedXpertQA-Text, HealthBench, LiveMedBench, LiveClin-MM, MMMU에서 최고 성능을 기록하는 반면, 두 데이터셋에서는 지정된 baseline보다 낮은 성능을 보인다.
- I.3 Backbone 간 Skill Transfer: transfer 결과는 SkeMex가 cached answer나 backbone-specific response trace가 아니라 재사용 가능한 임상 절차를 저장함을 보여준다.repository는 DeepSeek-V3.2가 생성하지만, closed-source frontier model과 open-source mixture-of-experts model 모두에 여전히 유용하다.
- I.4 실행 비용과 상호작용 깊이: SkeMex는 평균 4.77 interaction steps를 사용하며, 이는 ReAct의 3.17과 다른 memory-based method의 3.97–4.61 steps보다 많다.retrieved skill은 task decomposition, intermediate verification, 필요한 경우의 tool use, 성급한 final answer 회피를 유도한다.
- I.4 실행 비용과 상호작용 깊이: SkeMex의 task당 평균 소요 시간은 116.06 seconds로, ReAct의 54.48 및 Evolver의 81.65보다 길지만, 관련 skill을 사용하면 HealthBench 시간은 52.36 seconds로 줄어든다.step당 평균 시간은 SkeMex가 24.33 seconds, ReAct가 17.19, Evolver가 20.41이며, retrieval과 더 깊은 reasoning이 overhead에 기여한다.
I.5 학습 데이터 순서의 영향
학습 데이터 순서는 HealthBench와 LiveMedBench에서 SkeMex의 도메인 내 skill-evolution 성능에 영향을 준다. Random ordering이 전반적으로 가장 우수하고 Hard-to-Easy ordering이 가장 낮은 성능을 보여, 초기 repository 업데이트가 trajectory의 혼합과 품질에 민감함을 시사한다.
- I.5 학습 데이터 순서의 영향: 각 benchmark의 training split에서 SkeMex의 repository를 진화시킨 뒤, 해당 held-out in-domain test split에서 평가한다.HealthBench와 LiveMedBench는 task difficulty의 proxy로 rubric 기반 sample-level score를 사용한다.
- I.5 학습 데이터 순서의 영향: 45.03% 평균 점수: random ordering이 HealthBench와 LiveMedBench 전반에서 가장 우수한 성능을 달성한다.이 결과는 category와 difficulty level이 혼합된 stream이 learning window 전반에서 trajectory를 균형 있게 배분하기 때문으로 해석된다.
- I.5 학습 데이터 순서의 영향: 41.41% 평균 점수: Hard-to-Easy ordering이 평가된 training-order strategy 중 가장 낮은 성능을 보인다.어려운 case를 먼저 처리하면 초기 skill writing이 noisy trajectory, 불완전한 reasoning, 또는 이후 retrieval과 governance 과정에서도 지속되는 지나치게 specific한 error pattern에 노출될 수 있다.
J 한계
SkeMex의 평가는 복잡한 실제 임상 환경을 완전히 포착하지 못하며, skill 기반 reasoning은 더 많은 API 사용량과 더 긴 실행 시간을 초래한다. 또한 고위험 환경에서 오류를 강화하거나 오용될 수 있으므로 framework에는 human oversight가 필요하다.
- 평가된 benchmark는 다양한 환자 병력, 기관별 workflow, 의사결정 제약이 존재하는 실제 임상 환경을 완전히 대표하지 못한다.
- Skill 기반 reasoning은 memory-free agent에 비해 API 사용량과 wall-clock time을 증가시키며, 이는 구조화되고 신뢰할 수 있는 reasoning을 위해 효율성을 절충한 결과다.
- 충분한 human oversight가 없으면 framework가 잘못된 패턴을 강화하거나 고위험 환경에서 오용될 수 있으므로, 전문적인 의학적 판단을 대체하기보다 지원해야 한다.
K 사례 연구 … ANALYSIS_PROMPT_RUBRIC
사례 연구는 검색된 skill이 임상 추론, 도구 선택, 진단 검증, 시술 선택을 어떻게 이끄는지 보여주는 동시에 interaction budget 낭비로 인한 실패를 드러낸다. prompt appendix는 agent interaction, retrieval, evaluation, attribution, mutation, review, skill-merging 절차를 명시한다.
- K 사례 연구: 다섯 사례에서 검색된 skill은 네 시나리오의 성공적인 추론을 지원하지만, 한 실패 사례는 조기 수렴으로 진단 특이성이 부족해지는 문제를 드러낸다.그림은 repository experience가 주입되어 skill이 agent trajectory를 형성하는 과정을 보여준다.
- K 사례 연구: skill은 정보성이 낮은 검색을 피하고, 적절한 도구를 선택하며, 진단 경계를 검증하고, retrieval을 중단하기 전에 시술을 비교하는 방식으로 추론을 조정한다.예시로는 structured differential diagnosis, administrative-tool routing, Brunt 기반 간경변 검증, multimodal biopsy-procedure 선택이 있다.
- K 사례 연구: 실패 사례에서는 초기에 발생한 두 번의 tool-format 오류가 interaction budget을 소모해, 특정 lymphoma subtype을 확인할 단계가 부족해진다.초기에는 vignette-first differential workflow가 올바랐음에도 ground truth는 Diffuse Large B-Cell Lymphoma다.
- L Prompt: 핵심 prompt는 planning, reasoning, tool, response 형식을 강제하고, conversation history와 검색된 skill을 주입하며, step limit에서 최종 답변을 강제한다.검색된 skill은 general, task-level, action-level branch로 그룹화된다.
- L Prompt: Memory-evolution prompt는 의학 질의를 action-oriented category로 분류하고, 상위 순위 후보가 scoring pipeline에 들어가기 전에 의미적으로 관련된 skill을 사전 선별한다.classifier는 methodology-level retrieval을 지원하며, 사전 선별은 agent에 주입되는 skill을 직접 결정한다.
- ANALYSIS_PROMPT_BINARY: Binary-outcome trajectory analysis는 skill adoption을 평가하고, 이후 memory evolution을 위한 결정적인 성공 또는 실패 패턴을 추출한다.prompt는 trajectory attribution을 medical knowledge-engineering task로 규정한다.
- ANALYSIS_PROMPT_RUBRIC: Rubric 기반 analysis는 agent action에 score deduction의 원인을 귀속한 뒤, mutation이 skill을 초안 작성하거나 patch하고, review가 novelty와 anti-fragmentation을 점검하며, merging이 중복을 통합한다.이 prompt들은 trajectory attribution에서 skill creation, governance, 간결한 consolidation으로 이어지는 pipeline을 구성한다.
- L Prompt: Automatic-evaluation prompt는 query, prediction, evaluation criteria를 사용해 HealthBench에 rubric 기반 grading을 제공하고, LiveMedBench에는 interactive clinical assessment를 제공한다.별도의 system prompt가 각 benchmark에 맞게 grading을 조정한다.