Source-linked AI summary

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu

arXiv:2608.27454v1cs.AIcs.CL

TL;DR

Agent skill 개발에는 여러 iteration에 걸쳐 재사용할 수 있도록 경험을 정리하는 지속적 방식이 부족하다. WikiSkill은 지속적 wiki와 skill을 함께 진화시켜 benchmark 전반에서 기존 방법을 능가하는 동시에 model과 model family 간 transfer를 가능하게 한다.

  • 문제

    Agent skill 개발이 여전히 어려운 이유는 경험과 교훈이 체계적 재사용을 위한 별도의 진화하는 지식 표현으로 유지되지 않기 때문이다.

  • 방법

    WikiSkill은 raw execution trace, 지속적 구조화 지식, 진화하는 skill을 지속적 loop에서 분리하고, 경험을 통합하며 skill 업데이트를 제어한다.

  • 결과

    다섯 benchmark와 다섯 model에서 WikiSkill은 기존 skill-evolution 방법을 일관되게 능가했다. Qwen 내 평균 향상폭은 4B, 9B, 27B model에서 각각 12.3%, 17.5%, 23.9%다.

  • 시사점 및 한계

    지속적 지식 축적은 효과적인 skill evolution을 뒷받침하며, 진화한 skill은 model 간 transfer가 가능하고 때로는 self-evolved skill을 능가한다.

  • 시사점 및 한계

    활성 skill이 prompt에 직접 주입되므로, 이 연구는 skill retrieval이나 triggering을 평가하지 않는다.

Abstract

from arXiv · show

Agent skills package specialized knowledge and workflows into reusable resources that extend AI agent capabilities. Recent work automatically discovers such skills from agent experience, which enables agents to progressively adapt through interaction. However, the insights that guide skill development typically remain scattered across optimization histories, limiting their systematic reuse across iterations. We introduce WikiSkill, a framework that co-evolves agent skills with a persistent knowledge base (wiki). At a high level, WikiSkill separates raw execution experience, accumulated knowledge, and executable skills, while continuously consolidating experience into the wiki, which subsequent skill updates can build on. Across diverse benchmarks and models, WikiSkill consistently outperforms state-of-the-art skill-evolution methods and improves over no-skill baselines in most model-benchmark settings. We find that skill evolution complements model scaling: larger models generally benefit more from evolved skills, while smaller models with skills can outperform substantially larger models without them. We also find that evolved skills transfer effectively across models and model families, and skills evolved by other models can outperform self-evolved skills. Finally, our ablation studies confirm that persistent knowledge accumulation in the wiki is critical for effective skill evolution. These results demonstrate the benefits of systematically accumulating and refining agent experience for developing reusable and transferable skills.

1. 서론

WikiSkill은 실행 경험을 지속적으로 구조화된 지식 베이스에 축적해 skill 업데이트를 안내함으로써 재사용 가능한 agent skill을 발전시키는 문제를 해결한다. 5개 benchmark와 5개 model에서 기존 skill-evolution 방법을 능가하고, 대부분의 경우 skill이 없는 설정보다 성능을 높이며, 확장 가능하고 전이 가능한 skill 향상을 가능하게 한다.

  • Qwen 4B, 9B, 27B model에서 각각 평균 12.3%, 17.5%, 23.9% 향상이 나타나 skill 향상이 model scale과 함께 증가함을 보여준다.보고된 향상은 각각 4B, 9B, 27B model에 해당한다.
  • WikiSkill을 적용한 Qwen-3.5-9B는 skill이 없는 Qwen-3.6-27B를 능가하며, 각각 47.4% 대 39.4%를 달성한다.이는 evolved skill이 상당한 model-scale 차이를 보완할 수 있음을 보여준다.
  • Evolved skill은 model family 간에 전이되며 self-evolved skill을 능가할 수 있다. ALFWorld에서 Qwen-3.5-9B는 70.2% 대 63.4%를 기록한다.70.2% 결과에는 Qwen-3.6-27B가 진화시킨 skill이 사용된 반면, 63.4%에는 Qwen-3.5-9B 자체의 skill이 사용된다.
  • WikiSkill은 5개 benchmark와 5개 model에서 기존 skill-evolution 방법을 일관되게 능가하며, 대부분의 설정에서 skill이 없는 경우보다 성능을 높인다.평가는 수학적 추론, web search, spreadsheet 조작, 긴 문맥 문서 질의응답, interactive embodied task를 포괄하며, Qwen, Gemma, Gemini model을 사용한다.
  • WikiSkill은 agent 경험에서 얻은 지식을 지속적으로 조직하고 정제하는 persistent knowledge base와 agent skill을 함께 진화시킨다.Workspace는 불변 execution trace, 구조화된 wiki 지식, 진화하는 procedural skill을 분리하며, 각 iteration을 지원하는 inference, maintenance, proposal, gating component를 포함한다.
  • Framework의 ablation study는 효과적인 skill evolution에 Persistent knowledge accumulation이 핵심임을 확인한다.기여 요약은 persistent knowledge accumulation을 WikiSkill 성능의 중요한 요인으로 규정한다.

2. 문제 설정

문제 설정은 train, validation, test task split에 걸쳐 tool-using LLM agent의 반복적 skill evolution을 형식화한다. WikiSkill은 training rollout과 validation gating을 사용해 미지 task 성능을 높이면서 active procedural skill과 persistent knowledge base를 공동 진화시킨다.

  • 2. 문제 설정: Task는 서로 겹치지 않는 training, validation, testing split으로 분할되며, 성능은 각 split에서의 domain-specific prediction score 평균으로 정의된다.각 task는 instance x_i와 ground-truth answer y_i를 연결하며, 정답 여부는 f(ŷ_i, y_i) ∈ [0, 1]로 측정된다.
  • 2. 문제 설정: Agent는 multi-step execution trajectory와 최종 answer generation을 안내하는 tool 및 modular filesystem-based skill을 갖춘 LLM-based system이다.Skill은 procedural knowledge를 instruction, script 및 기타 resource로 패키징하며, trajectory는 사용 가능한 tool을 호출할 수 있는 observation과 action을 포함한다.
  • 2. 문제 설정: WikiSkill은 active procedural skill과 반복에 따라 누적되는 persistent knowledge base를 결합한 joint state (S_k, W_k)로 각 iteration을 나타낸다.Candidate skill update는 validation-gated 방식으로 적용할 수 있으며 score가 하락하면 rollback할 수 있는 반면, knowledge base는 유지된다.
  • 2. 문제 설정: WikiSkill은 empty skill과 knowledge에서 시작해 training rollout, pattern consolidation, validation gating을 사용하여 반복마다 두 state component를 공동 진화시키고, 미지 task에 대한 test performance를 최대화한다.Framework는 immutable execution trace, persistent wiki knowledge, active procedural instruction을 서로 다른 layer로 분리한다.

3. 방법론

WikiSkill은 rollout 분석, skill 제안, validation gating의 반복 루프와 three-layer architecture를 통해 실행 가능한 agent skill과 persistent wiki를 공동 진화시킨다. 불변 trace는 후속 skill refinement를 이끄는 historical knowledge로 통합되며, active skill은 inference agent에 주입된다.

  • 3.1 Three-layer knowledge architecture: WikiSkill은 raw execution trace, 누적되는 wiki knowledge, active evolved skill을 서로 구분되는 세 개의 workspace layer로 분리한다.raw layer는 단계별 상호작용 전체를 불변으로 보존하고, wiki layer는 pattern, historical evolution, skill impact를 기록하며, skills layer는 실행 가능한 SKILL.md 파일과 이를 뒷받침하는 PURPOSE.md 매핑을 저장한다.
  • 3.2 Evolution loop: 각 iteration은 active skill과 함께 inference agent를 실행하고, rollout trace를 wiki로 통합하며, skill update를 제안한 뒤 validation을 거쳐 필터링한다.Training rollout은 wiki에 접근할 수 없으며, Wiki Maintainer는 trace와 기존 knowledge를 분석하고 Skill Proposer는 그 결과로 생성된 resource를 사용해 변경 사항을 구성한다.
  • Wiki Maintainer: Wiki Maintainer는 성공 및 실패 trace를 샘플링하고 root-cause analysis와 strategy extraction을 수행하며, pattern page를 점진적으로 업데이트하거나 새로 생성한다.Wiki Maintainer는 샘플링된 trace와 함께 이전 wiki 전체를 입력으로 받아 patch 기반 편집을 통해 persistent evidence와 solution을 정교화한다.
  • Skill Proposer: Skill Proposer는 새 skill을 생성하거나 기존 skill 하나에 atomic patch를 적용하기 전에 선택된 wiki pattern과 raw trace를 자율적으로 조사한다.ReAct-style process는 wiki index, skill-impact history, 요약된 training outcome을 사용해 context window가 소진되는 것을 방지한다.
  • Validation gating: Candidate skill은 validation 결과가 추적 중인 best score를 개선할 때만 accepted되며, rejected modification은 폐기되고 accepted transition은 향후 proposal을 위해 기록된다.시스템은 empty-skill baseline에서 best score를 초기화하고, validation이 1.0에 도달하면 종료할 수 있으며, 각 intervention의 audit trail을 유지한다.

4. 실험 및 결과

다섯 가지 다양한 benchmark와 다섯 가지 model에서 WikiSkill은 경쟁 skill-evolution 방법과 no-skill baseline을 일관되게 능가한다. 그 이점은 model capability가 높을수록 커지고 model 간에 전이되며, task 특성과 execution ability에 좌우된다.

  • 실험 설정: 실험은 closed model과 open-weight model 전반에서 수학적 추론, web search, spreadsheet 조작, long-context 문서 QA, interactive embodied task를 다룬다.각 방법은 서로 독립적인 세 번의 evolution run에서 평가하며, 결과 skill set 전반의 점수를 평균하고 paired bootstrap으로 p<0.05에서 유의성을 검정한다.
  • WikiSkill은 model과 dataset 전반에서 일관된 향상을 보인다: WikiSkill은 다섯 model 모두에서 가장 높은 평균 성능을 달성하며, 가장 강력한 경쟁 방법보다 3.3–12.0 points, 대부분의 model-dataset pair에서는 no-skill baseline보다 향상된다.이득에는 LiveMath에서 Gemini-3.5-Flash가 33.0%에서 72.6%로, SpreadSheet에서 50.5%에서 76.6%로 향상된 결과와, ALFWorld에서 Qwen-3.6-27B가 52.8%에서 77.6%로 향상된 결과가 포함된다.
  • skill evolution의 이점은 model capability와 함께 증가하며 model scaling을 보완한다: Qwen family에서는 scale이 커질수록 WikiSkill의 평균 향상이 증가해 4B의 +12.3 points에서 27B의 +23.9 points까지 이르며, skill은 model-size 차이를 상쇄할 수 있다.WikiSkill을 적용한 Qwen-3.5-9B는 평균 accuracy 47.4%를 달성해, skill이 없는 Qwen-3.6-27B의 39.4%를 웃돈다.
  • skill evolution의 이점은 dataset에 따라서도 크게 달라진다: Skill의 이점은 dataset에 따라 달라진다. Qwen-3.6-27B는 ALFWorld에서 24.8 points를 얻지만 OfficeQA에서는 11.6에 그치며, 더 작은 model은 long-context search workflow에서 어려움을 겪을 수 있다.같은 분석에서 Qwen-3.6-27B는 SealQA에서 14.1 points를 기록하고, long-context setting에서는 Qwen-3.5-4B의 성능이 소폭 하락한다.
  • evolved skill의 전이 가능성은 general procedure 또는 model-specific workaround를 포착하는지에 따라 달라진다: 전이 가능성은 skill이 general procedure를 인코딩하는지 model-specific workaround를 인코딩하는지에 따라 달라진다. LiveMath skill은 강하게 전이되는 반면, 일부 SpreadSheet skill은 negative transfer를 유발한다.Qwen-3.5-4B와 Qwen-3.6-27B의 skill은 Gemini-3.5-Flash의 성능을 각각 33.0%에서 67.5%, 73.9%로 향상시킨다.
  • evolved skill은 model 간에 효과적으로 전이되며, 전이된 skill은 self-evolved skill을 능가할 수 있다: WikiSkill skill은 model 간에 자주 전이되며 self-evolved skill을 능가할 수도 있다. 예를 들어 Qwen-3.6-27B skill은 Qwen-3.5-9B의 SpreadSheet에서 50.5%에 도달한 반면 self-evolved 결과는 33.6%였다.해당 비교에서 no-skill baseline은 24.3%다.

5. 분석 및 논의

WikiSkill의 persistent wiki는 skill evolution을 크게 향상시키지만, rollout 중 inference agent가 wiki에 접근하면 최종 skill 품질이 낮아질 수 있다. 시스템은 기록된 proposal, rejection, evidence를 통해 지속적인 skill refinement를 뒷받침하는 model- 및 benchmark-dependent knowledge pattern을 계속 축적한다.

  • Persistent wiki knowledge가 skill evolution을 크게 향상시킨다: 15.0 퍼센트포인트: Skill Proposer에 persistent wiki access를 제공하면 평균 성능이 48.7%에서 63.7%로 상승하며, LiveMath 성능은 51.3%에서 72.6%로, SpreadsheetBench 성능은 49.9%에서 76.6%로 상승한다.이 비교는 Inference Agent의 wiki access를 비활성화한 Gemini-3.5-Flash에서 보고되었으며, persistent accumulation이 없으면 Skill Proposer가 복잡한 failure mode에 제대로 대응하지 못한다.
  • Evolution 중 Inference Agent의 wiki access가 최종 skill 품질을 저하시킨다: 2.8 퍼센트포인트: training rollout 중 Inference Agent에 wiki access를 제공하면 평균 성능이 63.7%에서 60.9%로, LiveMath 성능이 72.6%에서 64.8%로 하락한다.저자들은 rollout 중 skill과 wiki knowledge에 직접 접근하게 하면 evolved skill을 개선하지 않은 채 task-solving knowledge만 제공할 수 있다고 가정한다.
  • WikiSkill은 간결한 skill을 생성하면서 wiki pattern을 지속적으로 축적한다: Wiki pattern accumulation과 skill structure는 model과 benchmark에 따라 달라진다. Qwen 모델은 118.9–128.6줄의 skill을 생성하는 반면, Gemma-4-31B와 Gemini-3.5-Flash는 각각 45.1줄과 81.2줄의 skill을 생성한다.Benchmark 전체에서 SpreadSheet는 142.5줄로 가장 긴 skill과 9.8개의 가장 많은 wiki pattern을 생성하는 반면, LiveMath는 84.6줄로 가장 짧은 skill과 4.4개로 가장 적은 pattern을 생성한다.
  • Skill refinement는 evolution process 전반에서 계속된다: Skill refinement는 초기 단계를 넘어 계속된다. Accepted update는 모델별로 iteration 0–1에서 update의 39%–52%, benchmark별로 39%–58%를 차지한다.Accepted update는 middle iteration 2–4와 late iteration 5–7에도 속하므로, initialization 이후에도 evolution이 계속됨을 보여준다.

6. 관련 연구

선행 연구는 재사용 가능한 agent skill과 경험 기반 자기 개선을 다루며, skill-augmented agent 연구에서는 실행 중 관련 skill을 검색하는 방법도 탐구한다. 반면 WikiSkill은 경험을 구조화된 지식으로 지속적으로 통합하여 이후 skill 업데이트가 이를 체계적으로 활용하도록 하는 데 초점을 둔다.

7. 결론

WikiSkill은 반복이 진행될수록 지식 통합도가 높아지는 지속적·누적형 knowledge base와 agent skill을 함께 진화시킨다. orchestrated loop는 experience를 통합하고 refinement를 제안하며 validation performance를 기준으로 변경을 선별하는 동시에, 5개 benchmark와 5개 inference model에서 기존 skill-evolution method를 능가한다.

  • WikiSkill은 지속적·누적형 knowledge base(wiki)와 agent skill을 함께 진화시킨다.
  • 3-layer workspace는 반복이 진행될수록 근거가 강화되고 통합되는 지식을 토대로 skill development가 이루어지도록 한다.
  • orchestrated loop는 experience를 wiki에 통합하고, 축적된 지식에서 skill refinement를 제안하며, validation performance를 기준으로 변경을 선별한다.
  • WikiSkill은 5개 benchmark와 5개 inference model에서 기존 skill-evolution method를 일관되게 능가한다.

한계

WikiSkill의 평가는 active skill을 프롬프트에 직접 주입하므로 skill retrieval이나 triggering을 평가하지 않는다. 또한 엄격한 validation gate는 이후 개선을 가능하게 할 수 있는 중립적 제안을 배제한다.

  • 프롬프트에 active skill을 직접 주입하면 사용 가능한 skill이 늘어날수록 중요성이 커지는 skill retrieval과 triggering을 평가하지 못한다.이 설계는 선행 연구를 따르며 retrieval로 인한 교란 효과를 피함으로써 skill 품질을 분리해 평가하는 것을 목표로 한다.
  • 수용되는 모든 제안이 validation score를 높이도록 요구하면 즉각적인 성능은 유지하지만 이후 반복에서 향상을 뒷받침할 수 있는 중립적 제안이 배제된다.이 연구는 이 엄격한 validation 기준을 gating rule로 사용한다.

A. 방법 세부사항 · A.1. 알고리즘 · A.2. 수락된 Skill Update의 분포

WikiSkill은 training task에 rollout을 수행하고, trace를 wiki로 통합하며, 수정안을 제안하고, validation gating을 통해 update를 수락하거나 롤백하는 과정을 반복해 skill을 진화시킨다. 이 방법은 거부된 skill proposal 이후에도 wiki를 유지하며, update된 proposal이 수락되는 조건을 별도로 분석한다.

  • A.1. 알고리즘: WikiSkill의 evolution loop는 각 iteration에서 inference, wiki maintenance, proposal generation, validation gating, 최종 wiki update를 결합한다.이 loop는 training task에서 active skill을 사용하고, 샘플링된 trace를 intermediate wiki로 통합하며, candidate modification을 생성하고, proposal outcome과 skill diff를 기록한다.
  • A.1. 알고리즘: Validation gating은 제안된 skill update를 수락하거나 이전 skill state로 롤백한다.알고리즘은 update가 거부될 때 제안된 S′_k와 유지되는 S_k−1을 명시적으로 구분한다.
  • A.1. 알고리즘: 알고리즘에는 training task, validation task, performance metric, 고정된 iteration 수가 필요하다.이 입력들은 skill evolution에 사용되는 training 및 validation workflow와 performance criterion을 정의한다.
  • A.1. 알고리즘: Evolution 전에 WikiSkill은 initial skill set을 사용한 rollout으로 baseline validation performance를 설정한다.Baseline은 S0에서 샘플링된 validation-task trace로 계산되며 Rbest로 저장된다.
  • A.1. 알고리즘: 각 iteration에서 inference agent는 current skill을 사용해 training task에서 rollout을 수행하고, wiki maintenance를 위해 생성된 trace의 일부를 샘플링한다.Training rollout은 S_k−1을 사용하며, maintainer는 반드시 모든 trace가 아니라 샘플링된 subset을 처리한다.
  • A.1. 알고리즘: Proposal이 거부되면 WikiSkill은 skill을 롤백하지만 누적된 wiki는 유지한다.거부 단계에서는 wiki state를 보존한 채 S_k를 S_k−1로 설정하여 이후 evolution에 사용한다.
  • A.2. 수락된 Skill Update의 분포: 논문은 update된 skill proposal이 수락되는 조건의 분포를 Table 5에 보고한다.제공된 문단은 Table 5를 수락 동작의 출처로 제시하지만 해당 cell value는 제공하지 않는다.

B. 데이터셋 세부사항 및 분할

평가는 서로 다른 추론, 검색, 장문맥, 인터랙티브 태스크 요구를 지닌 다섯 개 benchmark를 사용하며, 선행 연구의 데이터 분할과 tool configuration을 그대로 맞춘다. Validation set이 작기 때문에 보고 점수는 세 번의 독립적인 evolutionary-pipeline 실행 결과를 평균내고 paired bootstrap significance testing을 사용한다.

  • Benchmark 범위: 다섯 개 benchmark는 복잡한 수학적 추론, 학술 웹 기반 question answering, 장문맥 금융 증거 종합, 인터랙티브 태스크 완료를 포함한 다양한 능력을 평가한다.LiveMath는 quantifier와 extremal condition을 평가하고, SealQA는 search-query formulation과 answer extraction을 평가한다. Treasury-bulletin 태스크는 여러 페이지의 증거 종합을 요구하며, ALFWorld는 인터랙티브하다.
  • 데이터셋 분할과 tool: Table 6은 training, validation, test split별 benchmark sample 수와 interaction mode 및 사용 가능한 tool을 함께 보고한다.분할과 toolset은 선행 연구(Alzubi et al., 2026; Yang et al., 2026)와 엄격하게 일치한다.
  • Interaction mode: LiveMath는 single-step이며 tool-free인 반면, SealQA는 web search를 제공한다. Treasury 태스크는 oracle reference page를 제공하면서 local text-processing tool을 유지한다.Treasury 설정은 Yang et al. (2026)을 따르며, 사전 파싱된 oracle page를 초기 증거로 사용하고 문서 검색과 검사를 위해 glob, grep, read를 사용한다.
  • 평가 robustness: 작은 validation split에서는 gating decision이 noisy해질 수 있으므로, 보고 점수는 세 번의 독립적인 실행에서 얻은 test performance를 평균내고 paired bootstrap significance testing을 적용한다.이 robustness procedure는 Alzubi et al. (2026)Yang et al. (2026)의 확립된 설정을 따른다.

C. 구현 세부사항 · D. 기준선 세부사항 및 Optimizer API 호출 분석 · D.1. 기준선 방법

구현은 층화된 실행 trace 샘플링과 명시적인 최고 성능자 판정 규칙을 적용한 bootstrap 기반 유의성 검정을 사용한다. 기준선은 서로 다른 trace 분석, candidate frontier, ReflACT 기반 skill 최적화 파이프라인으로 구성된다.

  • C. 구현 세부사항: 반복마다 최대 8개의 trace를 샘플링하며, root-cause analysis를 위한 실패 trace와 효과적인 전략 탐색을 위한 성공 trace로 층화한다.할당은 실패 trace 최대 5개와 성공 trace 최대 3개를 허용한다.
  • C. 구현 세부사항: 실행 로그는 prompt에 주입하기 전에 15,000자로 제한한다.
  • C. 구현 세부사항: Paired bootstrap 검정은 benchmark마다 1,000회 반복하며, 복원추출로 test instance를 재표집해 candidate accuracy와 쌍별 성능 차이를 계산한다.
  • C. 구현 세부사항: 어떤 방법이 모든 경쟁 방법에 대한 관측 gain 또는 macro-average gain에서 p<0.05 수준의 유의성을 보일 때에만 유일한 최고 성능자로 판정한다.그렇지 않으면 통계적으로 구분할 수 없는 최상위 방법들에 유일한 최고 성능자 지정이 부여되지 않는다.
  • D.1. 기준선 방법: Trace2Skill (Ni et al., 2026)은 성공 및 실패 training trace를 병렬로 분석한 뒤, 구조화된 patch를 계층적으로 병합해 적용된 patch set을 구성한다.
  • D.1. 기준선 방법: EvoSkill (Alzubi et al., 2026)은 round-robin training category, 실패 전용 feedback, validation scoring, proposal history를 사용해 candidate skill program의 제한된 frontier를 탐색한다.
  • D.1. 기준선 방법: SkillOpt (Yang et al., 2026)은 six-stage ReflACT pipeline을 사용해 전체 trace를 성찰하고, patch를 계층적으로 집계·선택하며, 하나의 monolithic skill에 대한 업데이트를 검증한다.

D.2. Optimizer API Call Complexity · 3. 계층적 reduce & apply 단계: The 𝑁train · E. System and Agent Prompts

WikiSkill은 full-batch evolution에서 training-set size에 대한 O(1) optimizer API-call complexity를 달성하며, iteration마다 1 + T_ReAct calls만 필요하다. 반면 기존 방법은 minibatch 또는 trajectory 수에 따라 확장된다. 또한 appendix는 task-specific inference prompts와 Wiki Maintainer 및 Skill Proposer의 상세 workflow를 제시한다.

  • D.2. Optimizer API Call Complexity: training instance 수와 무관하게 WikiSkill iteration마다 1 + T_ReAct optimizer LLM calls가 필요하며, 이에 따라 N_train에 대한 complexity는 O(1)이 된다.WikiSkill은 full-batch processing을 사용하며 B = N_train이고, 실험에서 T_ReAct는 대략 10–20이다.
  • D.2. Optimizer API Call Complexity: WikiSkill의 constant call complexity는 일부 dataset에서 inference cost를 높일 수 있지만, 기존 skill-evolution methods 대비 일관된 성능 향상을 동반한다.비교는 optimizer-complexity analysis에 기술된 evaluation settings 전반에서 수행된다.
  • D.2. Optimizer API Call Complexity: EvoSkill과 SkillOpt은 O(N_train/B)로 확장되는 반면, Trace2Skill은 각 training trajectory를 개별적으로 분석하므로 O(N_train)을 하한으로 갖는다.SkillOpt은 minibatch step마다 대략 6–8 optimizer calls를 사용하며, Trace2Skill은 여기에 hierarchical patch merging과 final formatting을 추가로 수행한다.
  • 3. 계층적 reduce & apply 단계: The N_train: WikiSkill의 full-batch setup에서는 Skill Proposer가 EvoSkill과 SkillOpt의 best-performing minibatch settings와 달리, 필요할 때 execution traces를 동적으로 search, select, read할 수 있다.full-batch configuration은 iteration마다 전체 training set을 한 번에 처리한다.
  • E. System and Agent Prompts: appendix는 task 전반의 inference agents, Wiki Maintainer, WikiSkill Skill Proposer를 위한 exact system prompts를 제공한다.task prompts는 mathematical reasoning, factual web question answering, spreadsheet manipulation, OfficeQA document work, ALFWorld interaction을 다룬다.
  • Wiki Maintainer Agent System Prompt: Wiki Maintainer에는 execution traces를 심층 분석하고, root causes와 commands를 포함해 성공 및 실패 패턴을 문서화하며, 구조화된 incremental wiki files를 유지하도록 지시한다.필수 output은 patterns, index, evolution log를 업데이트하며, index entries는 problem, root cause, fix를 간결하게 명시해야 한다.
  • Skill Proposer Agent System Prompt: Skill Proposer는 targeted traces를 검토하기 전에 wiki와 prior skill impacts를 읽은 뒤, structured proposals를 사용해 skill change를 생성하거나 patch하거나 거절해야 한다.workflow에서는 change를 제안하기 전에 최소 네 개의 execution traces를 읽어야 하며, 부분적으로 올바른 skills에는 간결하고 실행 가능한 patches를 우선한다.
Loading 2608.27454v1…