Source-linked AI summary
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu
TL;DR
Agent skill 的开发缺乏一种持久化机制,用于组织经验并在不同迭代间复用。WikiSkill 让 skill 与持久化 wiki 协同演化,在各项 benchmark 上超越现有方法,同时支持跨模型和模型家族迁移。
问题
Agent skill 的开发仍然困难,因为经验与教训没有被维护为一种独立且持续演化的知识表示,以便系统复用。
方法
WikiSkill 将原始执行轨迹、持久化结构化知识和持续演化的 skill 分离,并通过持续循环整合经验、控制 skill 更新。
结果
在五个 benchmark 和五个模型上,WikiSkill 持续超越现有 skill 演化方法;在 Qwen 系列中,4B、9B 和 27B 模型的平均增益分别为 12.3%、17.5% 和 23.9%。
要点与局限
持久化知识积累支持有效的 skill 演化,而演化后的 skill 可以跨模型迁移,有时还能超越自行演化的 skill。
要点与局限
由于 active skill 会被直接注入 prompt,研究未评估 skill 检索或触发。
Abstract
from arXiv · showhide
Agent skills package specialized knowledge and workflows into reusable resources that extend AI agent capabilities. Recent work automatically discovers such skills from agent experience, which enables agents to progressively adapt through interaction. However, the insights that guide skill development typically remain scattered across optimization histories, limiting their systematic reuse across iterations. We introduce WikiSkill, a framework that co-evolves agent skills with a persistent knowledge base (wiki). At a high level, WikiSkill separates raw execution experience, accumulated knowledge, and executable skills, while continuously consolidating experience into the wiki, which subsequent skill updates can build on. Across diverse benchmarks and models, WikiSkill consistently outperforms state-of-the-art skill-evolution methods and improves over no-skill baselines in most model-benchmark settings. We find that skill evolution complements model scaling: larger models generally benefit more from evolved skills, while smaller models with skills can outperform substantially larger models without them. We also find that evolved skills transfer effectively across models and model families, and skills evolved by other models can outperform self-evolved skills. Finally, our ablation studies confirm that persistent knowledge accumulation in the wiki is critical for effective skill evolution. These results demonstrate the benefits of systematically accumulating and refining agent experience for developing reusable and transferable skills.
1. 引言
WikiSkill 通过将执行经验持续整理到结构化知识库中,并以此指导技能更新,解决可复用 agent 技能演化的难题。在五个 benchmark 和五个模型上,它均优于现有技能演化方法,在多数设置下超过无技能配置,并实现可扩展、可迁移的技能增益。
- Qwen 4B、9B 和 27B 模型分别取得 12.3%、17.5% 和 23.9% 的平均提升,表明技能增益会随模型规模扩大而增加。所报告的增益分别对应 4B、9B 和 27B 模型。
- 配备 WikiSkill 的 Qwen-3.5-9B 优于未配备技能的 Qwen-3.6-27B,二者分别达到 47.4% 和 39.4%。这表明演化后的技能能够弥补显著的模型规模差异。
- 演化后的技能可以跨模型系列迁移,并且能够优于自行演化的技能;在 ALFWorld 上,Qwen-3.5-9B 分别达到 70.2% 和 63.4%。70.2% 的结果使用由 Qwen-3.6-27B 演化的技能,而 63.4% 使用 Qwen-3.5-9B 自身的技能。
- WikiSkill 在五个 benchmark 和五个模型上始终优于现有技能演化方法,并在多数设置下超过无技能配置。评测涵盖数学推理、网页搜索、电子表格操作、长上下文文档问答和交互式具身任务,使用 Qwen、Gemma 和 Gemini 模型。
- WikiSkill 让 agent 技能与持久化知识库共同演化,持续整理并提炼来自 agent 经验的知识。其工作空间将不可变执行轨迹、结构化 wiki 知识和不断演化的程序性技能分离开来,并由推理、维护、提议和门控组件支持每次迭代。
- 框架的消融实验表明,持久化知识积累对于有效的技能演化至关重要。贡献总结将持久化知识积累确定为 WikiSkill 性能的重要因素。
2. 问题设定
问题设定形式化了工具调用型 LLM agent 在训练、验证和测试任务划分上的迭代式 skill evolution。WikiSkill 联合演化 active procedural skills 与 persistent knowledge base,利用训练 rollout 和 validation gating 提升未见任务上的性能。
- 2. 问题设定: 任务被划分为互不相交的训练、验证和测试集,并将性能定义为各划分上领域特定预测得分的平均值。每个任务将实例 x_i 与 ground-truth answer y_i 配对,并通过 f(ŷ_i, y_i) ∈ [0, 1] 衡量正确性。
- 2. 问题设定: agent 是一种基于 LLM、配备工具和模块化 filesystem-based skills 的系统,这些 skills 引导多步执行轨迹和最终答案生成。skills 将程序性知识封装为指令、脚本及其他资源,而轨迹包含可能调用可用工具的观测与动作。
- 2. 问题设定: WikiSkill 通过联合状态 (S_k, W_k) 表示每次迭代,将 active procedural skills 与跨迭代累积的 persistent knowledge base 结合起来。候选 skill 更新可以经过 validation gating,并在得分下降后回滚,而 knowledge base 会持续保留。
- 2. 问题设定: WikiSkill 从空 skills 和 knowledge 出发,在每次迭代中利用训练 rollout、模式整合和 validation gating,共同演化两个状态组件,以最大化未见任务上的测试性能。该框架将不可变的执行轨迹、持久化的 wiki knowledge 和 active procedural instructions 分为不同层。
3. 方法
WikiSkill 通过由 rollout 分析、技能提案和验证门控组成的迭代循环,以及三层架构,使可执行 agent 技能与持久化 wiki 协同演化。不可变轨迹被整合为历史知识,用于指导后续技能改进,同时将活跃技能注入推理 agent。
- 3.1 三层知识架构: WikiSkill 将原始执行轨迹、持续累积的 wiki 知识和活跃的演化技能划分到三个不同的工作区层中。原始层以不可变方式保存完整的逐步交互;wiki 层记录模式、历史演化和技能影响;技能层存储可执行的 SKILL.md 文件及其对应的动机 PURPOSE.md 映射。
- 3.2 演化循环: 每次迭代都使用活跃技能运行推理 agent,将 rollout 轨迹整合到 wiki 中,提出技能更新,并通过验证进行筛选。训练 rollout 无法访问 wiki;Wiki Maintainer 分析轨迹和现有知识,而 Skill Proposer 利用所得资源制定变更。
- Wiki Maintainer: Wiki Maintainer 对成功和失败的轨迹进行采样,开展根因分析和策略提取,并逐步更新或创建模式页面。它接收完整的历史 wiki 以及采样轨迹,并通过基于补丁的编辑来完善持久化证据和解决方案。
- Skill Proposer: Skill Proposer 会自主检查选定的 wiki 模式和原始轨迹,然后创建新技能,或对一个现有技能应用原子补丁。其 ReAct 风格的流程利用 wiki 索引、技能影响历史和汇总后的训练结果,避免耗尽上下文窗口。
- 验证门控: 只有当验证使当前跟踪的最佳分数得到提升时,候选技能才会被接受;被拒绝的修改会被丢弃,而被接受的变更则会被记录,供未来提案使用。系统以空技能基线初始化最佳分数;当验证达到 1.0 时可以终止,并维护每次干预的审计轨迹。
4. 实验与结果
在五个多样化基准和五个模型上,WikiSkill始终优于其他技能演化方法和无技能基线。其收益随模型能力提升而增长,可跨模型迁移,并且取决于任务特征和执行能力。
- 实验设置: 实验覆盖数学推理、网页搜索、电子表格操作、长上下文文档QA和交互式具身任务,涉及闭源模型和开放权重模型。每种方法均进行三次独立演化运行,并对所得技能集的得分取平均;显著性通过配对bootstrap检验,阈值为p<0.05。
- WikiSkill在不同模型和数据集上带来稳定改进: WikiSkill在五个模型上均取得最高平均性能,较最强竞争方法提升3.3–12.0 points,并在大多数模型-数据集组合上优于无技能基线。具体收益包括:Gemini-3.5-Flash在LiveMath上从33.0%提升至72.6%,在SpreadSheet上从50.5%提升至76.6%;Qwen-3.6-27B在ALFWorld上从52.8%提升至77.6%。
- skill evolution 的收益随模型能力提升而增加,并与模型扩展相辅相成: 在 Qwen 系列中,WikiSkill 的平均提升幅度随模型规模增大而上升:从 4B 的 +12.3 分增至 27B 的 +23.9 分,同时 skills 能够弥补模型规模差异。使用 WikiSkill 的 Qwen-3.5-9B 平均准确率达到 47.4%,而未使用 skills 的 Qwen-3.6-27B 为 39.4%。
- 技能演化的收益在不同数据集之间也存在显著差异: 技能收益因数据集而异:Qwen-3.6-27B在ALFWorld上提升24.8 points,但在OfficeQA上仅提升11.6 points;较小模型在长上下文搜索工作流中则可能表现不佳。同一分析显示,Qwen-3.6-27B在SealQA上提升14.1 points,而Qwen-3.5-4B在长上下文设置下出现轻微性能下降。
- 演化技能的可迁移性取决于其捕获的是通用流程还是模型特定的变通方案: 可迁移性取决于技能编码的是通用流程还是模型特定的变通方案:LiveMath技能具有较强迁移性,而部分SpreadSheet技能会产生负迁移。Qwen-3.5-4B和Qwen-3.6-27B的技能分别将Gemini-3.5-Flash的性能从33.0%提升至67.5%和73.9%。
- 演化技能可有效跨模型迁移,迁移技能还可能优于自演化技能: WikiSkill技能经常可以跨模型迁移,并且能够优于自演化技能;例如,Qwen-3.6-27B技能使Qwen-3.5-9B在SpreadSheet上的性能达到50.5%,而自演化结果为33.6%。该比较中的无技能基线为24.3%。
5. 分析与讨论
WikiSkill 的持久化 wiki 显著提升了 skill evolution,但在 rollout 期间让 Inference Agent 接触 wiki 可能降低最终 skill 质量。系统持续积累依赖模型和 benchmark 的知识模式,通过记录 proposal、rejection 和 evidence 支持 skill 的持续优化。
- 持久化 wiki 知识显著提升 skill evolution: 15.0 个百分点:为 Skill Proposer 提供持久化 wiki 访问权限,使平均性能从 48.7% 提升至 63.7%;其中 LiveMath 从 51.3% 提升至 72.6%,SpreadsheetBench 从 49.9% 提升至 76.6%。该比较针对 Gemini-3.5-Flash,且 Inference Agent 未启用 wiki 访问;如果没有持久化积累,Skill Proposer 难以应对复杂的失败模式。
- evolution 期间向 Inference Agent 提供 wiki 访问会降低最终 skill 质量: 2.8 个百分点:在 training rollout 期间向 Inference Agent 提供 wiki 访问权限,使平均性能从 63.7% 降至 60.9%,LiveMath 性能从 72.6% 降至 64.8%。作者推测,rollout 期间直接访问 skill 和 wiki 知识,可能提供任务求解知识,却未能改善 evolved skill。
- WikiSkill 持续积累 wiki pattern,同时生成简洁的 skill: Wiki pattern 的积累和 skill 结构因模型与 benchmark 而异:Qwen 模型生成 118.9–128.6 行的 skill,而 Gemma-4-31B 和 Gemini-3.5-Flash 分别生成 45.1 行和 81.2 行的 skill。在不同 benchmark 中,SpreadSheet 生成的 skill 最长,为 142.5 行,wiki pattern 数量也最多,为 9.8;LiveMath 生成的 skill 最短,为 84.6 行,pattern 数量最少,为 4.4。
- Skill refinement 贯穿整个 evolution 过程: Skill refinement 会持续超出初始阶段:在各模型的迭代 0–1 中,accepted update 占全部 update 的 39%–52%;在各 benchmark 中占 39%–58%。accepted update 还可归入中期迭代 2–4 和后期迭代 5–7,表明初始化后 evolution 仍在持续。
6. 相关工作
已有研究探讨可复用的智能体技能与经验驱动的自我改进;与此同时,技能增强型智能体也研究如何在执行过程中检索相关技能。WikiSkill 则强调将经验持续整合为结构化知识,使后续技能更新能够系统地基于这些知识进行构建。
- 经验驱动的智能体技能演化: 智能体技能编码了可复用的程序性知识,使 LLM 智能体能够利用过去的经验完成未来任务(Anthropic, 2026; Li et al., 2026; Wang et al., 2026; Xia et al., 2026b; Xu and Yan, 2026; Zhang et al., 2025; Zhou et al., 2026)。
- 经验驱动的智能体技能演化: WikiSkill 引入了持久化 Wiki Layer,在多个迭代中将经验整合为结构化知识,使后续技能更新能够系统地基于累积知识进行构建。
- 技能增强型智能体与智能体自我改进: 技能增强型智能体必须在执行过程中选择并使用相关技能,这推动了 skill-retrieval 方法的发展,即针对每项任务从不断扩大的技能库中进行选择(Chen et al., 2026a; Liu et al., 2026; Cho et al., 2026; Shi et al., 2026; Su et al., 2026; Ye et al., 2026; Zheng et al., 2026)。WikiSkill 则关注技能本身的质量。
7. 结论
WikiSkill 将智能体技能与持久且不断累积的知识库协同演化,使不同迭代中的知识逐步实现更高程度的整合。其编排循环将经验加以整合、提出改进方案,并依据验证性能对变更进行准入控制;在五个基准和五个推理模型上均优于现有技能演化方法。
- WikiSkill 将智能体技能与持久且不断累积的知识库(wiki)协同演化。
- 其三层工作空间使技能开发能够建立在不同迭代中日益充分且整合良好的知识之上。
- 该编排循环将经验整合到 wiki 中,根据累积知识提出技能改进方案,并依据验证性能对变更进行准入控制。
- 在五个基准和五个推理模型上,WikiSkill 均稳定优于现有技能演化方法。
局限性
WikiSkill 的评估未考察 skill retrieval 或 triggering,因为 active skills 会直接注入 prompts。其严格的 validation gate 也会排除可能推动后续改进的 neutral proposals。
- 将 active skills 直接注入 prompts,使 skill retrieval 和 triggering 未得到评估,尽管随着可用 skills 增加,它们的重要性日益提升。这一设计沿用了既有工作,旨在通过避免 retrieval 带来的混杂效应来隔离 skill quality。
- 要求每个被接受的 proposal 都提升 validation scores,会排除那些保持即时性能不变、但可能支持后续迭代取得增益的 neutral proposals。该研究将这一严格的 validation criterion 作为 gating rule。
A. 方法细节 · A.1. 算法 · A.2. 已接受技能更新的分布
WikiSkill通过在训练任务上展开执行、将轨迹整合到wiki中、提出修改,并通过验证门控接受或回滚更新,迭代演化技能。该方法会在拒绝技能提案后保留wiki,并单独分析更新后的提案在何种情况下会被接受。
- A.1. 算法: WikiSkill的演化循环在每次迭代中结合了推理、wiki维护、提案生成、验证门控和最终wiki更新。该循环在训练任务上使用当前技能,将采样轨迹整合到中间wiki中,生成候选修改,并记录提案结果和技能差异。
- A.1. 算法: 验证门控会接受提出的技能更新,或回滚到之前的技能状态。当更新被拒绝时,算法会明确区分提出的S′_k与保留的S_k−1。
- A.1. 算法: 该算法需要训练任务、验证任务、性能指标和固定的迭代次数。这些输入定义了训练与验证流程,以及技能演化过程中使用的性能标准。
- A.1. 算法: 在演化开始前,WikiSkill根据初始技能集的展开执行结果,确定基线验证性能。该基线由在S0下采样的验证任务轨迹计算得到,并存储为Rbest。
- A.1. 算法: 在每次迭代中,推理agent使用当前技能在训练任务上展开执行,并从所得轨迹中采样一个子集用于wiki维护。训练展开执行使用S_k−1,维护器处理的是采样子集,而不一定是全部轨迹。
- A.1. 算法: 当提案被拒绝时,WikiSkill会回滚技能,但保留已累积的wiki。拒绝步骤将S_k设为S_k−1,同时保留wiki状态供后续演化使用。
- A.2. 已接受技能更新的分布: 论文在Table 5中报告了更新后的技能提案被接受时所对应条件的分布。给定段落将Table 5确定为接受行为的数据来源,但未提供其中的单元格数值。
B. 数据集细节与划分
评估采用五个基准,涵盖不同的推理、搜索、长上下文和交互式任务需求,同时与先前工作的划分方式和工具配置保持一致。由于验证集较小,报告分数取三次独立演化流水线运行的平均值,并采用配对 bootstrap 显著性检验。
- 基准覆盖范围: 五个基准评估多种能力,包括复杂数学推理、基于学术网页的问答、长上下文金融证据综合,以及交互式任务完成。LiveMath 测试量词和极值条件;SealQA 测试搜索查询构造和答案提取;Treasury-bulletin 任务要求综合多页证据;ALFWorld 是交互式任务。
- 数据集划分与工具: Table 6 报告训练、验证和测试划分中的基准样本数量,以及交互模式和可用工具。划分方式和工具集严格遵循先前工作(Alzubi et al., 2026; Yang et al., 2026)。
- 交互模式: LiveMath 是单步且无需工具,而 SealQA 提供网页搜索;Treasury 任务提供 oracle 参考页面,同时保留本地文本处理工具。Treasury 设置遵循 Yang et al. (2026),使用预解析的 oracle 页面作为初始证据,并使用 glob、grep 和 read 进行文档搜索与检查。
- 评估稳健性: 较小的验证集划分可能导致门控决策噪声较大,因此报告分数取三次独立运行的测试性能平均值,并采用配对 bootstrap 显著性检验。该稳健性流程遵循 Alzubi et al. (2026) 和 Yang et al. (2026) 中的既有设置。
C. 实现细节 · D. 基线细节与优化器 API 调用分析 · D.1. 基线方法
实现采用分层执行轨迹采样和基于 bootstrap 的显著性检验,并明确规定最佳方法的判定规则。基线涵盖不同的轨迹分析、候选前沿搜索和基于 ReflACT 的技能优化流程。
- C. 实现细节: 每次迭代最多采样 8 条轨迹,在失败轨迹与通过轨迹之间进行分层:前者用于根因分析,后者用于发现有效策略。分配方案允许最多采样 5 条失败轨迹和 3 条通过轨迹。
- C. 实现细节: 执行日志在注入 prompt 前限制为最多 15,000 个字符。
- C. 实现细节: 配对 bootstrap 检验在每个 benchmark 上执行 1,000 次迭代,有放回地重新采样测试实例,以计算候选方法的准确率和成对性能差距。
- C. 实现细节: 仅当某方法相对于每个竞争方法的观测增益或宏平均增益在 p<0.05 水平上显著时,才将其认定为唯一最佳方法。否则,对于统计上无法区分的并列最高排名方法,不指定唯一最佳方法。
- D.1. 基线方法: Trace2Skill (Ni et al., 2026) 并行分析通过和失败的训练轨迹,然后分层合并结构化补丁,形成应用补丁集。
- D.1. 基线方法: EvoSkill (Alzubi et al., 2026) 使用轮流训练类别、仅针对失败的反馈、验证评分和提议历史,在有界候选技能程序前沿中进行搜索。
- D.1. 基线方法: SkillOpt (Yang et al., 2026) 使用六阶段 ReflACT 流程反思完整轨迹,分层聚合并选择补丁,并验证对单一整体技能的更新。
D.2. Optimizer API 调用复杂度 · 3. 分层 reduce & apply 阶段:The 𝑁train · E. 系统与 Agent 提示词
在 full-batch evolution 下,WikiSkill 相对于训练集规模实现 O(1) 的 optimizer API 调用复杂度,每次迭代需要 1 + T_ReAct 次调用;相比之下,已有方法的调用次数随 minibatch 数量或轨迹数量增长。附录还给出了面向具体任务的 inference prompts,以及 Wiki Maintainer 和 Skill Proposer 的详细工作流程。
- D.2. Optimizer API 调用复杂度: 无论训练实例数量如何,WikiSkill 每次迭代都需要 1 + T_ReAct 次 optimizer LLM 调用,相对于 N_train 的复杂度为 O(1)。WikiSkill 使用 full-batch 处理,即 B = N_train;实验中 T_ReAct 大约为 10–20。
- D.2. Optimizer API 调用复杂度: WikiSkill 的恒定调用复杂度可能增加某些数据集上的推理成本,但同时相较已有 skill-evolution 方法带来稳定的性能提升。该比较基于 optimizer-complexity 分析所描述的评测设置。
- D.2. Optimizer API 调用复杂度: EvoSkill 和 SkillOpt 的复杂度为 O(N_train/B),而 Trace2Skill 的复杂度下界为 O(N_train),因为它会逐条分析每条训练轨迹。SkillOpt 在每个 minibatch 步骤中大约使用 6–8 次 optimizer 调用,而 Trace2Skill 还会执行分层 patch 合并和最终格式化。
- 3. 分层 reduce & apply 阶段:The N_train: WikiSkill 的 full-batch 设置使 Skill Proposer 能够按需动态搜索、选择并读取执行轨迹,这不同于 EvoSkill 和 SkillOpt 中性能最佳的 minibatch 设置。full-batch 配置在每次迭代中一次性处理整个训练集。
- E. 系统与 Agent 提示词: 附录为各项任务中的 inference agents、Wiki Maintainer 和 WikiSkill Skill Proposer 提供了精确的系统提示词。任务提示词涵盖数学推理、事实性网络问答、电子表格操作、OfficeQA 文档处理和 ALFWorld 交互。
- Wiki Maintainer Agent 系统提示词: Wiki Maintainer 被要求深入分析执行轨迹,记录带有根因和命令的成功与失败模式,并维护结构化的增量 wiki 文件。其规定的输出会更新模式、索引和演化日志;索引条目必须简洁说明问题、根因和修复方案。
- Skill Proposer Agent 系统提示词: Skill Proposer 必须先阅读 wiki 和既有 skill 的影响,再检查目标轨迹,随后通过结构化提案创建、修补或拒绝一项 skill 变更。该工作流程要求在提出变更前至少阅读四条执行轨迹,并倾向于为部分正确的 skill 提供简洁、可执行的补丁。