Source-linked AI summary

Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization

Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang

arXiv:2608.31077v1cs.AI

TL;DR

长程智能体强化学习能够提供经验证的轨迹结果,但无法精确确定中间可执行决策的信用分配。TASPO 将特权信息与目标轨迹对齐,并在动作层面重新分配结果信用,在多个智能体基准上持续优于 GRPO。

  • 问题

    基于结果的智能体强化学习能够提供经验证的轨迹反馈,但哪些中间可执行决策应获得信用仍存在歧义。

  • 方法

    TASPO 将成功同源轨迹中的特权信息与目标执行对齐,并利用有界、均值保持的动作级支持度重新分配经验证的结果优势。

  • 结果

    在不同智能体环境和模型规模下,TASPO 均持续优于匹配的 GRPO 基线;动作级分配降低了训练方差,并使优化动态更加平滑。

  • 要点与局限

    结果表明,对齐的特权监督无需额外的环境交互,也能提供更细致的学习信号。

  • 要点与局限

    PI 引起的似然变化衡量的是策略对特权信息的敏感性,而非奖励或 token 级动作价值。

Abstract

from arXiv · show

Outcome-based reinforcement learning provides verified feedback for language-model agents, but assigns trajectory-level advantage uniformly to all decisions, yielding coarse credit over long-horizon interactions. On-policy self-distillation offers finer supervision by re-evaluating sampled behavior with privileged information (PI) available only during training. However, fine-grained supervision is not necessarily fine-grained credit: PI-induced likelihood changes describe how additional information alters policy preference, but do not directly determine how an executable action should inherit the verified task outcome. This creates a supervision-credit gap. Privileged signals may be irrelevant to the current interaction state, operate at a token granularity misaligned with executable decisions, and lack the outcome semantics required for reinforcement. We introduce TASPO, which converts privileged supervision into outcome-grounded action credit. TASPO constructs decision-applicable PI from verified successful experience, aggregates PI-induced likelihood shifts at the executable-action level, and converts relative action support into positive, bounded, mean-preserving weights on the original trajectory advantage. Thus, the verified outcome determines the update direction and average scale, while PI only redistributes credit across actions. Across three agentic benchmarks, TASPO improves over GRPO by 10.6\% and generalizes better to unseen tasks. Further analysis indicates that TASPO reduces supervision mismatch and that action-level assignment stabilizes the policy optimization process. These findings offer the community another interesting perspective.

1 浙江大学 · 1 引言

Agentic RL 必须结合可靠的轨迹级结果 credit 与可适用的决策级过程监督。TASPO 通过将 privileged information 对齐到目标轨迹、在可执行动作上聚合,并重新分配而非替代已验证的结果信号,弥合了这一鸿沟。

  • 1 引言: GRPO 根据已验证结果提供可靠的轨迹级更新方向,但无法区分同一轨迹中的不同决策;相比之下,OPSD 提供更密集的 token 级监督。Token 级监督可能与可执行决策不对应,也可能无法保留结果语义。
  • 1 引言: 现有过程监督替代方案需要在可靠性与适用性之间权衡:任务特定奖励依赖可验证信号,而评估器和 value model 面临估计误差与分布偏移。训练时 privileged information 可减少对任务特定反馈或额外评估模型的依赖,但仍需要进行状态与相关性对齐。
  • 1 引言: 过程监督必须与已验证结果保持一致,并评估完整的环境决策,因为密集的过程信号可能与统一的结果 credit 发生冲突。因此,对于轨迹结果与动作质量,动作级聚合比 token 级聚合更为合适。
  • 1 引言: TASPO 从已验证的成功 sibling 轨迹中构造 privileged information,仅保留由目标执行路径支持的指导信号,否则不提供指导。当无法完成对齐时,TASPO 回退到原始 GRPO 更新。
  • 1 引言: 在 ALFWorld、Search-QA 和 WebShop、多个 backbone 规模及不同训练预算下,TASPO 均持续优于匹配的 GRPO 基线。在相同训练预算下,该框架还能够更快、更有效地改进策略。
  • 1 引言: 受控分析表明,轨迹对齐、动作级聚合和以结果为锚定的 credit 重新分配分别促成了 TASPO 的收益。与提取出的、与目标对齐的成功经验相比,通用技能和直接复用成功轨迹并不是同样有效的监督来源。
  • 1 引言: TASPO 在完整的可执行动作上聚合 privileged-information likelihood shifts,并使用受约束的权重重新分配原始 GRPO advantage。这使已验证结果继续作为优化方向,同时将 credit 更局部地分配到具体动作。

2 相关工作

既有研究将交互式智能体视为 outcome-based reinforcement learning 的受益者,同时指出稀疏反馈下难以为中间决策分配 credit。Knowledge distillation,尤其是结合仅在训练阶段可用的 privileged information 的 on-policy self-distillation,为 token 或 sequence 层级提供了互补监督。

  • 基于结果的强化学习: 交互式智能体日益需要进行推理、搜索、调用工具,并在长时域内采取行动,这推动了基于环境或验证器反馈的 outcome-based reinforcement learning [5] [6] [7] [12] [22] [24]稀疏的轨迹结果无法充分说明哪些中间决策导致了成功或失败,体现了序列学习中的延迟 credit。
  • 知识蒸馏: Knowledge distillation 通过 token 或 sequence 层级的监督,将行为信息从教师传递给学生 [11] [13]这里将 token 层级和 sequence 层级监督区分为已经确立的蒸馏设置。
  • On-policy 与 self-distillation: On-policy distillation 监督学生生成的样本,以减小经优化数据与当前策略之间的分布不匹配 [1] [20]近期的 self-distillation 方法利用仅在训练阶段可用的额外上下文、推理轨迹、技能或 hindsight 构造 privileged teachers [18] [23] [25] [29] [30] [33] [35]

3 方法

TASPO 将成功经验中的 privileged information 转化为可执行动作级 credit,同时保持经验证结果的更新方向和平均尺度不变。它将有依据的指导匹配到目标轨迹,衡量相对动作支持度,并通过正值、有界且均值保持的权重重新分配轨迹 advantage。

  • 3 方法: TASPO 区分不同作用:经验证结果决定更新方向和平均尺度,而 privileged information 在每条轨迹内的动作之间重新分配 credit。该方法保留原始轨迹 advantage,而不是利用 privileged information 估计新的局部 reward。
  • Privileged-information 构建: TASPO 从成功的同级轨迹中提取条件指导,将其匹配到每个目标的实际路径;若不再有有依据的条目,则回退到原始 GRPO credit。指导内容包括要求、顺序约束、进度规则或有效替代方案,其中源动作和观测提供明确证据。
  • 动作级 PI 评分: TASPO 仅在解析出的可执行动作 token 上衡量 PI 引起的 likelihood shift,过滤低于 margin κ 的变化,并按完整动作长度进行归一化。这些 shift 衡量的是对 PI 的敏感性,而不是 reward 或 token-level action value;[31] 之所以支持过滤,是因为不同 token role 受到的影响并不均等。
  • 面向结果的 credit 重新分配: TASPO 在每条轨迹内对相对 PI 支持度进行中心化,依据 advantage 符号确定方向,并将其转换为均值为一、取值 bounded 于 [1 −ϵw, 1 +ϵw] 的 positive weights。对于 positive advantage,更强的支持度会获得更多 credit;对于 negative advantage,它会削弱所分配的负向 credit。
  • Policy optimization: TASPO 将每个动作推导出的 weight 应用于其 turn 中所有有效的 policy token,保留 standard GRPO token loss,且无需额外的环境交互。如果 Ai = 0,或对齐的 turn 少于两个,则所有 weight 均等于一。

4 实验

在 ALFWorld、Search-QA 和 WebShop 上,TASPO 在不同 backbone 规模下均持续优于 GRPO;在相同预算下,其学习速度更快,最终性能更高。分析表明,这些收益源于决策适用的 privileged information、对 analyzer 选择的鲁棒性,以及动作级而非 token 级的 credit 分配。

  • 各 agent benchmark 上的持续改进: TASPO 在 ALFWorld、Search-QA 和 WebShop 及不同 backbone 规模下均持续优于 GRPO;在 ALFWorld 上,Qwen2.5-3B、Qwen2.5-7B 和 Qwen3-1.7B 的收益分别为 12.1%、11.1% 和 27.4%。这些模型在 ALFWorld 上的平均收益为 +16.9%,在 Search-QA 和 WebShop 上也有类似提升。
  • 更快且更有效: 经过初始探索后,TASPO 的学习速度快于 GRPO,并且在相同训练预算下达到高于 GRPO 和 SDAR 的 ALFWorld 最终成功率。Figure 4 展示了训练进度对比,正文将这一改进归因于信息量更高的 privileged-supervision 信号。
  • Privileged information 构建: 决策适用的 privileged information 优于通用 skills,表明构建质量和 trajectory 对齐比单纯增加信息更为重要。TASPO 比 GRPO 提升 12.1%,比最强的基于 trajectory 的 baseline 提升 5.2%;它提取的是上下文条件化的指导,而非直接模仿 trajectory。
  • 对 analyzer model 的鲁棒性: 将默认 analyzer 替换为 GLM 或 Qwen3.5-35B-A3B 后,保留的 PI 覆盖率和最终任务成功率仅出现轻微变化。相近的覆盖率和下游性能表明,TASPO 对训练时 analyzer 具有鲁棒性,其收益主要来自基于证据、与 trajectory 对齐的构建方式。
  • credit 分配粒度的影响: 在各 benchmark 上,动作级分配优于 token 级分配,使 ALFWorld 平均分从 79.7 提升至 86.3,并使 WebShop 成功率从 72.1 提升至 78.1。在 ALFWorld 上,seed 波动从 2.9 降至 1.4;在 Search-QA 上,平均分从 42.9 提升至 43.4。
  • 优化动态: 动作级分配带来更平滑、更一致的训练,并减少 KL spikes;相比之下,尽管 privileged information 和优化过程完全相同,token 级分配的波动更大。结果支持过滤 token 特定噪声,同时保留与决策相关的监督信号,从而实现更稳定的优化。

5 结论

TASPO 通过将特权信息与可执行决策对齐,并在不改变已验证结果信用符号的情况下重新分配信用,为长时程 agentic 强化学习提供了更精细的信用分配。实验表明,相较于 GRPO 和近期基线方法,TASPO 持续取得改进;分析结果支持特权信息对齐和动作级分配。

  • TASPO 提出了一个与轨迹对齐的框架,为长时程 agentic 强化学习实现更精细的信用分配。
  • TASPO 从成功经验中构造决策适用的特权信息,并利用相对动作支持度重新分配已验证结果信用,同时不改变其符号。
  • 在多样化 agent 基准上的实验表明,相较于 GRPO 和近期基线方法,TASPO 持续取得改进;分析结果验证了特权信息对齐和动作级分配。这些发现表明,可靠的特权监督能够提供更精细的学习信号。
Loading 2608.31077v1…