Source-linked AI summary

Hindsight Credit Assignment for Long-Horizon LLM Agents

Hui-Ze Tan, Xiao-Wen Yang, Hao Chen, Jie-Jing Shao, Yi Wen, Yuteng Shen, Weihong Luo, Xiku Du, Lan-Zhe Guo, Yu-Feng Li

arXiv:2603.08754v1cs.LGcs.AI

TL;DR

长程 LLM agent 难以将稀疏的终止奖励归因于关键的中间动作,而现有 value-free 方法对 step-level value 和 baseline 的估计并不准确。HCAPO 利用 hindsight reasoning 和 multi-scale advantage 改进 credit assignment,在包括 ALFWorld 在内的三个 benchmark 上持续优于当前最优 RL 方法;相较于 GRPO,其 ALFWorld 提升了 13.8%。

  • 问题

    稀疏的终止奖励使关键中间动作难以获得准确归因,而全局 baseline 与不断变化的 state value 不匹配。

  • 方法

    HCAPO 将 LLM 作为 post-hoc critic,通过生成式验证改进 step-level Q-value,并为关键 state 引入 multi-scale advantage。

  • 结果

    HCAPO 在 ALFWorld、WebShop 和 Search-augmented QA 上持续优于当前最优 RL 方法,使 ALFWorld 相较于 GRPO 的成功率提升 13.8%。

  • 主要结论与局限

    HCAPO 提供了一种可扩展的 agent 优化方法,利用 LLM 的内在推理能力,而无需依赖外部模型。

  • 主要结论与局限

    在小型模型中,HCAPO 的 credit signal 精度可能受限;此外,hindsight 信息会引入部分分布外数据。

Abstract

from arXiv · show

Large Language Model (LLM) agents often face significant credit assignment challenges in long-horizon, multi-step tasks due to sparse rewards. Existing value-free methods, such as Group Relative Policy Optimization (GRPO), encounter two fundamental bottlenecks: inaccurate step-level Q-value estimation and misaligned value baselines for intermediate states. To address these limitations, we introduce HCAPO, the first framework to integrate hindsight credit assignment into LLM agents. HCAPO leverages the LLM itself as a post-hoc critic to refine step-level Q-values through hindsight reasoning. Furthermore, HCAPO's multi-scale advantage mechanism effectively supplements the inaccurate value baselines at critical decision states. Evaluations across three challenging benchmarks, including WebShop and ALFWorld, demonstrate that HCAPO consistently outperforms state-of-the-art RL methods. Notably, HCAPO achieves a 7.7% improvement in success rate on WebShop and a 13.8% on ALFWorld over GRPO using the Qwen2.5-7B-Instruct model. These results indicate that HCAPO significantly enhances exploration efficiency, promotes concise decision-making, and ensures scalability in complex, long-horizon tasks.

1. 引言

长程 LLM agent 受到稀疏终止奖励的影响,难以明确中间动作的贡献;GRPO 则面临步级 Q-value 估计不准确和价值基线错位的问题。HCAPO 通过基于 hindsight 的事后批评与多尺度优势融合解决这些局限,并在三个基准上超越最先进的 RL 方法。

  • 动机: 稀疏终止奖励使长程 RL 任务难以对中间动作及时、细粒度地分配 credit。大多数任务仅在终止状态提供标量奖励,从而形成根本性的 credit assignment 瓶颈。
  • 动机: GRPO 及相关 value-free 方法面临步级 Q-value 估计不准确,以及中间状态价值基线错位的问题。其贯穿整条轨迹的 Monte Carlo reward 淡化了单个动作的贡献,而初始状态的平均奖励可能无法反映后续决策状态。
  • HCAPO: HCAPO 通过让 LLM 充当以后续成功结果为条件的事后 critic,为 LLM agent 引入 hindsight credit assignment。其 Generative Verification 会在轨迹结束后评估各个动作发挥了多大作用。
  • HCAPO: HCAPO 将细化后的 Q-values 与多尺度优势相结合,在关键瓶颈节点准确估计价值,同时保持轨迹级训练的稳定性。该设计直接针对标准 group optimization 粗粒度的步级估计,以及中间状态价值基线错位问题。
  • 实证结果: HCAPO 在 ALFWorld、WebShop 和 Search-augmented QA 上持续超越最先进的 RL 方法。评估结果表明,该方法在多样化的长程 agent 基准上具有经验优势。

2. 相关工作

已有研究将 LLM 用作自主智能体,并结合强化学习、奖励塑形和过程监督来提升复杂任务性能与信用分配能力。HCAPO 的不同之处在于利用 LLM 的内在推理,无需人工锚点规则或外部模型。

  • LLM 作为自主智能体: LLM 能够进行推理、规划并与多样化环境交互,从而完成网页导航和具身规划等复杂多步任务。
  • 面向 LLM 智能体的强化学习: 包括 RLOO(Ahmadian et al., 2024)和 GRPO(Shao et al., 2024b)在内的无价值方法,在估计优势的同时,解决了 PPO 学习式 Critic 带来的内存开销问题。
  • 奖励塑形与过程监督: Process Reward Models(Lightman et al., 2023)为稀疏奖励下的信用分配提供步级监督,但需要昂贵的人工标注。
  • 奖励塑形与过程监督: 与 GiGPO(Feng et al., 2025)引入的基于状态的锚点不同,HCAPO 利用 LLM 的内在推理进行信用分配,无需人工锚点规则或外部模型。

3. 预备知识

论文将 LLM-agent 交互建模为稀疏奖励 POMDP 决策过程,并通过指出 value-free 基线的局限性、引入基于 LLM 的 hindsight 估计,论证 hindsight credit assignment 的必要性。

  • POMDP 建模: LLM-agent 任务被建模为 POMDP,其中观测和动作历史定义状态,策略选择动作,交互产生有限长度的轨迹。Agent 接收 HTML 源代码等观测,并生成点击或搜索查询等动作。
  • 稀疏奖励: 稀疏奖励仅在任务完成时到达,因此难以评估中间动作的贡献。环境在终止时间步提供一个标量轨迹奖励。
  • Credit Assignment 挑战: 长时域 value-free 方法缺乏准确的 step-level credit assignment,因为终止回报无法区分关键动作与无关动作,而全局基线又与不断变化的状态价值不匹配。基于 critic 的估计对 LLM 而言同样代价高且不稳定,在长时域稀疏奖励下具有较高偏差。
  • Value-Free 优化: GRPO 无需单独训练 critic,而是根据采样轨迹组中的奖励统计量估计优势,在不增加 value-network 参数的情况下降低方差。其基线使用结果奖励的组内均值和标准差进行组内比较。
  • Hindsight Credit Assignment: HCA 通过基于已实现的未来状态对动作概率进行条件化来估计 step-level Q-values;对于 LLM agents,通过后验结果构造提示,可以在无需训练单独模型的情况下近似这一 hindsight distribution。经典 HCA 使用 hindsight 分布与行为策略分布之间的 importance ratio,而 LLM agents 则通过上下文条件化模拟 hindsight。

4. HCAPO

HCAPO 是一种无价值函数强化学习框架,能够将稀疏的轨迹级反馈转化为面向长程 LLM agent 任务的细粒度、步骤级信用。该方法结合 hindsight reasoning、自归一化重要性估计与多尺度优势,在保持全局稳定性的同时提升局部精度。

  • 框架概览: HCAPO 将粗粒度的终止奖励细化为步骤级优势,利用 LLM 充当事后批评器,从而解决 GRPO 在轨迹动作之间进行均匀信用分配的问题(Shao et al., 2024b)。该框架通过 hindsight Q-values 区分关键的状态—动作对与冗余步骤。
  • Hindsight Q-values: Hindsight importance ratios 放大在成功结果下更可能采取的动作,并抑制在这些结果下可能性更低的动作,充当信用分配的因果过滤器。对于稀疏的终止奖励,细化后的 Q-value 将折扣未来回报与 hindsight ratio ρ_i,t 相结合。
  • Generative Verification: Generative Verification 通过将成功结果作为条件输入 LLM,并依据 token probabilities 估计 hindsight scores,避免使用难以处理的先验策略和单独训练的 hindsight model。该方法通过轨迹内 hindsight scores 的经验均值近似先验策略,从而得到自归一化重要性比率估计器。
  • Generative Verification: 轨迹内归一化为连续的关键决策提供局部参照,使长程任务能够在不依赖外部模型的情况下高效完成信用分配。当瓶颈决策涉及多个相邻动作时,这一点尤其有用,例如在 ALFWorld 中。
  • 多尺度优势优化: HCAPO 将宏观尺度的结果反馈与微观尺度的 hindsight 反馈相结合,同时通过保护性掩码、PPO 优化(Schulman et al., 2017)、KL 正则化和可选的时间平滑来稳定训练。保护性掩码会移除成功试验中的负 hindsight 信号,而平滑机制可以将信用分配到相邻的推理步骤与动作步骤之间。

5. HCAPO 的理论依据

HCAPO 的复合优势将宏观尺度的 GRPO 结果与微观尺度的事后指导相结合,在保持训练稳定性的同时,解决粗粒度的步级信用分配问题。其全局事后基线能够自适应地识别瓶颈动作,并抑制非工具性步骤。

  • 5. HCAPO 的理论依据: HCAPO 将轨迹级 GRPO 反馈用于提供全局方向,并利用经事后推理细化的 Q 值,在关键决策节点进行精确信用分配。宏观信号能够促进高回报结果,但会将成功试验中的动作一视同仁地归因;微观修正则放大关键决策,并抑制冗余或噪声步骤。
  • 5. HCAPO 的理论依据: HCAPO 的全局事后均值 µH 是对任务状态访问空间中平均期望效用的非参数估计。这是通过对不同轨迹中异质的状态-动作对应用全期望定律得到的。
  • 5. HCAPO 的理论依据: 在瓶颈状态下,µH 位于 Vlow 与 Vhigh 之间,形成一个能够区分突破性动作与非工具性动作的自适应阈值。QH ≈ Vhigh 的动作会获得正优势,而 QH ≈ Vlow 的动作会获得负优势。
  • 5. HCAPO 的理论依据: 聚焦瓶颈的优势能够降低背景方差,并将学习集中于触发从 Vlow 到 Vhigh 的转变。这种筛选机制使 HCAPO 能够针对任务瓶颈,同时维持整体训练稳定性。
  • 5. HCAPO 的理论依据: HCAPO 通过事后细化与多尺度优势整合,解决标准群组优化中的粗粒度步级 Q 值和错位的中间状态基线问题。这些机制共同隔离工具性动作,并在关键瓶颈节点提供具有判别性的价值估计。

6. 实验

在 ALFWorld、WebShop 和 search-augmented QA 上,HCAPO 的长程智能体性能均优于 GRPO,并接近 GiGPO 的结果。其 hindsight 信号还可缩短轨迹,同时仅增加有限的计算开销。

  • 行为分析: HCAPO 识别具有关键作用的动作,抑制冗余步骤,并将信用集中分配给关键检索查询,而非在整条轨迹上均匀分配反馈。其 hindsight ratio 能在包括 Pick2 和 Cool 在内的复杂环境中突出关键动作,并在 single-hop QA 中识别高效用的“golden queries”。
  • 基准测试结果: 在 ALFWorld 上,HCAPO 在 7B 模型上达到 91.4% 的成功率,而 GRPO 和 GiGPO 分别为 77.6% 和 90.8%;在 1.5B 模型上则达到 87.0%,相比之下为 72.8%。Table 1 报告了三个随机种子下的平均结果,并包含 ALFWorld 各子任务及总体成功率。
  • Search-Augmented QA: 在 search-augmented QA 上,HCAPO 在 7B 模型上的平均成功率达到 48.3%,超过 Search-R1 和 StepSearch,同时与 GiGPO 相当。这一提升在 single-hop 和 multi-hop 推理数据集上均成立。
  • 行为分析: HCAPO 将 WebShop 轨迹从使用 GRPO 时约 7.8 步缩短至约 5.8 步,同时减少训练期间的冗余动作。随着 HCAPO 惩罚低效用动作,剪枝率不断提升,表明策略已内化任务所需的关键逻辑。
  • 计算效率: 由于 Generative Verification 只需在一次可并行化的前向传递中对已有动作轨迹进行评分,hindsight audit pass 仅占总训练时间的 8.3%。这种基于前缀的计算避免了自回归动作生成的串行瓶颈。

7. 结论与局限性 · A. HCAPO 的时间平滑

HCAPO 被提出为一种无价值函数、可扩展的框架,利用 LLM 的推理能力进行生成式验证,并表明,准确的步级动作价值可以在简化全局归一化的情况下支持信用分配。其有效性取决于基础模型的推理能力,并会引入一些分布外的回溯数据。

  • 7. 结论与局限性: HCAPO 作为一种无价值函数框架,连接了回溯信用分配理论与长时程 LLM agent 优化。该框架旨在实现可扩展的 agent 优化,而不依赖外部模型。
  • 7. 结论与局限性: 即使采用简化的全局组归一化,准确的步级动作价值估计也足以完成信用分配。HCAPO 利用 LLM 的内在推理能力进行生成式验证。
  • 7. 结论与局限性: 由于依赖基础模型的推理能力,HCAPO 的信用信号在小模型中可能不够精确。这一局限性体现了该方法对底层模型推理能力的依赖。
  • 7. 结论与局限性: 尽管努力保留 agent 的决策过程,回溯信息仍不可避免地会引入一些分布外数据。未来工作可以采用专门的微调,使回溯推理与策略更好地对齐。

A.1. 方法论

HCAPO解决了多步 ALFWorld 任务中的信用断裂问题:必要的导航和准备动作可能因得分较低而被忽视。时间平滑将终端突破信号向前传播,把推理与即时执行视为一个连贯单元,其中 α = 0.5。

  • 信用断裂: 在 ALFWorld 中,verifier 对早期导航或准备动作的评分可能低于最终的“CleanObject”动作,尽管任务成功严格依赖这些前置动作。例如“GoToPlace”和“OpenObject”动作。
  • 时间平滑: 采用 ˜QH_i,t+1 进行时间平滑后,终端突破信号可以向前传播至更早的步骤。这解决了最终步骤识别与前置动作信用分配之间的不匹配问题。
  • 时间平滑: 当 α = 0.5 时,推理步骤与其即时执行构成一个连贯的功能单元,避免以牺牲前置步骤为代价过度优化最终奖励。该机制将中间动作与终端结果关联起来,而不是只奖励最终动作。

A.2. 实验 · B. 算法伪代码 · C. 实验细节

HCAPO 实验表明,时间平滑能够提升复杂 ALFWorld 序列训练的稳定性与成功率。该算法结合基于 rollout 的宏观优势、经 hindsight 精炼的 Q-values、可选的平滑机制、微观优势,以及采用 PPO-clipped 的策略更新。

  • A.2. 实验: 时间平滑能够稳定学习过程,并提高复杂多步 ALFWorld 序列上的总体成功率。Figure 5 展示训练期间的成功率,Table 3 则使用三个随机种子的平均结果比较 HCAPO、GRPO 和 GiGPO。
  • C. 实验细节: 实验细节规定了按子任务报告 ALFWorld 结果及总体成功率,并在三个随机种子下与 GRPO 和 GiGPO 进行比较。Table 3 定义了时间平滑实验所报告的指标及平均方案。
  • B. 算法伪代码: HCAPO 在每次训练迭代开始时更新旧策略、采样任务、初始化相同环境,并收集多步 rollout。伪代码在进行 hindsight credit assignment 之前使用任务分布 p(X)、批大小 N 和 rollout horizon T。
  • B. 算法伪代码: hindsight 阶段计算轨迹级宏观优势,并通过生成式验证获得 hindsight action probabilities。这些概率用于支持裁剪到 [Cmin, Cmax] 的重要性比率以及精炼后的 hindsight Q-values。
  • B. 算法伪代码: HCAPO 可在通过跨状态归一化估计微观优势之前,对精炼后的 hindsight Q-values 应用时间平滑。伪代码将平滑后的值记为 Q̃H,并将归一化的微观优势记为 AMicro。
  • B. 算法伪代码: 该方法将宏观优势和微观优势结合为多尺度优势,用于策略优化。这一组合优势用于 HCAPO 的 PPO-clipped surrogate objective JHCAPO(θ)。

C.1. 训练细节 · C.2. Agent 训练提示

训练采用各基准特定的时域、提示长度限制、奖励、rollout 设置和计算资源分配,同时在不同基准间保持 HCAPO 超参数一致。Agent 提示包含任务上下文、近期或完整交互历史、明确的推理标签,以及环境特定的动作或搜索-回答格式。

  • C.1. 训练细节: ALFWorld 训练使用 2048-token 提示、512-token 响应、50-step 回合、actor learning rate 1 × 10−6、critic learning rate 1 × 10−5,以及 +10/0 成功奖励。Rollout temperature 为 1.0,validation temperature 为 0.4;mini-batch size 为 256,βKL 为 0.01。
  • C.1. 训练细节: WebShop 训练使用 4096-token 提示、512-token 响应、15-step 回合、+10/0 成功奖励,以及对无效动作施加 −0.1 惩罚。基于 group 的方法使用 G = 8,每次 rollout 包含 16 个 group,共计 128 个环境;rollout 和 validation temperature 分别为 1.0 和 0.4。
  • C.1. 训练细节: Search-augmented QA 使用 4096-token 提示、512-token 响应、最多 4 轮、+1/0 奖励、−0.01 无效动作惩罚、256 个训练样本,以及 G = 5。actor learning rate 为 1 × 10−6,rollout 和 validation temperature 分别为 1.0 和 0.0。
  • C.1. 训练细节: HCAPO 在不同基准间保持其 Generative Verification 和 hindsight-credit 超参数一致,包括 Ttemp = 5.0、将 ρi,t 裁剪至 [0.8, 1.2]、ω = 1.0、α = 0.5 和 γ = 0.95。该裁剪范围旨在避免极端后验估计引发不稳定。
  • C.2. Agent 训练提示: 提示使用 Python 风格的运行时格式化来填充任务描述、步数、观测及其他语义槽位;ALFWorld 和 WebShop 的 history length 为 2,而 search-augmented QA 使用完整历史。共享格式使用 <think> 表示逐步推理,使用 <action> 表示最终决策;搜索 agent 还使用 <search>、<information> 和 <answer> 标签。
  • C.2.1. ALFWORLD AGENT TRAINING TEMPLATE ALFWorld Agent Training Template: ALFWorld 模板提供任务、近期观测与动作、当前步数和观测、可执行动作,并要求以 <think>-then-<action> 格式作答。该模板明确将 agent 设定为在 ALFRED embodied environment 中运行。
  • C.2.2. WEBSHOP AGENT TRAINING TEMPLATE WebShop Agent Training Template: WebShop 模板提供购物任务、近期交互历史、当前观测和可用动作,并要求 agent 先进行推理,再在 <action> 标签中选择一个可执行动作。该 agent 被要求选择最能推进购物目标的动作。
  • C.2.3. SEARCH-AUGMENTED QA AGENT TRAINING TEMPLATE: Search-augmented QA 模板记录先前查询及检索结果,随后要求先推理,再恰好作出一个选择:知识不足时发出 <search> 查询,有把握时提供简洁的 <answer>。搜索结果包裹在 <information> 标签中,最终答案使用 <answer> 标签,且不提供详细说明。

D. 消融实验

在使用 Qwen2.5-1.5B-Instruct 的 ALFWorld 上进行的消融实验表明,增大 hindsight weighting coefficient ω 能持续提升整体成功率,支持采用完整 HCAPO 设置 ω = 1.0。

  • D. 消融实验: ω 用于调节 composite advantage 中 step-level hindsight correction 相对于 trajectory-level GRPO advantage 的贡献。该消融实验改变 ω,以量化 hindsight credit assignment 在 Qwen2.5-1.5B 设置下的影响。
  • D. 消融实验: 单调提升验证了引入 hindsight credit assignment 的有效性,并促使我们将 ω = 1.0 作为默认选择。所测试的系数控制相对于 macro-scale GRPO baseline 的 micro-scale hindsight advantage。
  • D. 消融实验: 随着 ω 从 0 增至 0.2、0.5 和 1.0,整体成功率依次为 72.8 →79.7 →84.4 →87.0,其中 ω = 0 对应 GRPO,ω = 1.0 对应完整 HCAPO。Table 4 报告了在 3 个随机种子上取平均的各子任务及整体成功率。
Loading 2603.08754v1…