Source-linked AI summary

LLM-as-a-Verifier: A General-Purpose Verification Framework

arXiv:2607.05391v2

TL;DR

标准 LM judge 提供粗粒度的离散分数,限制了对候选解的细粒度验证。LLM-as-a-Verifier 根据 scoring-token logits 计算连续奖励,并在 coding、robotics 和 medical benchmarks 上实现 state-of-the-art 性能。

  • 问题

    标准 LM judge 提供粗粒度分数,常使不同轨迹获得相同分数,因此需要一种可泛化的框架来生成细粒度验证信号。

  • 方法

    LLM-as-a-Verifier 根据 scoring-token logit 分布计算期望分数,并通过粒度细化、重复评估和标准分解来扩展验证。

  • 结果

    LLM-as-a-Verifier 在 coding、robotics 和 medical benchmarks 上实现 state-of-the-art 性能,包括在 Terminal-Bench V2 上达到 86.5%。

  • 要点与局限

    细粒度 verifier 信号支持轨迹排序、agent 和 robot 的进展监控,以及用于 reinforcement learning 的更密集奖励。

  • 要点与局限

    该框架假设可以访问 scoring-token logits,因此不适用于只能通过受限 API 使用的 frontier models。

Abstract

from arXiv · show

1. 引言

本文提出 LLM-as-a-Verifier:一种无需训练的概率框架,利用 scoring-token 的 logit 分布提供细粒度的验证反馈。该框架通过分数粒度、重复评估和标准分解刻画验证的 scaling,从而支持轨迹评估、高效候选排序以及为强化学习提供更稠密的奖励。

  • 框架: LLM-as-a-Verifier 根据 scoring-token logits 的期望估计候选质量,无需额外训练即可提供稠密、细粒度的反馈。这一概率化表述弥补了离散 LM judge 的局限,后者可能产生有偏或噪声较大的分数。
  • 验证 Scaling: 通过提升 score-token 粒度、进行重复评估以及分解评估标准,可以提高验证准确率。重复评估可降低方差,而标准分解可减少 prompt 偏差;在受控预算下,本文将这些收益与离散 LM judge 进行比较。
  • Agent 评估: 该 verifier 评估完整的 agent 交互轨迹,并结合成本高效的排序算法,在 coding、robotics 和 medical 基准上均优于 frontier models。该方法还发现 verifier 分数与按时间顺序排列的步骤相关,从而支持任务进度监控,以及面向 Claude Code 和 Codex 的扩展。
  • 强化学习: 在 LIBERO 上,LLM-as-a-Verifier 的 sample efficiency 比稀疏奖励基线高 ≈1.8×;在 MATH 上,其 sample efficiency 高 ≈1.1×。在使用 DSRL-SAC 微调 π0 policy 时,LIBERO 结果还达到更高的最终成功率;MATH 结果使用 GRPO 微调 Qwen3-8B。

2. 预备知识

论文将智能体–环境交互建模为有限时域 MDP,并将该框架专门应用于基于 LLM 的智能体。同时,论文将传统语言空间 reward model 形式化为生成离散 token 分数的模型。

  • 2. 预备知识: 智能体–环境交互被建模为有限时域 Markov Decision Process (MDP)。该 MDP 包含上下文、状态、动作、转移 dynamics、rewards 和时域 H。
  • 2. 预备知识: 每个 episode 采样一个任务 prompt,从初始状态开始,并经历 H 次状态–动作转移。智能体观测每个状态,选择一个动作,并根据由 prompt、状态和动作共同决定的 P 进行转移。
  • 2. 预备知识: 对于基于 LLM 的智能体,状态是此前的交互历史,动作是 token 序列,language model π_θ 以自回归方式采样动作。该 policy 将上下文和状态映射为动作上的分布。
  • 2. 预备知识: 传统 reward model 会 prompting LLM 生成离散的语言空间分数,并将其形式化为 R_LM(x, τ) ∈ {1, . . . , G}。该分数就是生成的 token,reward model 为动作或轨迹分配标量分数。

3. 提出方法:LLM-as-a-Verifier

LLM-as-a-Verifier 是一种概率框架,通过扩大评分粒度、重复评估和标准分解来提供细粒度验证。该框架还引入了一种节省预算的 pivot tournament,用于从多个候选轨迹中进行选择。

  • 动机: 当汇集采样轨迹并由 oracle verifier 选择最优轨迹时,Oracle Pass@K 在 Terminal-Bench V2 上达到 98.9%。这一结果促使研究者开发能够从重复采样中识别正确解的验证方法。
  • 动机: 标准 language-model judges 产生的评估较为粗糙,因为离散评分输出常常无法区分复杂解,导致其在 Terminal-Bench 上的平分率达到 27%。Reward models [15] 被提出作为替代方案,但其对训练数据的依赖可能限制跨域泛化能力。
  • 细粒度奖励估计: 该框架利用 score-token 分布、重复评估和分解后的标准来估计细粒度奖励,而不是将每次评估压缩为一个离散分数。连续奖励经过归一化后,使用 Bradley–Terry model 转换为成对偏好。
  • 概率 pivot tournament: PPT 将成对验证成本从 O(N^2) 降至 O(Nk):它将候选项与从经验 ring-pass 领先者中选出的 k ≪ N 个 pivot 进行比较。随机 Hamiltonian ring pass 使每个候选项在每个 prompt 位置上各出现一次,从而在期望意义上抵消位置偏差;随后通过 pivot 比较汇总归一化胜率。
  • 概率 pivot tournament: PPT 的性能优于 V1 [5] 等已有 ranking 方法,同时所需比较次数更少;随着 pivot 数量增加,其性能持续提升。该基准为每个任务使用由 Terminus-2 harness 筛选的 20 条轨迹,并在 Table 9 中评估预算–准确率权衡。

4. 验证扩展

验证沿三个互补轴扩展——评分粒度、重复评估和评估标准——分别针对不同的奖励估计误差。更细的评分可改善校准,重复评估可降低方差,标准集成则可提高长时程判断的准确性。

  • 扩展轴: 验证扩展结合评分粒度、重复评估和评估标准,每个轴分别应对奖励估计误差的不同来源。粒度提升分数区分度,重复评估平均掉 verifier 通过偏差,评估标准则将正确性分解为可分别验证的因素。
  • 评分粒度: 0.775 到 0.799:将评分 token 数从 G=1 增加到 G=20,可提高 Terminal-Bench 上的 SNR,从而更好地校准正确与错误轨迹之间的区分。SNR 衡量成对分数差异中信号强度相对于不一致性的大小,成对验证准确率会随 SNR 单调提升。
  • 评分粒度: 77/100:G=20 对正确的 query-optimize 轨迹排名更高;相比之下,在相同 1–5 量表上取期望得到 69/100,而离散评判有 88/100 次平局。该案例研究在 Terminal-Bench V2 上进行 100 次重复评估;概率评分消除了粗粒度评判的平局,并进一步提高了区分度。
  • 重复评估: 对 K 次独立评估取平均,可在不改变偏差的情况下将估计量方差降低至 O(1/K);这通过消除更细评分无法消除的噪声,补充了评分粒度的作用。K=1 时的单次 verifier 已达到 K=16 时高度集成评判器的水平,表明细粒度概率评分能提供更强的信号。
  • 评估标准: 78.3%:由 Specification、Output 和 Errors 标准组成的集成优于单个标准;在长时程任务上,单个标准的准确率为 75.2%–76.4%。这些标准分别评估任务要求、最终输出格式和失败信号;最终奖励取它们期望分数的平均值。

5. 实验

在涵盖编程、机器人和医疗领域的四个 benchmark 上,LLM-as-a-Verifier 通过成对概率枢轴锦标赛从候选轨迹中进行选择;相比 Pass@1,该方法持续取得提升,并追回了相当大的 oracle 上限空间。该方法还在每个 benchmark 上达到 state-of-the-art 性能,并能泛化到不同的候选池和 harness。

  • 评测协议: 在编程、机器人和医疗 benchmark 上,generation policy 生成 N 条候选轨迹,verifier 通过概率枢轴锦标赛为每一对轨迹打分,随后提交归一化得分最高的轨迹。评测涵盖 Terminal-Bench V2 [17]、SWE-Bench Verified [18]、RoboRewardBench 和 MedAgentBench
  • 总体结果: LLM-as-a-Verifier 持续优于 Pass@1,追回了 oracle Pass@N 上限空间中的很大一部分,并在全部四个 benchmark 上达到 state-of-the-art 性能。Table 3 报告了固定 agent harness 下各 benchmark 的 baseline、Pass@1、oracle Pass@N 和 verifier accuracy。
  • Terminal-Bench V2: Terminal-Bench V2 的 accuracy 从 83.1% 提升至 86.5%,超过多个竞争性 agent 系统,并在 Terminal-Bench V2.1 上创造了新的 state of the art。这些增益还可泛化到主要 harness 之外的 Terminus-2 和 Terminus-Kira。
  • SWE-Bench Verified: 在 SWE-Bench Verified 上,verifier 从由不同 model family 生成的 N=3 条候选轨迹组成的异质候选池中选出最优轨迹。这一设置不同于 Terminal-Bench 上使用的同质 proposal pool,并测试了跨多样候选进行选择的能力。
  • RoboRewardBench: 在 RoboRewardBench 上,LLM-as-a-Verifier 通过整合视觉上下文评估多帧 rollout 视频,判断哪条轨迹取得了更大的物理进展,其表现优于训练得到的机器人 reward model。该 benchmark 使用遵循同一自然语言指令但进展不同的成对 rollout。
  • MedAgentBench: MedAgentBench 在涉及信息检索、指南查询和多步工具使用的医疗 EHR 任务上对通用 verification 进行压力测试;在这些任务中,verification 错误会带来安全后果。评测使用 AgentBench harness 和 Claude Opus 4.8,为每项任务抽取 N=5 条轨迹。

6. 细粒度验证器信号作为任务进度代理

LLM-as-a-Verifier 的细粒度分数提供了一个标量进度代理,可通过 Value-Order Correlation (VOC) 量化,并区分成功、停滞和失败的轨迹。在机器人任务上,它显著优于其他进度估计器;与此同时,TurboAgent 将验证器扩展到现有 coding-agent 客户端,无需修改其 harness 或 backend model。

  • 信号定义: VOC 是按 Ma et al. [22] 定义的 Spearman 秩相关系数,用于衡量时间顺序上的步骤索引与验证器对相应轨迹前缀预测值之间的相关性。用于跟踪进度的验证器应为后续步骤分配单调更高的分数。
  • VOC 在代码生成中的表现: 成功与失败的 Terminal-Bench V2 轨迹之间存在 0.08 Spearman gap,且成功 rollout 的验证器进度近似单调。失败 rollout 的相关性更弱或不一致,因此 VOC 可用于检测有限的进度。
  • Coding Agent 扩展: TurboAgent 是面向 Claude Code 和 OpenAI-API-compatible 客户端的 inference-time proxy,无需修改 agent harness 或 backend model。其透明的 proxy 设计还支持与现有 benchmark 集成。

7. 用于强化学习的稠密奖励

LLM-as-a-Verifier 为 off-policy 和 on-policy 强化学习提供稠密奖励,在无需训练 reward model 或进行环境特定 shaping 的情况下提升样本效率。在 off-policy RL 中,verifier progress rewards 提升 LIBERO 性能,并减少达到相同成功率所需的环境步数。

  • 稠密奖励: Verifier progress rewards 是适用于 off-policy 和 on-policy RL 的即插即用稠密信号,在无需训练 reward model 或进行环境特定 shaping 的情况下提升样本效率。该方法通过提供细粒度分数作为中间奖励,针对 credit-assignment 问题。
  • Off-policy RL: 在 off-policy DSRL-SAC 中,verifier scores 基于渲染的 rollout frames 计算,用于重新标注已存储的 transitions,并纳入 replay-buffer returns,同时不改变 SAC objective。系数 λ 在环境奖励和 verifier rewards 之间进行权衡,以离线方式加入稠密信号,且不增加额外 algorithmic cost。
  • On-policy RL: 在 on-policy GRPO 中,概率式 pivot-tournament preferences 为 reasoning traces 分配归一化分数,防止所有采样答案最初都不正确时 advantages 为零。当基于组的相对 advantages 否则会坍缩为零时,该方法提供 learning signal。
  • 实证结果: 1.8× 更高的样本效率使 LIBERO 上的 DSRL-SAC 在 verifier shaping 下达到 0.2 至 0.6 的成功率,相比之下 sparse rewards 下无法达到这一水平。verifier progress reward 还达到了更高的最终成功率:0.76 vs. 0.69。

8. 讨论

论文将验证视为 scaling 中一个尚未充分探索的维度,并提出 LLM-as-a-Verifier,这是一种针对 agentic 任务提供细粒度反馈的通用框架。不同于输出单一离散分数的标准 LM judges,该框架通过计算 scoring-token logit 期望得到连续 reward。

  • LLM-as-a-Verifier 将验证视为 agentic 任务中一个尚未充分探索的 scaling 维度。
  • 该框架提供细粒度反馈,而非单一离散分数。
  • 该框架通过对 scoring-token logit 分布求期望来计算连续 reward。

9. 相关工作 · 附录

相关工作涵盖 test-time scaling、基于 LLM 的评判以及可验证奖励。这些方法分别通过增加计算量来改进推理、提供可扩展的输出评估,并为候选行为的选择或优化生成反馈。

  • 9. 相关工作: Test-time scaling 通过为审慎推理、搜索或候选生成分配额外的推理计算量来提升模型性能。
  • 9. 相关工作: Single-response scaling 通过提示模型生成中间推理过程 [25] [26]、将问题分解为更简单的子问题 [27],或对采样得到的推理路径进行边缘化 [28] 来提升性能。
  • 9. 相关工作: 其他 scaling 方法利用 test-time feedback 搜索中间思路 [29]、行动 [32] 或潜在世界状态
  • 9. 相关工作: LLM-as-a-judge 方法通过提示大型模型对生成的输出进行评分或比较,为人工评估提供了可扩展的替代方案。
  • 9. 相关工作: 基于评判器的评估通过基于概率和表单填写的评估器 [43] [44] 提取更丰富的评分信号,并利用 LLM 偏好进行基准式评估 [45] [46] [47]
  • 9. 相关工作: 可验证奖励模型将候选解、行动或轨迹转换为标量反馈,用于选择、监控或策略优化。

A. 局限性与未来工作 … B.3. LLM-as-a-Verifier 作为过程与结果奖励模型

LLM-as-a-Verifier 可跨 agent harness 泛化,同时支持过程验证和结果验证;但其当前依赖可访问的 scoring-token logits,且 scaling 轴仍不完整,这些问题推动了未来研究。高效的 tournament selection 在保持准确率提升的同时,进一步降低了验证成本。

  • A. 局限性与未来工作: 该框架当前要求 scoring-token logits,因此无法涵盖只能通过受限 API 使用的 frontier models。一种两阶段变通方案将闭源模型的推理交给具有可访问 logits 的开放 verifier,从而恢复大部分增益。
  • A. 局限性与未来工作: 所提出的 scaling 轴并不完整,因此未来可进一步研究 criteria decomposition。相关讨论将 criteria decomposition 确定为扩展该框架 scaling 方法的一个方向。
  • B. Additional Results and Analyses: Additional Results 使用 Terminus-Kira 搭配 Claude Opus 4.6,以及 Terminus-2 搭配 GPT-5.3-Codex,在主 Capy scaffold 之外评估 verifier;采样 N=5 条轨迹,设置 G=20 和 K=8。两个 harness 均使用相同的 Gemini 2.5 Flash verifier,以及 Section 4.3 中的三标准 decomposition。
  • B.1. Agent Harness Generalization on Terminal-Bench V2: LLM-as-a-Verifier 可跨 Terminus-Kira 和 Terminus-2 迁移,准确率分别达到 79.4% 和 71.2%,相较最强的相关 baseline 分别提升约 5 和 2.7 个百分点。这些增益在不同 harness 设置、观测格式和调优模型下均能保持,表明模型推理的是终止状态与任务进展,而非 scaffold 特定语法。
  • B.2. Probabilistic Pivot Tournament: Budget–Accuracy Trade-off: 当 k=3 且查询 4,723 个 pairs 时,66.17% 的 selection accuracy 已超过相近 verification budget 下的最佳 V1 结果;随着 pivot 数量增加,PPT 还会进一步提升。PPT 使用 ring pass 选择 pivots,仅将其余候选项与 pivots 比较,使验证成本从二次复杂度降至约 O(Nk)。
  • B.3. LLM-as-a-Verifier 作为过程与结果奖励模型: 在 SWE-Bench Lite、AIME 和 HMMT 上,相对 base model 的绝对 pass@1 提升分别为 9.5%、18.5% 和 21.3%;同时,LLM-as-a-Verifier 以低于 V1 [5] 的 budget 超过 pointwise 和 pairwise baselines。作为 PRM,随着每步采样 action 数从 1 增至 9,pass@1 也单调上升:TauBench 上从 48.7% 升至 55.7%,Terminal-Bench 上从 49.8% 升至 54.3%,且计算量比 V1 [5] 少 3×。

B.4. 案例研究:query-optimize

query-optimize 案例研究表明,verification 必须在 canonical、未修改的 database 上比较 outputs:对副本建立 index 会使检查失去 soundness,而等待 original query 则能进行有效 diff。在 16 条 traces 中,Gemini 2.5 Flash 都能可靠识别这一方法学错误。

  • 任务规范: 任务要求在保留其 output 的同时优化 OEWN SQLite query,并将一条以分号结尾的 query 保存到 /app/sol.sql。该 trajectory pair 使用 OpenHands harness,由 Claude Opus 4.5 提出方案,Gemini 2.5 Flash 进行 verification。
  • Ground-truth 分析: 失败的 trajectory 获得 reward 0,因为它在 canonical database 上比较 optimized query,却在建立了 index 的副本上运行 original query,从而改变了 physical access paths。两条 trajectories 都保存 optimized SQL 并通过 internal diff check,但只有一条与 hidden grader 的 result 一致。
  • Ground-truth 分析: 正确的 trajectory 等待 5m03s,让 original query 在 canonical database 上运行,随后执行 direct diff,exit code 为 0。这保留了任务的隐含要求:必须将 outputs 与 unindexed database 上的 original query 进行比较。
  • Gemini 2.5 Flash reasoning trace: 在启用 thinking 的 16 条 reasoning traces 中,Gemini 2.5 Flash 能可靠识别出,修改 copied database 违反了任务的 verification constraint。verifier 指出,在 agent 为获取 reference output 而对 database copy 建立 index 之前,original query 曾两次被中断。

B.5. 在 RoboRewardBench 上扩展重复评估与视觉上下文 · B.6. 为 logit 受限的前沿模型恢复连续奖励 · B.7. 将 LLM-as-a-Verifier 作为 RL 的稠密奖励

重复评估提升了 RoboRewardBench 的准确率,并可迁移到视觉机器人输入;同时,两阶段的 open-verifier 变通方案为 logit 受限的前沿模型恢复了连续奖励。附录还在其他实验条件匹配的情况下,规定了适用于 off-policy 和 on-policy RL 的基于 verifier 的稠密奖励。

  • B.5. 在 RoboRewardBench 上扩展重复评估与视觉上下文: RoboRewardBench 结果表明,尽管输入模态发生变化,重复评估带来的收益仍可从文本迁移到多帧机器人操作。在每个评估预算下,LLM-as-a-Verifier 都优于 LLM-as-a-Judge、TOPReward、RoboReward-8B 和 Robometer-4B。
  • B.5. 在 RoboRewardBench 上扩展重复评估与视觉上下文: 在 K=8 时,轨迹偏好准确率达到 87.4%,高于 K=1 时的 81.5%;LLM-as-a-Verifier 在各个预算下都优于所有基线。随着 K 增大并达到噪声下限,收益趋于饱和。
  • B.6. 为 logit 受限的前沿模型恢复连续奖励: 由于 GPT-5.5 和 Claude Opus 4.7 等前沿 API 可能只提供 completion 而不提供 token logprobs,直接替换 verifier 无法计算 Eq. 3.1。该变通方案将推理与评分解耦,从而恢复大部分经过校准的奖励信号。
  • B.6. 为 logit 受限的前沿模型恢复连续奖励: 两阶段 pipeline 让 GPT-5.5 生成自由形式的推理,再由 Gemini 2.5 Flash 使用评分 token 位置处的 logprobs 对该推理进行评分,以产生连续奖励。评估将任务、两条轨迹以及 GPT-5.5 的推理作为 Gemini 的输入。
  • B.6. 为 logit 受限的前沿模型恢复连续奖励: K=16 时提升 +2.1 points,且 zero ties,表明即使在测试的最大预算下,连续变通方案仍保持优势。Table 12 比较了离散 GPT-5.5 评分与 GPT-5.5-to-Gemini 2.5 Flash 连续 pipeline 的准确率和并列率。
  • B.7. 将 LLM-as-a-Verifier 作为 RL 的稠密奖励: 在 on-policy RL 中,GRPO 以权重 β=0.1 将组标准化的 Gemini 2.5 Flash 偏好加入正确性奖励和格式奖励。该设置在 Hendrycks MATH 上使用 Qwen3-8B,组大小为 M=16。
Loading 2607.05391v2…