跳转至

title: LLM-as-a-Verifier: A General-Purpose Verification Framework paper_id: 'arXiv:2607.05391v2' year: '2026'


LLM-as-a-Verifier: A General-Purpose Verification Framework

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-08 评分:5 领域:verifier 方法:gen-verifier, test-time 类型:framework

元信息

  • ID: arXiv:2607.05391v2
  • 年份: 2026
  • arXiv v2: 2026-07-07
  • 作者: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
  • 团队: Stanford University, UC Berkeley, NVIDIA Research
  • 项目: https://llm-as-a-verifier.com
  • 代码: https://github.com/llm-as-a-verifier/llm-as-a-verifier
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 31
  • 主题: LLM verifier, continuous scoring, scoring-token logits, test-time scaling, agent trajectory selection, dense reward

摘要翻译

论文提出 LLM-as-a-Verifier,一个不需要额外训练的通用 verification framework。与普通 LLM judge 直接生成离散分数不同,它读取 scoring-token logits,对评分 token 分布求期望,得到连续 verifier score。这个连续分数减少 tie,并支持三个 verification scaling 维度:score granularity、repeated evaluation、criteria decomposition。作者进一步提出 Probabilistic Pivot Tournament,用较低 pairwise comparison 成本从候选轨迹中选出最佳解。该方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench 上报告强结果,并展示 verifier score 可用于 progress tracking 和 RL dense reward。

定位

这篇试图把 verifier 从 domain-specific 方法推进为 general-purpose agent trajectory evaluator。它不是训练新 reward model,也不是让 verifier 自己生成答案,而是把已有 LLM/VLM 的评分 logits 转成细粒度连续信号,用于候选轨迹 reranking、进度估计和 reward shaping。

它的 headline 分数来自 candidate selection:

proposal generator / agent scaffold 产生 N 条候选轨迹
LLM-as-a-Verifier 对候选轨迹打连续分并做 pairwise ranking
提交 verifier 选出的最佳轨迹

因此它提升的是 test-time selection,不是单个模型直接解题能力。

动机

普通 LLM judge 通常输出离散分数,例如 1-5 分或 pass/fail。复杂 agent 任务中,多个候选轨迹很容易得到相同离散分,导致高 tie rate,无法有效区分轨迹质量。论文在 Terminal-Bench 上指出普通离散 judge 会出现约 27% tie。

训练专用 reward model 可以缓解部分问题,但受训练数据和领域分布限制。作者因此提出:直接利用 LLM 内部对 scoring tokens 的概率分布,不丢掉 logits 中的不确定性信息。

方法

Continuous verifier score

给定任务 x、候选轨迹 tau、评价标准 c,模型在 <score> 位置对一组有序 scoring tokens V_score = {v_1, ..., v_G} 给出概率分布。普通 judge 取最大概率 token 作为离散分数;LLM-as-a-Verifier 计算期望:

score = sum_g p(v_g | x, c, tau) * phi(v_g)

跨多个 criteria 和 repeated evaluations 后取平均:

R(x, tau) = average_{c,k} sum_g p(v_g | x, c, tau) * phi(v_g)

再 normalize 到 [0, 1]。这个 continuous score 保留模型的不确定性,能把两个都被离散 judge 打成同一分数的轨迹进一步区分开。

G=20 表示 20 个有序 scoring tokens,对应更细粒度评分。G=1 不应理解成标准 0/1 打分,而是 granularity scaling 的最粗下界;论文的重点是评分 token 粒度越细,越能表达细微差异。

Pairwise preference

对两个候选轨迹 tau_itau_j,用 Bradley-Terry 模型把连续分数差转成偏好概率:

P(tau_i > tau_j | x) = 1 / (1 + exp(-(R(x,tau_i) - R(x,tau_j))))

该概率主要用于 test-time ranking / candidate selection,不是训练 verifier 的 loss。本文主方法强调 training-free;后续 dense reward 实验是把 verifier score 用作 policy/RL 的 reward signal,而不是训练 verifier 本身。

Verification scaling

论文提出三个 scaling 维度:

  • Score granularity G: 更多 scoring tokens 带来更细分数空间,降低 tie,提高正负轨迹分离度。Terminal-Bench 上从 G=1 的 73.1% 提升到 G=20 的 77.5%。
  • Repeated evaluation K: 重复评分并平均,降低单次 judge 噪声。Terminal-Bench 上从 K=1 的 74.7% 提升到 K=16 的约 77.4%。
  • Criteria decomposition C: 拆分评价标准,降低整体判断复杂度和 prompt bias。单个 criterion 为 75.2%-76.4%,ensemble 后为 78.3%。

主实验默认使用 G=20K=8、三 criteria decomposition。

Probabilistic Pivot Tournament

N 个候选轨迹全量两两比较,成本是 O(N^2)。论文提出 Probabilistic Pivot Tournament (PPT),用 pairwise preference probability 做 soft tournament:

  1. Ring pass: 将所有候选随机排成环,比较相邻 pair,使每个候选各出现在 A/B 位置一次,抵消位置偏置。
  2. Pivot selection: 根据 ring-pass 初步得分选 top-k pivots。
  3. Pivot rounds: non-pivots 与 pivots 比,pivots 之间互比,累计 soft wins,按 normalized score 选最佳候选。

成本从 O(N^2) 降为 O(Nk)。附录中 N=20 Terminal-Bench V2 轨迹上,PPT k=9 用 9,630 pair queries 达 67.13%,接近 full round-robin 13,111 queries 的 67.42%。

实验设置与结果

Terminal-Bench V2

  • 候选来源: N=5 trajectories from GPT-5.5 under Capy scaffold。
  • Verifier: Gemini 2.5 Flash。
  • Pass@1: 83.1%。
  • Oracle Pass@5: 92.1%。
  • LLM-as-a-Verifier: 86.5%。
  • 对比 leaderboard baselines: GPT-5.5 + NexAU-AHE 84.7%,Claude Mythos + Terminus-2 82.0%,Claude Opus 4.7 + WOZCODE 80.2%,Gemini 3.1 Pro + TongAgents 80.2%。

附录还在 Terminus-Kira / Terminus-2 harness 上复验,说明收益不完全依赖 Capy scaffold。

SWE-Bench Verified

  • 候选来源: N=3 heterogeneous candidates,每题分别来自 Claude Opus 4.5、Gemini 3 Flash、MiniMax M2.5,使用 mini-swe-agent scaffold。
  • Verifier: Gemini 2.5 Flash。
  • Mean Pass@1: 76.1%。
  • Oracle Pass@3: 84.4%。
  • LLM-as-a-Verifier: 78.2%。
  • 对比单模型: Claude Opus 4.5 76.8%,Gemini 3 Flash 75.8%,MiniMax M2.5 75.8%。

这个实验强调 verifier 能从不同模型家族产生的异构候选轨迹中选出更强解。

RoboRewardBench

  • 输入: 机器人 rollout video pairs。
  • Verifier: Qwen 3.6 35B VLM。
  • LLM-as-a-Verifier preference accuracy: 87.4%。
  • Baselines: 同 VLM 的 discrete LLM-as-a-Judge 70.8%,TOPReward 74.7%,Robometer-4B 78.8%,RoboReward-8B 81.4%。
  • Human reward MAE: RoboReward-8B 为 1.11,使用 LLM-as-a-Verifier continuous rewards 后降到 0.72。

该结果说明 continuous score 不只改善排序,也能更贴近人类 reward 强度标注。

MedAgentBench

  • 候选来源: N=5 trajectories from Claude Opus 4.8 with AgentBench harness。
  • Pass@1: 70.2%。
  • Oracle Pass@5: 75.0%。
  • LLM-as-a-Verifier: 73.3%。
  • Baselines: Opus 4.8 70.2%,Gemini 3.5 Flash 66.3%,GPT-5.5 65.1%。

Progress tracking

论文用 Value-Order Correlation (VOC) 衡量 verifier score 是否随 agent 轨迹推进而单调上升。

  • Terminal-Bench V2: Gemini 2.5 Flash verifier 在 successful trajectories 上 Spearman VOC 0.848,在 failed trajectories 上 0.769。
  • RoboRewardBench: Qwen 3.6 35B verifier VOC 0.966,超过 RoboReward-8B 0.877、Robometer-4B 0.780、TOPReward 0.565。

作者还实现 TurboAgent / Claude Code / Codex extension,将 live verifier score 展示给开发者,用于监控长时间 agent 任务。

Dense reward for RL

LLM-as-a-Verifier score 被用作 dense reward:

  • LIBERO + DSRL-SAC: 约 1.8x sample efficiency improvement,最终 success rate 0.76 vs sparse baseline 0.69。
  • MATH + Qwen3-8B + GRPO: 约 1.1x sample efficiency improvement。

这里 verifier 不是被训练,而是其连续分数作为 reward shaping / reasoning reward,缓解 sparse reward 和 group-relative advantage collapse。

局限

  • 需要访问 scoring-token logits;很多闭源 frontier API 不提供 token-level logprobs。
  • 附录提出 two-stage workaround:先让闭源强模型生成 reasoning,再把 reasoning 和候选轨迹交给开放 logprob verifier 读取连续 score。该方法可恢复大部分 gains,但增加系统复杂度。
  • Criteria decomposition 目前主要人工设计,未来可学习或动态生成。
  • Repeated evaluation 目前固定预算,未来可根据 verifier uncertainty 做 adaptive compute allocation。
  • RL dense reward 实验仍偏初步,主要是 single-turn setting;真正 long-horizon multi-turn agent RL 的 per-step credit assignment 仍待验证。
  • 结果依赖候选池质量;如果候选轨迹中没有正确或接近正确的解,verifier 无法凭空生成答案。

ORM/Verifier 启发

  • 普通 LLM judge 的离散分数会浪费 logits 中的不确定性信息;连续分数能显著减少 tie。
  • Verification scaling 可以像 generation scaling 一样被系统化调参:粒度、重复次数、criteria 拆分分别对应分辨率、方差和复杂度。
  • Candidate selection 的真实上限由 oracle Pass@N 决定;verifier 的作用是恢复一部分 oracle headroom。
  • PPT 说明 verifier compute 不一定要做全量两两比较,可以把预算集中在可能正确的候选附近。
  • Continuous verifier score 可同时服务于 reranking、progress tracking 和 dense reward,是比单一 accept/reject 更通用的信号。

与其他论文关系

  • 与 Hard2Verify: Hard2Verify 是高难开放式数学 step-level benchmark;LLM-as-a-Verifier 更关注通用 agent trajectory selection 和连续评分机制。
  • 与 DeepVerifier: 二者都反对粗糙整体 judge;DeepVerifier 用 taxonomy + evidence check,LLM-as-a-Verifier 用 scoring-token logits + criteria decomposition。
  • 与 Mirror-Critique: Mirror 通过训练 critique verifier 改善数学 TTS;LLM-as-a-Verifier 不训练 verifier,而是从已有 LLM logits 中提取连续信号。
  • 与 Agentic Verifier: Agentic Verifier 是竞赛编程 domain-specific execution verifier;LLM-as-a-Verifier 试图做跨 coding、SWE、robotics、medical 的 general-purpose verifier。
  • 与 Variation in Verification: Variation 解释 verifier 表现依赖题目、generator、verifier;LLM-as-a-Verifier 提供一种在多候选轨迹上更细粒度使用 verifier compute 的工程框架。