title: 中文译文 · LLM-as-a-Verifier: A General-Purpose Verification Framework paper_id: 'arXiv:2607.05391v2' year: '2026'
LLM-as-a-Verifier: A General-Purpose Verification Framework¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: arXiv:2607.05391v2
- 年份: 2026
- arXiv v2: 2026-07-07
- 作者: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
- 团队: Stanford University, UC Berkeley, NVIDIA Research
- 项目:
https://llm-as-a-verifier.com - 代码:
https://github.com/llm-as-a-verifier/llm-as-a-verifier - 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 31
- 主题: LLM verifier, continuous scoring, scoring-token logits, test-time scaling, agent trajectory selection, dense reward
摘要翻译¶
论文提出 LLM-as-a-Verifier,一个不需要额外训练的通用 verification framework。与普通 LLM judge 直接生成离散分数不同,它读取 scoring-token logits,对评分 token 分布求期望,得到连续 verifier score。这个连续分数减少 tie,并支持三个 verification scaling 维度:score granularity、repeated evaluation、criteria decomposition。作者进一步提出 Probabilistic Pivot Tournament,用较低 pairwise comparison 成本从候选轨迹中选出最佳解。该方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench 上报告强结果,并展示 verifier score 可用于 progress tracking 和 RL dense reward。
定位¶
这篇试图把 verifier 从 domain-specific 方法推进为 general-purpose agent trajectory evaluator。它不是训练新 reward model,也不是让 verifier 自己生成答案,而是把已有 LLM/VLM 的评分 logits 转成细粒度连续信号,用于候选轨迹 reranking、进度估计和 reward shaping。
它的 headline 分数来自 candidate selection:
proposal generator / agent scaffold 产生 N 条候选轨迹
LLM-as-a-Verifier 对候选轨迹打连续分并做 pairwise ranking
提交 verifier 选出的最佳轨迹
因此它提升的是 test-time selection,不是单个模型直接解题能力。
动机¶
普通 LLM judge 通常输出离散分数,例如 1-5 分或 pass/fail。复杂 agent 任务中,多个候选轨迹很容易得到相同离散分,导致高 tie rate,无法有效区分轨迹质量。论文在 Terminal-Bench 上指出普通离散 judge 会出现约 27% tie。
训练专用 reward model 可以缓解部分问题,但受训练数据和领域分布限制。作者因此提出:直接利用 LLM 内部对 scoring tokens 的概率分布,不丢掉 logits 中的不确定性信息。
方法¶
Continuous verifier score¶
给定任务 x、候选轨迹 tau、评价标准 c,模型在 <score> 位置对一组有序 scoring tokens V_score = {v_1, ..., v_G} 给出概率分布。普通 judge 取最大概率 token 作为离散分数;LLM-as-a-Verifier 计算期望:
跨多个 criteria 和 repeated evaluations 后取平均:
再 normalize 到 [0, 1]。这个 continuous score 保留模型的不确定性,能把两个都被离散 judge 打成同一分数的轨迹进一步区分开。
G=20 表示 20 个有序 scoring tokens,对应更细粒度评分。G=1 不应理解成标准 0/1 打分,而是 granularity scaling 的最粗下界;论文的重点是评分 token 粒度越细,越能表达细微差异。
Pairwise preference¶
对两个候选轨迹 tau_i 和 tau_j,用 Bradley-Terry 模型把连续分数差转成偏好概率:
该概率主要用于 test-time ranking / candidate selection,不是训练 verifier 的 loss。本文主方法强调 training-free;后续 dense reward 实验是把 verifier score 用作 policy/RL 的 reward signal,而不是训练 verifier 本身。
Verification scaling¶
论文提出三个 scaling 维度:
- Score granularity
G: 更多 scoring tokens 带来更细分数空间,降低 tie,提高正负轨迹分离度。Terminal-Bench 上从G=1的 73.1% 提升到G=20的 77.5%。 - Repeated evaluation
K: 重复评分并平均,降低单次 judge 噪声。Terminal-Bench 上从K=1的 74.7% 提升到K=16的约 77.4%。 - Criteria decomposition
C: 拆分评价标准,降低整体判断复杂度和 prompt bias。单个 criterion 为 75.2%-76.4%,ensemble 后为 78.3%。
主实验默认使用 G=20、K=8、三 criteria decomposition。
Probabilistic Pivot Tournament¶
若 N 个候选轨迹全量两两比较,成本是 O(N^2)。论文提出 Probabilistic Pivot Tournament (PPT),用 pairwise preference probability 做 soft tournament:
- Ring pass: 将所有候选随机排成环,比较相邻 pair,使每个候选各出现在 A/B 位置一次,抵消位置偏置。
- Pivot selection: 根据 ring-pass 初步得分选 top-k pivots。
- Pivot rounds: non-pivots 与 pivots 比,pivots 之间互比,累计 soft wins,按 normalized score 选最佳候选。
成本从 O(N^2) 降为 O(Nk)。附录中 N=20 Terminal-Bench V2 轨迹上,PPT k=9 用 9,630 pair queries 达 67.13%,接近 full round-robin 13,111 queries 的 67.42%。
实验设置与结果¶
Terminal-Bench V2¶
- 候选来源:
N=5trajectories from GPT-5.5 under Capy scaffold。 - Verifier: Gemini 2.5 Flash。
- Pass@1: 83.1%。
- Oracle Pass@5: 92.1%。
- LLM-as-a-Verifier: 86.5%。
- 对比 leaderboard baselines: GPT-5.5 + NexAU-AHE 84.7%,Claude Mythos + Terminus-2 82.0%,Claude Opus 4.7 + WOZCODE 80.2%,Gemini 3.1 Pro + TongAgents 80.2%。
附录还在 Terminus-Kira / Terminus-2 harness 上复验,说明收益不完全依赖 Capy scaffold。
SWE-Bench Verified¶
- 候选来源:
N=3heterogeneous candidates,每题分别来自 Claude Opus 4.5、Gemini 3 Flash、MiniMax M2.5,使用 mini-swe-agent scaffold。 - Verifier: Gemini 2.5 Flash。
- Mean Pass@1: 76.1%。
- Oracle Pass@3: 84.4%。
- LLM-as-a-Verifier: 78.2%。
- 对比单模型: Claude Opus 4.5 76.8%,Gemini 3 Flash 75.8%,MiniMax M2.5 75.8%。
这个实验强调 verifier 能从不同模型家族产生的异构候选轨迹中选出更强解。
RoboRewardBench¶
- 输入: 机器人 rollout video pairs。
- Verifier: Qwen 3.6 35B VLM。
- LLM-as-a-Verifier preference accuracy: 87.4%。
- Baselines: 同 VLM 的 discrete LLM-as-a-Judge 70.8%,TOPReward 74.7%,Robometer-4B 78.8%,RoboReward-8B 81.4%。
- Human reward MAE: RoboReward-8B 为 1.11,使用 LLM-as-a-Verifier continuous rewards 后降到 0.72。
该结果说明 continuous score 不只改善排序,也能更贴近人类 reward 强度标注。
MedAgentBench¶
- 候选来源:
N=5trajectories from Claude Opus 4.8 with AgentBench harness。 - Pass@1: 70.2%。
- Oracle Pass@5: 75.0%。
- LLM-as-a-Verifier: 73.3%。
- Baselines: Opus 4.8 70.2%,Gemini 3.5 Flash 66.3%,GPT-5.5 65.1%。
Progress tracking¶
论文用 Value-Order Correlation (VOC) 衡量 verifier score 是否随 agent 轨迹推进而单调上升。
- Terminal-Bench V2: Gemini 2.5 Flash verifier 在 successful trajectories 上 Spearman VOC 0.848,在 failed trajectories 上 0.769。
- RoboRewardBench: Qwen 3.6 35B verifier VOC 0.966,超过 RoboReward-8B 0.877、Robometer-4B 0.780、TOPReward 0.565。
作者还实现 TurboAgent / Claude Code / Codex extension,将 live verifier score 展示给开发者,用于监控长时间 agent 任务。
Dense reward for RL¶
LLM-as-a-Verifier score 被用作 dense reward:
- LIBERO + DSRL-SAC: 约 1.8x sample efficiency improvement,最终 success rate 0.76 vs sparse baseline 0.69。
- MATH + Qwen3-8B + GRPO: 约 1.1x sample efficiency improvement。
这里 verifier 不是被训练,而是其连续分数作为 reward shaping / reasoning reward,缓解 sparse reward 和 group-relative advantage collapse。
局限¶
- 需要访问 scoring-token logits;很多闭源 frontier API 不提供 token-level logprobs。
- 附录提出 two-stage workaround:先让闭源强模型生成 reasoning,再把 reasoning 和候选轨迹交给开放 logprob verifier 读取连续 score。该方法可恢复大部分 gains,但增加系统复杂度。
- Criteria decomposition 目前主要人工设计,未来可学习或动态生成。
- Repeated evaluation 目前固定预算,未来可根据 verifier uncertainty 做 adaptive compute allocation。
- RL dense reward 实验仍偏初步,主要是 single-turn setting;真正 long-horizon multi-turn agent RL 的 per-step credit assignment 仍待验证。
- 结果依赖候选池质量;如果候选轨迹中没有正确或接近正确的解,verifier 无法凭空生成答案。
ORM/Verifier 启发¶
- 普通 LLM judge 的离散分数会浪费 logits 中的不确定性信息;连续分数能显著减少 tie。
- Verification scaling 可以像 generation scaling 一样被系统化调参:粒度、重复次数、criteria 拆分分别对应分辨率、方差和复杂度。
- Candidate selection 的真实上限由 oracle Pass@N 决定;verifier 的作用是恢复一部分 oracle headroom。
- PPT 说明 verifier compute 不一定要做全量两两比较,可以把预算集中在可能正确的候选附近。
- Continuous verifier score 可同时服务于 reranking、progress tracking 和 dense reward,是比单一 accept/reject 更通用的信号。
与其他论文关系¶
- 与 Hard2Verify: Hard2Verify 是高难开放式数学 step-level benchmark;LLM-as-a-Verifier 更关注通用 agent trajectory selection 和连续评分机制。
- 与 DeepVerifier: 二者都反对粗糙整体 judge;DeepVerifier 用 taxonomy + evidence check,LLM-as-a-Verifier 用 scoring-token logits + criteria decomposition。
- 与 Mirror-Critique: Mirror 通过训练 critique verifier 改善数学 TTS;LLM-as-a-Verifier 不训练 verifier,而是从已有 LLM logits 中提取连续信号。
- 与 Agentic Verifier: Agentic Verifier 是竞赛编程 domain-specific execution verifier;LLM-as-a-Verifier 试图做跨 coding、SWE、robotics、medical 的 general-purpose verifier。
- 与 Variation in Verification: Variation 解释 verifier 表现依赖题目、generator、verifier;LLM-as-a-Verifier 提供一种在多候选轨迹上更细粒度使用 verifier compute 的工程框架。