title: 中文译文 · Variation in Verification: Understanding Verification Dynamics in Large Language Models
paper_id: 'OpenReview DcEuBwrWnB; arXiv:2509.17995'
year: '2026'
Variation in Verification: Understanding Verification Dynamics in Large Language Models¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: OpenReview
DcEuBwrWnB; arXiv:2509.17995 - 年份: 2026 ICLR;arXiv v2: 2026-04-14
- 作者: Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui, Shafiq Joty
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 47
- 备注: OpenReview PDF 端点 HEAD 可见,但 GET 被 403 challenge 拦截;本地 PDF 下载自同题 arXiv 版本。
- 主题: generative verifier, verification dynamics, test-time scaling, generator/verifier capability
摘要翻译¶
论文系统研究 generative verifier 的动态规律:模型先生成 verification CoT,再输出 Correct/Incorrect verdict。作者在数学、知识和自然语言推理的 12 个 benchmark 上,用 14 个 2B 到 72B 开源模型和 GPT-4o 同时作为 generator/verifier 做实验。主要发现是:题目越容易,verifier 越能识别正确答案;generator 越强,它产生的错误越难被识别;verifier 自身解题能力通常与验证能力相关,但这种相关性随题目难度变化。论文进一步讨论这些规律如何影响 test-time scaling 的 generator/verifier 选择。
定位¶
这篇是 verifier 使用策略论文。它不直接提出新 verifier 训练法,而是回答“什么时候 verifier 有用、用强 verifier 是否总值得、弱 generator 能否在验证后接近强 generator”。
动机¶
当前实践常默认用最强闭源模型当 verifier,但这可能浪费计算。验证不是单调随 verifier 规模提升的独立能力,它还被问题难度和被验证 generator 的错误形态影响。没有这些规律,很容易在 TTS 中错误分配 compute。
方法¶
论文把 verification 拆成三类因素:
- problem difficulty:用多个 generator 的平均 pass rate 估计一个问题有多容易。
- generator capability:模型生成正确答案的能力。
- verifier generation capability:同一模型作为 generator 解题时的能力。
评估指标包括:
- TPR:verifier 接受正确响应的概率。
- TNR:verifier 拒绝错误响应的概率。
- Balanced Accuracy:TPR 与 TNR 的平均。
- TTS gain:从 generator 采样
K=64个响应后,用 verifier 过滤保留 Correct 响应,对比未验证的 pass rate。
实验¶
关键结论:
- 数据覆盖 12 个 benchmark:6 个数学、5 个知识、901 个自然语言推理问题,并使用 14 个开源模型加 GPT-4o。
- RQ1: 题目越容易,TPR 越高;TNR 和问题难度没有稳定关系。论文解释为 verifier 往往会先自己解题再比较,难题上 verifier 自己也更容易解错。
- RQ2: generator 越强,TNR 越低;例如 Qwen2.5-72B verifier 对 Llama-3.1-8B 生成错误的 TNR 为 0.68,但对 Qwen3-32B 生成错误的 TNR 降到 0.17。
- RQ3: verifier 解题能力和验证准确率整体正相关,但在中等难度上最接近线性;在极难或极易区间出现平台期或非线性。
- RQ4: 固定 GPT-4o verifier 时,Gemma2-9B 与 Gemma2-27B 的 post-verification gap 从 10.3% 缩到 2.5%,弥合 75.7% 原始差距。
- D.5 显示在一组数学问题上,Qwen3-4B + GPT-4o verifier 的 pass rate 为 0.954,GPT-4o 直接作为 generator 为 0.952;前者 GPT-4o 平均 token 从 482 降到 193,约 2.5x token 节省。
局限¶
论文的 verifier 是通用 LLM 的 generative verdict,不等同于专门训练的 scalar RM 或 PRM。部分难度估计依赖 ground truth 做 oracle 分桶,虽然附录给了 label-free estimator 的复现实验。TTS 评估采用 verifier 过滤而不是复杂的 weighted aggregation,因此不是所有部署策略都覆盖。
ORM/Verifier 启发¶
- Verifier 效果不能只看模型规模,要同时看题目难度和 generator 错误形态。
- 强 generator 产生的错误更隐蔽,hard negatives 应来自强 generator,而不是弱模型的表层错误。
- 在某些区间,用小 generator 多采样加强 verifier 可能比直接用强 generator 更省 token。
- 中等难度题可能是训练/选择 verifier 最有信息量的区域;极易或极难题上 verifier 差距反而不明显。
与其他论文关系¶
它为 Hard2Verify 的现象提供机制解释:前沿模型错误更难抓,导致 verifier TNR 崩溃。也解释了 Mirror-Critique 和 Agentic Verifier 为什么需要更强的错误信号或主动反例搜索。