跳转至

title: Variation in Verification: Understanding Verification Dynamics in Large Language Models paper_id: 'OpenReview DcEuBwrWnB; arXiv:2509.17995' year: '2026'


Variation in Verification: Understanding Verification Dynamics in Large Language Models

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-03 评分:0 领域:verifier 方法:gen-verifier 类型:analysis

元信息

  • ID: OpenReview DcEuBwrWnB; arXiv:2509.17995
  • 年份: 2026 ICLR;arXiv v2: 2026-04-14
  • 作者: Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui, Shafiq Joty
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 47
  • 备注: OpenReview PDF 端点 HEAD 可见,但 GET 被 403 challenge 拦截;本地 PDF 下载自同题 arXiv 版本。
  • 主题: generative verifier, verification dynamics, test-time scaling, generator/verifier capability

摘要翻译

论文系统研究 generative verifier 的动态规律:模型先生成 verification CoT,再输出 Correct/Incorrect verdict。作者在数学、知识和自然语言推理的 12 个 benchmark 上,用 14 个 2B 到 72B 开源模型和 GPT-4o 同时作为 generator/verifier 做实验。主要发现是:题目越容易,verifier 越能识别正确答案;generator 越强,它产生的错误越难被识别;verifier 自身解题能力通常与验证能力相关,但这种相关性随题目难度变化。论文进一步讨论这些规律如何影响 test-time scaling 的 generator/verifier 选择。

定位

这篇是 verifier 使用策略论文。它不直接提出新 verifier 训练法,而是回答“什么时候 verifier 有用、用强 verifier 是否总值得、弱 generator 能否在验证后接近强 generator”。

动机

当前实践常默认用最强闭源模型当 verifier,但这可能浪费计算。验证不是单调随 verifier 规模提升的独立能力,它还被问题难度和被验证 generator 的错误形态影响。没有这些规律,很容易在 TTS 中错误分配 compute。

方法

论文把 verification 拆成三类因素:

  • problem difficulty:用多个 generator 的平均 pass rate 估计一个问题有多容易。
  • generator capability:模型生成正确答案的能力。
  • verifier generation capability:同一模型作为 generator 解题时的能力。

评估指标包括:

  • TPR:verifier 接受正确响应的概率。
  • TNR:verifier 拒绝错误响应的概率。
  • Balanced Accuracy:TPR 与 TNR 的平均。
  • TTS gain:从 generator 采样 K=64 个响应后,用 verifier 过滤保留 Correct 响应,对比未验证的 pass rate。

实验

关键结论:

  • 数据覆盖 12 个 benchmark:6 个数学、5 个知识、901 个自然语言推理问题,并使用 14 个开源模型加 GPT-4o。
  • RQ1: 题目越容易,TPR 越高;TNR 和问题难度没有稳定关系。论文解释为 verifier 往往会先自己解题再比较,难题上 verifier 自己也更容易解错。
  • RQ2: generator 越强,TNR 越低;例如 Qwen2.5-72B verifier 对 Llama-3.1-8B 生成错误的 TNR 为 0.68,但对 Qwen3-32B 生成错误的 TNR 降到 0.17。
  • RQ3: verifier 解题能力和验证准确率整体正相关,但在中等难度上最接近线性;在极难或极易区间出现平台期或非线性。
  • RQ4: 固定 GPT-4o verifier 时,Gemma2-9B 与 Gemma2-27B 的 post-verification gap 从 10.3% 缩到 2.5%,弥合 75.7% 原始差距。
  • D.5 显示在一组数学问题上,Qwen3-4B + GPT-4o verifier 的 pass rate 为 0.954,GPT-4o 直接作为 generator 为 0.952;前者 GPT-4o 平均 token 从 482 降到 193,约 2.5x token 节省。

局限

论文的 verifier 是通用 LLM 的 generative verdict,不等同于专门训练的 scalar RM 或 PRM。部分难度估计依赖 ground truth 做 oracle 分桶,虽然附录给了 label-free estimator 的复现实验。TTS 评估采用 verifier 过滤而不是复杂的 weighted aggregation,因此不是所有部署策略都覆盖。

ORM/Verifier 启发

  • Verifier 效果不能只看模型规模,要同时看题目难度和 generator 错误形态。
  • 强 generator 产生的错误更隐蔽,hard negatives 应来自强 generator,而不是弱模型的表层错误。
  • 在某些区间,用小 generator 多采样加强 verifier 可能比直接用强 generator 更省 token。
  • 中等难度题可能是训练/选择 verifier 最有信息量的区域;极易或极难题上 verifier 差距反而不明显。

与其他论文关系

它为 Hard2Verify 的现象提供机制解释:前沿模型错误更难抓,导致 verifier TNR 崩溃。也解释了 Mirror-Critique 和 Agentic Verifier 为什么需要更强的错误信号或主动反例搜索。