title: Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers paper_id: 'arXiv:2509.23152' year: '2025'
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers¶
跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF
笔记时间:2026-07-03 评分:0 领域:verifier 方法:gen-verifier, rl 类型:method
元信息¶
- ID: arXiv:2509.23152
- 年份: 2025
- 作者: Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Yiwei Wang, Xiaodan Liang, Jing Tang
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 15
- 主题: critique verifier, RLVR verifier training, weighted voting, selective abstention, honesty
摘要翻译¶
论文提出 Mirror-Critique,用合成 critique 信号训练 verifier,以改善 test-time scaling 中的多解采样聚合。作者认为普通 reward model selection 常常找不到“少数但正确”的答案,因为 verifier 训练缺少解释性 critique 信号。Mirror-Critique 通过对比模型生成解和 ground-truth 解来合成 critique,再用 SFT 冷启动和 RLVR 训练 Mirror-Verifier。测试时 verifier 为每个候选解生成多条 critique,聚合为 verify score,用于 weighted voting 或 selective abstention,从而同时提升准确率和“知道自己不会”的 honesty。
定位¶
这是把 verifier 从二元打分器推进到“生成 critique 的 verifier”的一篇训练论文。它仍服务于 outcome selection,但核心监督信号不只是 correct/incorrect,而是“为什么错”的文本 critique。
动机¶
多数投票在 reasoning TTS 中有效,但当正确答案处于少数模式时会放大错误。传统 reward model selection 虽然比计数更灵活,却容易缺乏可解释错误信号。论文认为 critique 能教会 verifier 不只是判断结果,还能识别推理缺口,从而更适合 weighted voting 和拒答。
方法¶
Mirror-Critique 包含四个环节:
- 先用 RLVR 训练 solver,并记录训练轨迹中的候选解。训练源数据为 OpenR1-45K,它是 OpenR1-Math-220K 的子集。
- 用
Math-Verify过滤最终答案相同的冗余 trajectories,减少 critique 数据重复。 - 对每个问题,用模型生成解和 ground-truth solution 构造对比输入,让一个小 instruction-tuned model 合成 critique。prompt 明确要求 critique 不得提到 ground truth / official solution / correct answer,而要写成自然数学批改。
- 用 rejection sampling 过滤 critique:只有 critique 最后一行 True/False judgment 与候选解真实正确性一致时才保留。这个过滤保证最终判断方向正确,但不完全保证解释文本无噪声。
- 形成合成 critique 数据后,对 base LLM 做 SFT 冷启动。附录显示 base model 若没有 critique SFT,常会复读 system prompt 或候选解,几乎不能稳定生成合格 critique。
- 在平衡正负样本上继续用 RLVR 训练 verifier,避免样本不平衡导致模型总预测 False。除 1:1 正负平衡外,论文还只选择 question-solution pairs with accuracy rate
<60%进行进一步 RLVR,让 verifier 更关注 hard cases 和“少数但正确”的候选。
推理时,对每个候选 solution 生成 M 条独立 critique。verify score 是判为 True 的 critique 比例;实验中 M=16。最终答案通过按 verify score 加权的 majority voting 选择,但权重不是纯 w_i,而是 (w_i + beta),实验中 beta=0.15,用于保留一部分答案频率信息。
abstention 不是看最高单个 solution 分数,而是先选出最终 answer a_hat,再计算所有支持该答案的 solutions 的平均 verification score。如果该平均分低于阈值 tau,系统选择 abstain。
训练数据规模与来源¶
verifier 训练数据来自 OpenR1-45K 数学题,经 solver RLVR rollout、Math-Verify 去重、ground-truth 对照 critique 合成和 rejection sampling 得到。论文 Table 1 明确给出的 verifier 训练实例规模为:
- Mirror-SFT / Mirror-Verifier-1.5B: 170k instances。
- Mirror-SFT / Mirror-Verifier-7B: 116k instances。
这些数据不是人工 critique 标注,也不是闭源 GPT-4o 批量生成 critique;Mirror-Critique 的卖点之一是用 ground-truth solution 作为参照,以较低成本合成 critique 数据。
实验¶
评测使用 5 个数学 reasoning benchmark:MATH-500、OlympiadBench、Minerva-Math、AIME24、AMC23。
关键结果:
- Qwen2.5-Math-1.5B solver 下,majority@16 overall 为 55.7,Mirror-Verifier-1.5B 提升到 58.2。
- Qwen2.5-Math-7B solver 下,majority@16 overall 为 61.8,Mirror-Verifier-7B 提升到 63.0。
- honesty score 上,1.5B solver 的 majority@16 为 11.4,Mirror-Verifier-1.5B 为 32.7;7B solver 的 majority@16 为 23.6,Mirror-Verifier-7B 为 31.3。
- Synthetic critique quality 的人工核验为 80.0% 和 76.7%,说明 critique 仍有噪声但可用。
- 附录显示不平衡 RLVR 数据约 75% 为负样本时,模型会 reward hacking,倾向全部预测 False;改成 1:1 正负采样后训练更稳定。
- Accuracy 实验中
tau=0,强制不拒答,用来比较纯答案选择能力;honesty 实验中统一设tau=0.20,允许 abstain。 - Honesty Score 定义为:正确回答
+1,错误回答-1,abstain0。因此它直接惩罚错误输出,同时允许模型在低置信度时不答。 - Mirror-Verifier 训练时使用
K=8,但测试时可以扩展到K=16,说明该 verifier 不只是适配固定采样规模。
局限¶
论文没有给出大规模人工 critique 标注对照,合成 critique 的质量仍依赖 rejection sampling 和 judge。实验主要集中在数学题,且 honesty 的实际价值依赖阈值设定与用户是否接受 abstention。
ORM/Verifier 启发¶
- 对 verifier 训练,文本 critique 是比单个 outcome label 更丰富的监督信号。
- Weighted voting 可以把“候选答案频率”和“候选解质量”结合起来,缓解正确答案是少数模式的问题。
- 若要训练可拒答 verifier,训练和评估都要显式引入 honesty/abstention 指标。
- RLVR 训练 verifier 时正负样本平衡很关键,否则容易学到总是否定的 shortcut。
(w_i + beta)形式说明 voting 不能完全丢掉频率信号;高质量少数解和多数一致性都被纳入选择。- selective abstention 应基于最终答案组的平均 verification score,而不是单条最高分 solution,否则容易被偶然高分 critique 误导。
与其他论文关系¶
相对 Cobbe/Lightman 的 verifier/PRM 路线,这篇更重视 critique generation。它和 Hard2Verify 的需求互补:Hard2Verify 要求抓 step-level 错误,Mirror-Critique 则提供一种生成式错误解释训练方式。
与 Hard2Verify 的数据难度对比:
- Hard2Verify 是 benchmark,数据来自近期 IMO / Putnam / INMO 等高难竞赛题,78.5% 为 open-ended proof-style questions,由 GPT-5、Gemini 2.5 Pro、Claude Sonnet 4 生成响应,并由数学专家逐步标注 1,860 个 steps。
- Mirror-Verifier 的训练数据来自 OpenR1-45K / OpenR1-Math 体系,依赖 ground-truth answer / solution 进行自动 correctness 判断和 critique 合成,更接近传统可验证 final-answer 数学 RLVR 分布。
- 因此按题目开放性、generator 强度和验证要求看,Hard2Verify 难度显著高于 Mirror-Verifier 的训练数据;但二者用途不同,Hard2Verify 适合作为前沿 verifier benchmark,Mirror-Critique 的优势是能以较大规模训练 critique verifier。