Let's Verify Step by Step¶
跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF
笔记时间:2026-07-02 评分:0 领域:verifier, math 方法:prm, test-time 类型:method, dataset
元信息¶
- ID: arXiv:2305.20050
- 年份: 2023
- 作者: Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 29
- 主题: PRM800K, process supervision, ORM baseline, best-of-N search
摘要翻译¶
论文比较 outcome supervision 与 process supervision 在复杂多步推理中的效果。作者发现,在 MATH 这个更难的数据集上,用 process supervision 训练 reward model 明显优于 outcome supervision。最佳 PRM 在 MATH 测试子集上使模型解出 78% 的题。论文还发布 PRM800K,包含 80 万个 step-level 人类反馈标签。
定位¶
这是 ORM 必读的反例和边界论文。它说明:当题目难度上升、错误步骤更隐蔽、false positive 更重要时,只看最终答案训练 ORM 会明显落后于 PRM。
方法¶
论文的评估对象是 reward model,不训练 generator RL。Section Scope 明确:固定 generator,reward model 的好坏由 best-of-N search 选中正确解答的能力评估。
ORM 训练见 Section Outcome-supervised Reward Models (ORMs) 和 Appendix ORM Training Details:
- 从 generator 均匀采样固定数量解答。
- 根据最终答案自动判定 correct/incorrect。
- 测试时使用最后 token 的 ORM 预测作为整条 solution score。
- 训练方式与 Cobbe et al. 的 token-level verifier 基本相同:每个 solution token 都预测同一个 outcome label。
- 与 Cobbe 不同的是:只训练 1 epoch,不用 dropout,也不联合 LM objective。
PRM 训练见 Section Process-supervised Reward Models (PRMs):
- 每个 step 后预测该 step 的 correctness。
- PRM 的 solution score 定义为所有 step 正确概率的乘积。
- 标注只到第一个错误 step,以便和 outcome supervision 在信息量上更公平地比较。
数据收集:
- PRM800K 包含 75K 条 solution、12K 道问题、800K step-level labels。
- 主动学习优先标注 convincing wrong-answer solutions,即当前 PRM 高分但最终答案错误的样本。
- 小规模合成实验用大 PRM 作为 oracle,研究 process vs outcome 和 active learning。
实验¶
关键结果:
- Section
Process vs Outcome Supervision: 在 small-scale 直接对比中,process supervision 在所有数据规模上都明显优于 outcome supervision。 - 使用大 PRM 给 outcome label 比直接 final-answer checking 更好,因为它能缓解“答案对但推理错”的 false positive。
- Section
Active Learning: 选择 convincing wrong-answer 样本的 active learning 约有 2.6x 数据效率提升。 - Abstract 中报告最佳 PRM 在 MATH 子集上达到 78.2% solve rate。
局限¶
- PRM800K 成本高,主观/开放任务要复制这种 step-level 标注非常贵。
- 论文评估的是 reward model 做 best-of-N selection,不讨论用 RM 做 RL 后 generator 的行为变化。
- 结果强依赖 MATH 任务:答案可自动判定,但过程标注仍需人工。
ORM 训练启发¶
- ORM 的评估必须看 best-of-N:reward loss 低不代表能选中正确解答。
- 训练 ORM 时要构造 hard negatives,尤其是“看起来合理但最终错”或“答案对但推理错”的样本。
- 如果数据是主观题,
better/worsepair 要尽量选择“有迷惑性的 worse”,而不是显然低质样本。 - 只有 outcome labels 时,可以把大模型 judge 或更强 verifier 当作 labeler,缓解 false positives。
- 主动学习思路非常实用:用当前 RM 找高分坏样本,优先送去人工/LLM 标注。
与其他论文关系¶
这篇直接挑战 Cobbe/Uesato 中 ORM 的充分性。OVM 后续换了问题设定:不是拿 ORM 验完整解答,而是把 outcome supervision 用作 step-level value estimation。