跳转至

Let's Verify Step by Step

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-02 评分:0 领域:verifier, math 方法:prm, test-time 类型:method, dataset

元信息

  • ID: arXiv:2305.20050
  • 年份: 2023
  • 作者: Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 29
  • 主题: PRM800K, process supervision, ORM baseline, best-of-N search

摘要翻译

论文比较 outcome supervision 与 process supervision 在复杂多步推理中的效果。作者发现,在 MATH 这个更难的数据集上,用 process supervision 训练 reward model 明显优于 outcome supervision。最佳 PRM 在 MATH 测试子集上使模型解出 78% 的题。论文还发布 PRM800K,包含 80 万个 step-level 人类反馈标签。

定位

这是 ORM 必读的反例和边界论文。它说明:当题目难度上升、错误步骤更隐蔽、false positive 更重要时,只看最终答案训练 ORM 会明显落后于 PRM。

方法

论文的评估对象是 reward model,不训练 generator RL。Section Scope 明确:固定 generator,reward model 的好坏由 best-of-N search 选中正确解答的能力评估。

ORM 训练见 Section Outcome-supervised Reward Models (ORMs) 和 Appendix ORM Training Details

  • 从 generator 均匀采样固定数量解答。
  • 根据最终答案自动判定 correct/incorrect。
  • 测试时使用最后 token 的 ORM 预测作为整条 solution score。
  • 训练方式与 Cobbe et al. 的 token-level verifier 基本相同:每个 solution token 都预测同一个 outcome label。
  • 与 Cobbe 不同的是:只训练 1 epoch,不用 dropout,也不联合 LM objective。

PRM 训练见 Section Process-supervised Reward Models (PRMs)

  • 每个 step 后预测该 step 的 correctness。
  • PRM 的 solution score 定义为所有 step 正确概率的乘积。
  • 标注只到第一个错误 step,以便和 outcome supervision 在信息量上更公平地比较。

数据收集:

  • PRM800K 包含 75K 条 solution、12K 道问题、800K step-level labels。
  • 主动学习优先标注 convincing wrong-answer solutions,即当前 PRM 高分但最终答案错误的样本。
  • 小规模合成实验用大 PRM 作为 oracle,研究 process vs outcome 和 active learning。

实验

关键结果:

  • Section Process vs Outcome Supervision: 在 small-scale 直接对比中,process supervision 在所有数据规模上都明显优于 outcome supervision。
  • 使用大 PRM 给 outcome label 比直接 final-answer checking 更好,因为它能缓解“答案对但推理错”的 false positive。
  • Section Active Learning: 选择 convincing wrong-answer 样本的 active learning 约有 2.6x 数据效率提升。
  • Abstract 中报告最佳 PRM 在 MATH 子集上达到 78.2% solve rate。

局限

  • PRM800K 成本高,主观/开放任务要复制这种 step-level 标注非常贵。
  • 论文评估的是 reward model 做 best-of-N selection,不讨论用 RM 做 RL 后 generator 的行为变化。
  • 结果强依赖 MATH 任务:答案可自动判定,但过程标注仍需人工。

ORM 训练启发

  • ORM 的评估必须看 best-of-N:reward loss 低不代表能选中正确解答。
  • 训练 ORM 时要构造 hard negatives,尤其是“看起来合理但最终错”或“答案对但推理错”的样本。
  • 如果数据是主观题,better/worse pair 要尽量选择“有迷惑性的 worse”,而不是显然低质样本。
  • 只有 outcome labels 时,可以把大模型 judge 或更强 verifier 当作 labeler,缓解 false positives。
  • 主动学习思路非常实用:用当前 RM 找高分坏样本,优先送去人工/LLM 标注。

与其他论文关系

这篇直接挑战 Cobbe/Uesato 中 ORM 的充分性。OVM 后续换了问题设定:不是拿 ORM 验完整解答,而是把 outcome supervision 用作 step-level value estimation。