跳转至

Solving math word problems with process- and outcome-based feedback

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-02 评分:0 领域:verifier, math 方法:orm, prm 类型:analysis

元信息

  • ID: arXiv:2211.14275
  • 年份: 2022
  • 作者: Jonathan Uesato, Nate Kushman, Ramana Kumar, Francis Song, Noah Siegel, Lisa Wang, Antonia Creswell, Geoffrey Irving, Irina Higgins
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 29
  • 主题: outcome feedback, process feedback, ORM, PRM, reranking, RL

摘要翻译

论文研究当语言模型生成逐步推理时,应该只监督最终结果,还是监督推理过程本身。作者在 GSM8K 上系统比较 outcome-based 和 process-based 方法。结论是:纯 outcome-based supervision 可以用更少标签达到相近的 final-answer error;但如果关心推理步骤本身是否正确,则需要 process-based supervision,或者使用能够近似 process feedback 的 learned reward model。论文将先前最好 final-answer error 从 16.8% 降到 12.7%,并把最终答案正确样本中的 reasoning error 从 14.0% 降到 3.4%。

定位

这是 ORM 与 PRM 的第一批系统对比。它不是只问“答案对不对”,而是同时度量 final-answer error 和 trace error,从而揭示 outcome supervision 的强项和盲点。

方法

Reward model 设计见 Section Reward models

  • ORM: 在每个 step 后预测一个 correct / incorrect token;标签来自整条样本的最终答案是否正确。也就是说,同一条解答中的所有 step 都共享最终 outcome label。
  • PRM: 在每个 step 后预测当前 step 是否正确,标签由人工标注。
  • ORM 训练时每个问题采样 K=96 条,temperature 为 1.0
  • ORM 使用 dropout 0.1,SFT-based setting 从 SFT model 初始化;few-shot-based setting 从 base pretrained LM 初始化。
  • PRM 数据很小,只有 1560 条完整解答,因此先用 ORM 参数初始化 PRM,再把 learning rate 降到 1e-7

Decoding 见 Section Decoding

  • 测试时先生成 K=96 条完整解答。
  • 无 RM 时用 majority voting。
  • 有 RM 时用 RM-weighted decoding:按 final answer 聚合 RM 分数,选总分最高的答案,再在该答案组中选 RM 分最高的样本。论文说这比直接选最高 RM score 大约好 1% final-answer error。

实验

Table tab:results_overview 是核心结果:

  • SFT + majority voting: trace error 11.4%,final-answer error 22.3%。
  • SFT + ORM reranking: trace error 4.4%,final-answer error 14.8%。
  • SFT + PRM reranking: trace error 3.5%,final-answer error 14.1%。
  • SFT + ORM-RL + ORM reranking: trace error 3.4%,final-answer error 12.7%。

论文的关键观察:

  • 如果目标只看 final answer,outcome supervision 很高效。
  • ORM 虽然只用最终答案监督,却在很多时候近似 PRM 标签。Section Additional RM analysis 中,ORM 与 PRM step labels 的平均一致性高于它与自身 outcome labels 的一致性。
  • 低 trace error 仍然需要 process feedback,或者需要一个实际学会检查过程的 ORM。

局限

  • GSM8K 的最终答案可自动判定,且错误推理碰巧得到正确答案的比例相对有限。
  • 对主观任务、开放式问答、长文写作等场景,outcome label 本身就可能带噪。
  • RM-weighted decoding 依赖 final answer string matching,不适用于所有生成任务。

ORM 训练启发

  • 主观题 rerank 可以借鉴 RM-weighted decoding 的思想:先按可聚合属性分组,再在组内选最高分。但主观题通常没有可靠 final answer,因此更常用直接 pairwise preference。
  • 如果 PRM 数据少,先训练 ORM 再初始化 PRM 是一个实用路径。
  • 训练集应优先包含“多数投票错或模型容易混淆”的题,PRM 标注预算才更有效。
  • ORM 有可能学到过程正确性,但不能假设一定如此;要单独评估 trace quality 或 faithfulness。

与其他论文关系

这篇连接了 Cobbe et al. 2021 的 verifier recipe 和 Lightman et al. 2023 的 PRM800K。Lightman 后续在 MATH 上显示,PRM 在更难任务中明显强于 ORM。