Solving math word problems with process- and outcome-based feedback¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: arXiv:2211.14275
- 年份: 2022
- 作者: Jonathan Uesato, Nate Kushman, Ramana Kumar, Francis Song, Noah Siegel, Lisa Wang, Antonia Creswell, Geoffrey Irving, Irina Higgins
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 29
- 主题: outcome feedback, process feedback, ORM, PRM, reranking, RL
摘要翻译¶
论文研究当语言模型生成逐步推理时,应该只监督最终结果,还是监督推理过程本身。作者在 GSM8K 上系统比较 outcome-based 和 process-based 方法。结论是:纯 outcome-based supervision 可以用更少标签达到相近的 final-answer error;但如果关心推理步骤本身是否正确,则需要 process-based supervision,或者使用能够近似 process feedback 的 learned reward model。论文将先前最好 final-answer error 从 16.8% 降到 12.7%,并把最终答案正确样本中的 reasoning error 从 14.0% 降到 3.4%。
定位¶
这是 ORM 与 PRM 的第一批系统对比。它不是只问“答案对不对”,而是同时度量 final-answer error 和 trace error,从而揭示 outcome supervision 的强项和盲点。
方法¶
Reward model 设计见 Section Reward models:
- ORM: 在每个 step 后预测一个
correct/incorrecttoken;标签来自整条样本的最终答案是否正确。也就是说,同一条解答中的所有 step 都共享最终 outcome label。 - PRM: 在每个 step 后预测当前 step 是否正确,标签由人工标注。
- ORM 训练时每个问题采样
K=96条,temperature 为1.0。 - ORM 使用 dropout
0.1,SFT-based setting 从 SFT model 初始化;few-shot-based setting 从 base pretrained LM 初始化。 - PRM 数据很小,只有 1560 条完整解答,因此先用 ORM 参数初始化 PRM,再把 learning rate 降到
1e-7。
Decoding 见 Section Decoding:
- 测试时先生成
K=96条完整解答。 - 无 RM 时用 majority voting。
- 有 RM 时用 RM-weighted decoding:按 final answer 聚合 RM 分数,选总分最高的答案,再在该答案组中选 RM 分最高的样本。论文说这比直接选最高 RM score 大约好 1% final-answer error。
实验¶
Table tab:results_overview 是核心结果:
- SFT + majority voting: trace error 11.4%,final-answer error 22.3%。
- SFT + ORM reranking: trace error 4.4%,final-answer error 14.8%。
- SFT + PRM reranking: trace error 3.5%,final-answer error 14.1%。
- SFT + ORM-RL + ORM reranking: trace error 3.4%,final-answer error 12.7%。
论文的关键观察:
- 如果目标只看 final answer,outcome supervision 很高效。
- ORM 虽然只用最终答案监督,却在很多时候近似 PRM 标签。Section
Additional RM analysis中,ORM 与 PRM step labels 的平均一致性高于它与自身 outcome labels 的一致性。 - 低 trace error 仍然需要 process feedback,或者需要一个实际学会检查过程的 ORM。
局限¶
- GSM8K 的最终答案可自动判定,且错误推理碰巧得到正确答案的比例相对有限。
- 对主观任务、开放式问答、长文写作等场景,outcome label 本身就可能带噪。
- RM-weighted decoding 依赖 final answer string matching,不适用于所有生成任务。
ORM 训练启发¶
- 主观题 rerank 可以借鉴 RM-weighted decoding 的思想:先按可聚合属性分组,再在组内选最高分。但主观题通常没有可靠 final answer,因此更常用直接 pairwise preference。
- 如果 PRM 数据少,先训练 ORM 再初始化 PRM 是一个实用路径。
- 训练集应优先包含“多数投票错或模型容易混淆”的题,PRM 标注预算才更有效。
- ORM 有可能学到过程正确性,但不能假设一定如此;要单独评估 trace quality 或 faithfulness。
与其他论文关系¶
这篇连接了 Cobbe et al. 2021 的 verifier recipe 和 Lightman et al. 2023 的 PRM800K。Lightman 后续在 MATH 上显示,PRM 在更难任务中明显强于 ORM。