Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: arXiv:2502.06781
- 年份: 2025
- 作者: Chengqi Lyu, Songyang Gao, Yuzhe Gu, Wenwei Zhang, Jianfei Gao, Kuikun Liu, Ziyi Wang, Shuaibin Li, Qian Zhao, Haian Huang, Weihan Cao, Jiangning Liu, Hongwei Liu, Junnan Liu, Songyang Zhang, Dahua Lin, Kai Chen
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 20
- 主题: outcome reward, binary feedback, RL, BoN, token-level reward model
摘要翻译¶
论文提出 OREAL,探索仅使用二元 outcome reward 训练数学推理模型的性能上限。作者证明,在二元反馈环境中,对 Best-of-N 采样得到的正轨迹做行为克隆足以学习 KL 正则化下的最优策略;同时,负样本需要 reward reshaping,才能保持正负样本梯度一致。为了缓解长 CoT 中 outcome reward 稀疏的问题,论文进一步训练 token-level reward model 来估计重要 token。实验中 7B 模型通过 RL 在 MATH-500 上达到 94.0 pass@1,32B 模型达到 95.0。
定位¶
这篇不是传统 ORM reranker 论文,而是 outcome reward based RL。它对 ORM 训练的启发在于:如何处理二元 outcome label 的稀疏性、如何筛选训练题、如何平衡正负样本,以及 token-level reward model 如何从最终 outcome 中学习 token 重要性。
方法¶
Section Preliminary 把数学推理视为 MDP:输入问题,模型输出长 reasoning trajectory,最终通过答案 verifier 得到 0/1 reward。
核心组件:
- Positive samples: 对 BoN 采样中选出的正确轨迹做 behavior cloning,作为
L1。 - Negative samples: 根据 BoN 分布和原采样分布的差异,对负样本 reward 做 reshaping,作为
L2。 - Long reasoning chains: 训练 token-level reward model
w(s_t),用二元 outcome reward 的 BCE loss 学习整条 trajectory 的正确概率;再用 token score 做 importance sampling。
Implementation 中的关键训练设置:
- base: Qwen2.5-7B / 32B,也测试 DeepSeek-R1-Distill-Qwen-7B 初始化。
- 每个问题采样 16 条 trajectory。
- 只保留 correctness rate 在 0 到 0.8 之间的问题,以增加训练难度。
- outcome reward 由 rule-based verifier + Qwen2.5-72B-Instruct generative verifier 共同提供,降低 rule verifier 的 false negative。
- 每批 64 个问题,每题 16 rollouts,max trajectory length 16384。
- 对 token-level RM 训练,每题只保留 1 条正确和 1 条错误 response,平衡正负样本。
- policy LR
5e-7,token-level RM LR2e-6,token-level RM 先 warmup 10 steps。 - 总训练 80 steps,每 10 steps eval,KL coefficient
0.01。 - token-level reward model 从 policy 同权重初始化,输出层换成一维线性层,且线性层权重初始化为 0。
实验¶
Table tab: main_res:
- OREAL-7B: MATH-500 91.0,OlympiadBench 59.9。
- OREAL-DSR1-Distill-Qwen-7B: MATH-500 94.0,OlympiadBench 66.1。
- OREAL-32B: MATH-500 95.0,AIME2025-I 46.7,LiveMathBench 74.8,OlympiadBench 72.4。
Table tab: ablation:
- Initial Policy: MATH-500 84.8。
-
- REINFORCE: 85.8。
-
- Reward Shaping: 86.6。
-
- Behavior Cloning: 87.6。
-
- Importance Sampling: 89.0。
-
- Skill-based Enhancement: 91.0。
局限¶
- 论文属于 RL 训练框架,和单纯训练 ORM reranker 的目标不同。
- outcome verifier 组合包含大模型 judge,复现实验时 judge 成本和一致性是关键变量。
- 数学答案可验证;主观任务的 outcome reward 更难定义。
ORM 训练启发¶
- 数据筛选非常重要:pass rate 太高或太低的问题对训练帮助有限。保留
0 < pass_rate < 0.8是一个实用经验。 - 二元 outcome label 不必只训练最后分数,也能训练 token-level reward/value,但要小心 credit assignment。
- 正负样本最好按 prompt 成对平衡,否则 RM 很容易学到题目难度或长度 shortcut。
- 如果 rule verifier 会漏判,可用强 LLM judge 补充,但要记录二者冲突。
- scalar head 零初始化可以避免训练初期 importance weight 偏置,这一点对 token-level reward model 尤其有用。
与其他论文关系¶
OREAL 与 OVM 都把 outcome supervision 扩展到 token/step 级信号;区别是 OVM 用于 guided decoding 的 value model,OREAL 用于 RL 中的 policy optimization 和 token importance。