OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: arXiv:2311.09724
- 年份: 2024
- 作者: Fei Yu, Anningzhe Gao, Benyou Wang
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 18
- 主题: outcome-supervised value model, guided decoding, beam search, GSM8K, Game of 24
摘要翻译¶
论文认为,在数学推理的 guided decoding 中,评估一条未完成推理路径未来能否导向正确答案,往往比只判断当前 step 是否正确更有价值。作者提出 OVM,即用 outcome supervision 训练 value model,让模型优先选择能导向正确最终答案的中间步骤。OVM 不需要人工 step-level 标注,实验在 GSM8K 和 Game of 24 上取得强结果。
定位¶
OVM 不是传统“完整答案打分”的 ORM,而是把同样的 outcome label 扩展到中间 token/step,用于 value-guided planning。它的关键问题是:最终答案监督是否能训练一个对 partial path 有用的 value model?
方法¶
Section Method 和 Appendix Training Strategies 给出流程:
- 每个训练问题采样
n条完整 solution path。 - 根据最终答案给整条 path 一个二元标签
y_o in {0,1}。 - 把这个 label 扩展成和 token 序列等长的标签向量。
- value model 使用 generator 最终 unembedding 后的线性层输出 scalar value。
- 损失是 MSE:
||f(q; S) - y||^2。 - 同时无权重联合 LM loss,继承 Cobbe et al. 的做法。
训练设置见 Appendix Implementation Details:
- generator: GSM8K 上 fine-tune Mistral-7B / Llama2-7B,2 epochs,batch size 128,max LR
1e-5。 - 采样 OVM 训练数据: 每题 100 条 path,temperature 0.7,top-k 50,top-p 1.0,max new tokens 400。
- GSM8K 得到 747,300 个训练样本;Game of 24 得到 90,000 个训练样本。
- OVM 初始化自对应 generator checkpoint。
- GSM8K 上训练 1 epoch,batch size 512;Game of 24 因数据小训练 10 epochs,batch size 128。
- LR: Llama2-7B 为
1e-5,Mistral-7B 为2e-6。
推理使用 value-guided beam search:
- 每一步从当前 beam 采样候选 next steps。
- 用 OVM 对 partial sequence 估值。
- 保留 top-b valued sequences,直到完成或达到最大步数。
实验¶
关键结果来自 Section Overall Performance:
- Game of 24: fine-tuned Llama2-7B greedy 只有 11.0%,self-consistency K=100 为 11.7%,OVM K=20 达 78.7%,OVM K=100 达 98.3%。
- GSM8K: OVM 在 7B 模型上达到强结果,并在 guided decoding baseline 中表现突出;论文称相较 CoRe 的 63.2%,OVM 达到 81.2%,提升 18 个百分点。
- OVM 对完整路径验证和中间步骤 planning 都有用,但论文重点是后者。
局限¶
- OVM 把最终 outcome label 复制到所有 token/step,早期 step 的 credit assignment 仍然粗糙。
- 对 Game of 24 这种短路径、强可验证任务效果特别明显;长开放任务的 partial value 学习更难。
- 论文的 PRM 对照依赖 GPT-4 标注或规则,跨任务泛化仍需谨慎。
ORM 训练启发¶
- 如果 ORM 只做完整答案 rerank,最后 token score 足够;如果要做搜索或边生成边选择,可以训练 token/step-level value。
- 对主观题 rerank,OVM 的思想可转化为“前缀质量/未来完成潜力”的 value model,但标签构造要更谨慎。
- 学习率和初始化对 7B value model 很敏感:Mistral-7B 用
2e-6,Llama2-7B 用1e-5,说明不能机械套同一 LR。 - 采样数据要覆盖同题多路径;每题 100 条 path 是一个可复用起点。
与其他论文关系¶
Cobbe/Uesato/Lightman 主要讨论完整解答 verification。OVM 把 outcome supervision 从 reranking 推进到 planning,使 ORM 更接近 value model。