跳转至

OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-02 评分:0 领域:verifier, math 方法:orm, test-time 类型:method

元信息

  • ID: arXiv:2311.09724
  • 年份: 2024
  • 作者: Fei Yu, Anningzhe Gao, Benyou Wang
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 18
  • 主题: outcome-supervised value model, guided decoding, beam search, GSM8K, Game of 24

摘要翻译

论文认为,在数学推理的 guided decoding 中,评估一条未完成推理路径未来能否导向正确答案,往往比只判断当前 step 是否正确更有价值。作者提出 OVM,即用 outcome supervision 训练 value model,让模型优先选择能导向正确最终答案的中间步骤。OVM 不需要人工 step-level 标注,实验在 GSM8K 和 Game of 24 上取得强结果。

定位

OVM 不是传统“完整答案打分”的 ORM,而是把同样的 outcome label 扩展到中间 token/step,用于 value-guided planning。它的关键问题是:最终答案监督是否能训练一个对 partial path 有用的 value model?

方法

Section Method 和 Appendix Training Strategies 给出流程:

  • 每个训练问题采样 n 条完整 solution path。
  • 根据最终答案给整条 path 一个二元标签 y_o in {0,1}
  • 把这个 label 扩展成和 token 序列等长的标签向量。
  • value model 使用 generator 最终 unembedding 后的线性层输出 scalar value。
  • 损失是 MSE: ||f(q; S) - y||^2
  • 同时无权重联合 LM loss,继承 Cobbe et al. 的做法。

训练设置见 Appendix Implementation Details

  • generator: GSM8K 上 fine-tune Mistral-7B / Llama2-7B,2 epochs,batch size 128,max LR 1e-5
  • 采样 OVM 训练数据: 每题 100 条 path,temperature 0.7,top-k 50,top-p 1.0,max new tokens 400。
  • GSM8K 得到 747,300 个训练样本;Game of 24 得到 90,000 个训练样本。
  • OVM 初始化自对应 generator checkpoint。
  • GSM8K 上训练 1 epoch,batch size 512;Game of 24 因数据小训练 10 epochs,batch size 128。
  • LR: Llama2-7B 为 1e-5,Mistral-7B 为 2e-6

推理使用 value-guided beam search:

  • 每一步从当前 beam 采样候选 next steps。
  • 用 OVM 对 partial sequence 估值。
  • 保留 top-b valued sequences,直到完成或达到最大步数。

实验

关键结果来自 Section Overall Performance

  • Game of 24: fine-tuned Llama2-7B greedy 只有 11.0%,self-consistency K=100 为 11.7%,OVM K=20 达 78.7%,OVM K=100 达 98.3%。
  • GSM8K: OVM 在 7B 模型上达到强结果,并在 guided decoding baseline 中表现突出;论文称相较 CoRe 的 63.2%,OVM 达到 81.2%,提升 18 个百分点。
  • OVM 对完整路径验证和中间步骤 planning 都有用,但论文重点是后者。

局限

  • OVM 把最终 outcome label 复制到所有 token/step,早期 step 的 credit assignment 仍然粗糙。
  • 对 Game of 24 这种短路径、强可验证任务效果特别明显;长开放任务的 partial value 学习更难。
  • 论文的 PRM 对照依赖 GPT-4 标注或规则,跨任务泛化仍需谨慎。

ORM 训练启发

  • 如果 ORM 只做完整答案 rerank,最后 token score 足够;如果要做搜索或边生成边选择,可以训练 token/step-level value。
  • 对主观题 rerank,OVM 的思想可转化为“前缀质量/未来完成潜力”的 value model,但标签构造要更谨慎。
  • 学习率和初始化对 7B value model 很敏感:Mistral-7B 用 2e-6,Llama2-7B 用 1e-5,说明不能机械套同一 LR。
  • 采样数据要覆盖同题多路径;每题 100 条 path 是一个可复用起点。

与其他论文关系

Cobbe/Uesato/Lightman 主要讨论完整解答 verification。OVM 把 outcome supervision 从 reranking 推进到 planning,使 ORM 更接近 value model。