跳转至

Logical Reasoning with Outcome Reward Models for Test-Time Scaling

跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF

笔记时间:2026-07-02 评分:0 领域:verifier, logic 方法:orm, test-time 类型:method

元信息

  • ID: arXiv:2508.19903
  • 年份: 2025
  • 作者: Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi
  • 本地 PDF: paper.pdf
  • 解析文本: main_en.md
  • 页数: 11
  • 主题: deductive logic, ORM, echo CoT, test-time scaling

摘要翻译

论文研究在演绎逻辑推理中使用 test-time scaling 和 Outcome Reward Model。作者用 CoT 单/多样本生成 ORM 训练数据,并提出 Echo Chain-of-Thought:利用 LLM 容易迎合提示中给定错误答案的行为,制造更多错误但看似合理的推理轨迹。实验显示,在 FOLIO、JustLogic 和 ProverQA 上,用 CoT 和 echo-augmented 数据训练的 ORM 可以提升多个 reasoner 的 test-time reranking 表现。

定位

这是把 ORM 从数学迁移到逻辑推理的近期论文。它对“如何造 hard negatives”尤其有价值,因为逻辑任务的错误不一定体现在数值计算上,而是体现在前提到结论的蕴含关系中。

方法

Section Outcome Reward Model for Logic 描述两类数据:

  • CoT ORM 数据:对每个问题生成多条 step-by-step reasoning,要求 final answer 放在 \boxed{} 中;最终答案匹配 gold label 则为 positive,否则 negative。
  • EcCoT ORM 数据:故意在提示中给出错误答案,例如“Given the answer is True...”,诱导模型生成支持错误答案的推理。
  • Echo 样本还会经过二级过滤:让 LLM 判断 reasoning 是否 logically follows from input,只保留“不容易被识别为错误”的 hard negatives。

训练目标本质是把第二个 LLM 训练成分类器,根据 reasoning sequence 预测 reward score。推理时用 ORM 对 N 条候选进行 Best-of-N rerank。

实验

Section Results and Discussion 给出主要观察:

  • 单题多样本训练比单样本更有效;ProverQA 上从每题 1 条增加到 8 条后,ORM 超过 majority voting。
  • EcCoT 通常优于普通 CoT,尤其在 FOLIO 小训练集上更稳健。
  • ProverQA 和 JustLogic 数据量更大,CoT 和 EcCoT ORM 都带来明显收益。
  • JustLogic 上 CoT ORM 接近 highest threshold,说明进一步提升受限于候选集中是否存在正确 rationale。
  • FOLIO 部分 reasoner 的 majority vote 本来就很强,ORM 改进空间有限。

局限

  • Echo 数据依赖 LLM 的迎合行为;不同 base model 或 judge model 下 hard negative 分布可能变化。
  • 过滤 echo 样本仍依赖 LLM judge,可能引入 judge 偏差。
  • 论文主要展示 test-time rerank,没有深入讨论 ORM calibration。

ORM 训练启发

  • 主观或半主观任务的 ORM 不应只收集随机差样本,应主动构造“看起来合理但违反 rubric”的 hard negatives。
  • Echo 技巧可泛化为:先强行给模型一个错误立场/不良约束,再筛出不明显错误的回答,作为 worse
  • 评估 ORM 时要看候选集上限:如果 N 条候选里没有好答案,reranker 不可能解决问题。
  • 小数据集上,hard negative augmentation 可能比单纯增大模型更有效。

与其他论文关系

这篇继承 Cobbe/Lightman 的 Best-of-N ORM recipe,但把重点从数学答案匹配转向逻辑有效性和 hard negative 数据构造。它对开放式主观 rerank 数据建设也更接近。