Logical Reasoning with Outcome Reward Models for Test-Time Scaling¶
跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF
笔记时间:2026-07-02 评分:0 领域:verifier, logic 方法:orm, test-time 类型:method
元信息¶
- ID: arXiv:2508.19903
- 年份: 2025
- 作者: Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 11
- 主题: deductive logic, ORM, echo CoT, test-time scaling
摘要翻译¶
论文研究在演绎逻辑推理中使用 test-time scaling 和 Outcome Reward Model。作者用 CoT 单/多样本生成 ORM 训练数据,并提出 Echo Chain-of-Thought:利用 LLM 容易迎合提示中给定错误答案的行为,制造更多错误但看似合理的推理轨迹。实验显示,在 FOLIO、JustLogic 和 ProverQA 上,用 CoT 和 echo-augmented 数据训练的 ORM 可以提升多个 reasoner 的 test-time reranking 表现。
定位¶
这是把 ORM 从数学迁移到逻辑推理的近期论文。它对“如何造 hard negatives”尤其有价值,因为逻辑任务的错误不一定体现在数值计算上,而是体现在前提到结论的蕴含关系中。
方法¶
Section Outcome Reward Model for Logic 描述两类数据:
- CoT ORM 数据:对每个问题生成多条 step-by-step reasoning,要求 final answer 放在
\boxed{}中;最终答案匹配 gold label 则为 positive,否则 negative。 - EcCoT ORM 数据:故意在提示中给出错误答案,例如“Given the answer is True...”,诱导模型生成支持错误答案的推理。
- Echo 样本还会经过二级过滤:让 LLM 判断 reasoning 是否 logically follows from input,只保留“不容易被识别为错误”的 hard negatives。
训练目标本质是把第二个 LLM 训练成分类器,根据 reasoning sequence 预测 reward score。推理时用 ORM 对 N 条候选进行 Best-of-N rerank。
实验¶
Section Results and Discussion 给出主要观察:
- 单题多样本训练比单样本更有效;ProverQA 上从每题 1 条增加到 8 条后,ORM 超过 majority voting。
- EcCoT 通常优于普通 CoT,尤其在 FOLIO 小训练集上更稳健。
- ProverQA 和 JustLogic 数据量更大,CoT 和 EcCoT ORM 都带来明显收益。
- JustLogic 上 CoT ORM 接近 highest threshold,说明进一步提升受限于候选集中是否存在正确 rationale。
- FOLIO 部分 reasoner 的 majority vote 本来就很强,ORM 改进空间有限。
局限¶
- Echo 数据依赖 LLM 的迎合行为;不同 base model 或 judge model 下 hard negative 分布可能变化。
- 过滤 echo 样本仍依赖 LLM judge,可能引入 judge 偏差。
- 论文主要展示 test-time rerank,没有深入讨论 ORM calibration。
ORM 训练启发¶
- 主观或半主观任务的 ORM 不应只收集随机差样本,应主动构造“看起来合理但违反 rubric”的 hard negatives。
- Echo 技巧可泛化为:先强行给模型一个错误立场/不良约束,再筛出不明显错误的回答,作为
worse。 - 评估 ORM 时要看候选集上限:如果 N 条候选里没有好答案,reranker 不可能解决问题。
- 小数据集上,hard negative augmentation 可能比单纯增大模型更有效。
与其他论文关系¶
这篇继承 Cobbe/Lightman 的 Best-of-N ORM recipe,但把重点从数学答案匹配转向逻辑有效性和 hard negative 数据构造。它对开放式主观 rerank 数据建设也更接近。