Lightweight Latent Reasoning for Narrative Tasks¶
跳转:🌐 看原文 EN · 📖 看译文 ZH · 📄 看原文 PDF
笔记时间:2026-07-21 评分:0 领域:narrative 方法:rl, latent 类型:method
元信息¶
- arXiv:2512.02240v2
- 日期:2026-06-09
- 作者:Alexander Gurung、Esmeralda S. Whitammer、Mirella Lapata
- 机构:University of Edinburgh;Esmeralda S. Whitammer 同时标注 CIFAR Fellow
- 本地 PDF:
paper.pdf(24 页) - 可追溯源码:
source/main-10907-Gurung.tex - 解析文本:
main_en.md
定位¶
LiteReason 研究的不是如何让模型生成更长的推理链,而是如何在保留 RL 探索能力的同时,把部分显式推理压缩成连续 embedding,从而降低训练和推理成本。论文面向缺乏大规模高质量 reasoning trace 的长篇叙事任务,并在 Flawed Fictions 与 Next Chapter Prediction(NCP)上验证。
最重要的判断¶
LiteReason 是 RL 为主、SFT 为辅 的方法:
- SFT 只负责初始化并周期性刷新 Reasoning Projector,使其学会用少量连续 latent token 跨过被遮掉的显式推理句。
- GRPO 更新整个基础 LLM,使模型提高任务正确率,并学会何时生成
<implicit_thought>#</implicit_thought>、进入 latent mode。 - RL 时 latent token 本身不作为 policy action,Reasoning Projector 也不直接接收 policy gradient;作者每个 RL epoch 后追加一次 SFT,缓解 projector 与不断变化的 policy 脱节。
这一判断可追溯到论文 §3 “The LiteReason Framework”、§3.1 “Training LiteReason” 和 §6.3 “Does LiteReason Benefit from RL?”。
前置概念¶
普通自回归生成的每一步是:最后隐藏状态经过 LM Head 得到词表分布,采样一个离散 token,再把该 token 的 embedding 输入下一步。
LiteReason 增加一个小型 MLP——Reasoning Projector。在 latent mode 中,最后隐藏状态不经过 LM Head 采样文字,而由 projector 直接映射成一个连续 embedding,并把它作为下一步输入。因此中间“想法”不会被解码成可读文字。
方法流程¶
1. 收集正确推理轨迹¶
对每个训练 prompt 采样 $n$ 条 reasoning trace,用任务 reward 过滤掉非正奖励轨迹。实验取 $n=5$。Flawed Fictions 的 reward 是最终 Yes/No 是否正确;NCP 使用 Contrastive Improvement。
2. 构造 latent-span SFT 数据¶
把推理轨迹按句切成 reasoning step,随机将比例 $s_r$ 的句子替换成:
其中 # 是要执行的连续 latent step 数。实验使用 $s_r\in{10\%,25\%}$、token replacement ratio $t_r=0.2$,约用一个 latent token 替代五个显式 token,并将每个被替换句子的 latent step 上限设为 5。
3. SFT 初始化 Reasoning Projector¶
冻结基础 LLM,只训练 projector;损失仍是未被遮掉的后续离散 reasoning token 的交叉熵。目标不是重建被遮掉句子的原文,而是让 latent embedding 携带足够信息,使模型能够继续生成后续推理与答案。
4. GRPO 训练 policy¶
整个基础 LLM 接受 GRPO 更新。模型生成 implicit-thought tag 时,切换到 latent mode;tag 中的整数决定执行多少次 projector。离散 token 采样是 policy action,确定性的 latent embedding 不是 action。
5. 周期性刷新 projector¶
基础 LLM 被 RL 更新后,隐藏状态分布和 reasoning trace 会变化,原 projector 可能过时。因此每个 RL epoch 后,作者用当前 epoch 的新轨迹再做一次 projector SFT。
最小例子¶
普通 CoT 可能输出:
LiteReason 可以学成:
tag 后执行两次连续 embedding 更新,用 latent state 代替中间两句显式文字。它不是简单删除文字:projector 必须让后续答案仍能利用被压缩的推理信息。
实验设置¶
- 主模型:Qwen2.5-7B-Instruct。
- Flawed Fictions:414 条,随机 70/15/15 划分;只做二元分类 Accuracy,不做 CEEval-Full 或错误句定位。
- NCP:1,347 条,平均约 6.5k input token,使用原数据集划分。
- Flawed Fictions 结果对完整 test set 重复采样 10 次并报告 run-level SEM。
- FF 使用 1 个 SFT epoch、30 个 RL epoch、batch size 48、group size 16;最大生成长度 2,048。
关键结果¶
Flawed Fictions:准确率与推理长度¶
| 方法 | Accuracy | 平均生成 token |
|---|---|---|
| Qwen2.5-7B | 57.26 ± 1.58 | 400.04 ± 6.50 |
| MoI | 58.06 ± 1.75 | 401.73 ± 6.57 |
| Soft Thinking | 57.42 ± 1.21 | 360.90 ± 2.96 |
| COCONUT | 50.65 ± 0.02 | 268.07 ± 6.68 |
| CoLaR | 53.71 ± 0.01 | 226.14 ± 10.00 |
| LiteReason | 87.42 ± 0.47 | 34.01 ± 0.38 |
| 普通 GRPO/RL | 88.71 ± 0.00 | 114.53 ± 2.01 |
来源:Table 5。LiteReason 获得普通 RL 从 57.26 提升到 88.71 所带来增益的 95.9%,但输出长度只有普通 RL 的约 30%。
训练与真实速度¶
- FF 的 RL 生成 token:普通 RL 61.4M,RL + LiteReason 29.0M,下降 52.8%。
- NCP:108.8M 降到 54.9M,下降 49.5%。
- 单样本 FF 推理:普通 RL 0.97 秒,LiteReason latent inference 0.31 秒。
- 单样本 NCP 推理:普通 RL 6.46 秒,LiteReason latent inference 1.84 秒。
来源:Tables 6–7。训练 token 统计没有计入未完整记录的 latent token,因此不能把 52.8% 直接解释成等比例 FLOPs 节省。
Length penalty¶
作者加入
$$ r_{\text{length}}=-0.5\frac{|y|}{\text{max length}} $$
后,LiteReason 在 FF 上达到 93.55% Accuracy、平均 6 token;普通 RL + length penalty 为 91.94%、16.65 token。来源:Table 8。
其他模型¶
Qwen3-4B-Instruct-2507 的结果为:base 33.23%,普通 RL 64.84%,LiteReason 57.42%。来源:Table 11。这说明 LiteReason 仍能提高弱基础模型,但恢复普通 RL 增益的比例低于 Qwen2.5-7B。
如何正确解释结果¶
- 论文最有力的结论是:token-space RL 的探索能力可以与间歇性的 latent reasoning 结合,并明显降低可见推理长度。
- 论文没有证明 latent reasoning 比普通 RL 更准确;主结果中普通 RL 略高于 LiteReason。它证明的是更好的 performance–compute trade-off。
- 93.55% 不是一个可与原 Flawed Fictions 论文中 Claude 3.5 Sonnet 76% 直接比较的 leaderboard 分数。LiteReason 在 FF 的 70% split 上进行过专项 SFT/RL,且只评测约 15% test split 的二元分类。
- 对 FF 而言,最终答案只有 Yes/No,length penalty 很容易把输出压到极短;这并不证明模型还能给出可靠的矛盾证据或自然语言解释。
局限¶
- Flawed Fictions 只评测短 split 的二元分类,没有 CEEval-Full、证据定位或 FlawedFictionsLong。
- 数据集只有 414 条,随机 test split 约 62 条;虽然重复采样 10 次能估计采样方差,却不能消除测试集规模和划分带来的不确定性。
- 主实验集中在 Qwen2.5-7B;Qwen3-4B 和 Gemma-3-1B 只做补充验证。
- 平均 token 数不等于 FLOPs、显存或实际成本。latent token 单步约比普通 token 贵 8%;训练 token 总数还漏记 latent token。
- 不同方法的推理实现不同,LiteReason 使用 vLLM,横向 token/速度比较仍可能受工程优化影响。
- implicit-thought tag 不是词表中的特殊 token,而是通过字符串变体检测和整数解析触发,工程上具有一定脆弱性。
- latent step budget 是局部固定整数,没有单独学习全局 halting policy;预算太小可能丢失密集信息,太大则削弱效率。
- Length penalty 没有做敏感性分析。作者指出,如果一个 GRPO group 全部回答错误,长度可能成为唯一奖励信号,从而把模型推向越来越短但仍错误的输出。
- latent-thought tag 的使用率在 RL 早期迅速上升、后期又可能下降,说明模型是否稳定依赖 latent path 尚未完全厘清。
与 Flawed Fictions 的关系¶
原论文把 Flawed Fictions 用作诊断未经专项训练的通用模型是否具有情节漏洞检测能力;LiteReason 把其中的二元分类子任务改造成 RLVR 训练环境。因此二者分别回答“原生能力有多强”和“针对性 RL 能否学会并压缩推理”,不能放进同一个 leaderboard 排序。