Lightweight Latent Reasoning for Narrative Tasks¶
笔记时间:2026-07-21 评分:3 领域:narrative 子领域:latent_reasoning 方法:rl, latent 类型:method
元信息¶
- arXiv:2512.02240v2
- 日期:2026-06-09
- 作者:Alexander Gurung、Esmeralda S. Whitammer、Mirella Lapata
- 机构:University of Edinburgh;CIFAR Fellow
- 本地 PDF:
paper.pdf(24 页) - 可追溯源码:
source/main-10907-Gurung.tex - 解析文本:
main_en.md
定位¶
LiteReason 研究的不是如何让模型生成更长的推理链,而是如何在保留 RL 探索能力的同时,把部分显式推理压缩成连续 embedding,从而降低训练和推理成本。论文面向缺乏大规模高质量 reasoning trace 的长篇叙事任务,并在 Flawed Fictions 与 Next Chapter Prediction(NCP)上验证。
最重要的判断¶
LiteReason 是 RL 为主、SFT 为辅 的方法:
- SFT 只负责初始化并周期性刷新 Reasoning Projector,使其学会用少量连续 latent token 跨过被遮掉的显式推理句。
- GRPO 更新整个基础 LLM,使模型提高任务正确率,并学会何时生成
<implicit_thought>#</implicit_thought>、进入 latent mode。 - RL 时 latent token 本身不作为 policy action,Reasoning Projector 也不直接接收 policy gradient;作者每个 RL epoch 后追加一次 SFT,缓解 projector 与不断变化的 policy 脱节。
这一判断可追溯到论文 §3 “The LiteReason Framework”、§3.1 “Training LiteReason” 和 §6.3 “Does LiteReason Benefit from RL?”。
前置概念¶
普通自回归生成的每一步是:最后隐藏状态经过 LM Head 得到词表分布,采样一个离散 token,再把该 token 的 embedding 输入下一步。
LiteReason 增加一个小型 MLP——Reasoning Projector。在 latent mode 中,最后隐藏状态不经过 LM Head 采样文字,而由 projector 直接映射成一个连续 embedding,并把它作为下一步输入。因此中间“想法”不会被解码成可读文字。

图 1(方法框架,原论文 Figure 1)。 黄色是普通离散 token embedding,粉色是 Reasoning Projector 生成的连续 embedding。模型先正常采样 \(x_1\),遇到隐式思维标记 \(\langle\mathrm{bot}\rangle\) 后,按标记中的预算连续生成 \(e_0,e_1\),再回到 LM Head 生成 \(x_2\);一次回复可以多次切换。图中也能看出:基础 LM 冻结时,Projector 学的是如何用少量连续状态“接上”后续显式推理,而不是把被省略句子逐字复原。
方法流程¶
1. 收集正确推理轨迹¶
对每个训练 prompt 采样 \(n\) 条 reasoning trace,用任务 reward 过滤掉非正奖励轨迹。实验取 \(n=5\)。Flawed Fictions 的 reward 是最终 Yes/No 是否正确;NCP 使用 Contrastive Improvement。
2. 构造 latent-span SFT 数据¶
把推理轨迹按句切成 reasoning step,随机将比例 \(s_r\) 的句子替换成:
其中 # 是要执行的连续 latent step 数。实验使用 \(s_r\in\{10\%,25\%\}\)、token replacement ratio \(t_r=0.2\),约用一个 latent token 替代五个显式 token,并将每个被替换句子的 latent step 上限设为 5。
3. SFT 初始化 Reasoning Projector¶
冻结基础 LLM,只训练 projector;损失仍是未被遮掉的后续离散 reasoning token 的交叉熵。目标不是重建被遮掉句子的原文,而是让 latent embedding 携带足够信息,使模型能够继续生成后续推理与答案。
4. GRPO 训练 policy¶
整个基础 LLM 接受 GRPO 更新。模型生成 implicit-thought tag 时,切换到 latent mode;tag 中的整数决定执行多少次 projector。离散 token 采样是 policy action,确定性的 latent embedding 不是 action。
5. 周期性刷新 projector¶
基础 LLM 被 RL 更新后,隐藏状态分布和 reasoning trace 会变化,原 projector 可能过时。因此每个 RL epoch 后,作者用当前 epoch 的新轨迹再做一次 projector SFT。
最小例子¶
普通 CoT 可能输出:
LiteReason 可以学成:
tag 后执行两次连续 embedding 更新,用 latent state 代替中间两句显式文字。它不是简单删除文字:projector 必须让后续答案仍能利用被压缩的推理信息。
实验设置¶
- 主模型:Qwen2.5-7B-Instruct。
- Flawed Fictions:414 条,随机 70/15/15 划分;只做二元分类 Accuracy,不做 CEEval-Full 或错误句定位。
- NCP:1,347 条,平均约 6.5k input token,使用原数据集划分。
- Flawed Fictions 结果对完整 test set 重复采样 10 次并报告 run-level SEM。
- FF 使用 1 个 SFT epoch、30 个 RL epoch、batch size 48、group size 16;最大生成长度 2,048。
关键结果¶
Flawed Fictions:准确率与推理长度¶
| 方法 | Accuracy | 平均生成 token |
|---|---|---|
| Qwen2.5-7B | 57.26 ± 1.58 | 400.04 ± 6.50 |
| MoI | 58.06 ± 1.75 | 401.73 ± 6.57 |
| Soft Thinking | 57.42 ± 1.21 | 360.90 ± 2.96 |
| COCONUT | 50.65 ± 0.02 | 268.07 ± 6.68 |
| CoLaR | 53.71 ± 0.01 | 226.14 ± 10.00 |
| LiteReason | 87.42 ± 0.47 | 34.01 ± 0.38 |
| 普通 GRPO/RL | 88.71 ± 0.00 | 114.53 ± 2.01 |
来源:Table 5。LiteReason 获得普通 RL 从 57.26 提升到 88.71 所带来增益的 95.9%,但输出长度只有普通 RL 的约 30%。
性能—成本位置¶

图 3(Flawed Fictions,原论文 Figure 3)。 横轴越右越准确,纵轴越低生成越短。LiteReason(橙色菱形)在准确率上只略低于 RL-Trained(粉色三角),但平均生成长度进一步从约 115 token 降到 34 token;CoLaR、COCONUT 虽然也更短,却落在明显更低的准确率区域。

图 4(Next Chapter Prediction,原论文 Figure 4)。 横轴越右代表计划更能帮助生成真实下一章且更少泛化到无关章节,纵轴越低代表推理更短。LiteReason(橙色菱形)与普通 RL 同在 Pareto 前沿:它没有超过普通 RL 的质量,但以约 193 token 对 721 token 换取接近的任务表现;其余潜在推理方法在质量上存在明显差距。
训练与真实速度¶
- FF 的 RL 生成 token:普通 RL 61.4M,RL + LiteReason 29.0M,下降 52.8%。
- NCP:108.8M 降到 54.9M,下降 49.5%。
- 单样本 FF 推理:普通 RL 0.97 秒,LiteReason latent inference 0.31 秒。
- 单样本 NCP 推理:普通 RL 6.46 秒,LiteReason latent inference 1.84 秒。
来源:Tables 6–7。训练 token 统计没有计入未完整记录的 latent token,因此不能把 52.8% 直接解释成等比例 FLOPs 节省。
Length penalty¶
作者加入
后,LiteReason 在 FF 上达到 93.55% Accuracy、平均 6 token;普通 RL + length penalty 为 91.94%、16.65 token。来源:Table 8。
其他模型¶
Qwen3-4B-Instruct-2507 的结果为:base 33.23%,普通 RL 64.84%,LiteReason 57.42%。来源:Table 11。这说明 LiteReason 仍能提高弱基础模型,但恢复普通 RL 增益的比例低于 Qwen2.5-7B。
如何正确解释结果¶
- 论文最有力的结论是:token-space RL 的探索能力可以与间歇性的 latent reasoning 结合,并明显降低可见推理长度。
- 论文没有证明 latent reasoning 比普通 RL 更准确;主结果中普通 RL 略高于 LiteReason。它证明的是更好的 performance–compute trade-off。
- 93.55% 不是一个可与原 Flawed Fictions 论文中 Claude 3.5 Sonnet 76% 直接比较的 leaderboard 分数。LiteReason 在 FF 的 70% split 上进行过专项 SFT/RL,且只评测约 15% test split 的二元分类。
- 对 FF 而言,最终答案只有 Yes/No,length penalty 很容易把输出压到极短;这并不证明模型还能给出可靠的矛盾证据或自然语言解释。
局限¶
- Flawed Fictions 只评测短 split 的二元分类,没有 CEEval-Full、证据定位或 FlawedFictionsLong。
- 数据集只有 414 条,随机 test split 约 62 条;虽然重复采样 10 次能估计采样方差,却不能消除测试集规模和划分带来的不确定性。
- 主实验集中在 Qwen2.5-7B;Qwen3-4B 和 Gemma-3-1B 只做补充验证。
- 平均 token 数不等于 FLOPs、显存或实际成本。latent token 单步约比普通 token 贵 8%;训练 token 总数还漏记 latent token。
- 不同方法的推理实现不同,LiteReason 使用 vLLM,横向 token/速度比较仍可能受工程优化影响。
- implicit-thought tag 不是词表中的特殊 token,而是通过字符串变体检测和整数解析触发,工程上具有一定脆弱性。
- latent step budget 是局部固定整数,没有单独学习全局 halting policy;预算太小可能丢失密集信息,太大则削弱效率。
- Length penalty 没有做敏感性分析。作者指出,如果一个 GRPO group 全部回答错误,长度可能成为唯一奖励信号,从而把模型推向越来越短但仍错误的输出。
- latent-thought tag 的使用率在 RL 早期迅速上升、后期又可能下降,说明模型是否稳定依赖 latent path 尚未完全厘清。
与 Flawed Fictions 的关系¶
原论文把 Flawed Fictions 用作诊断未经专项训练的通用模型是否具有情节漏洞检测能力;LiteReason 把其中的二元分类子任务改造成 RLVR 训练环境。因此二者分别回答“原生能力有多强”和“针对性 RL 能否学会并压缩推理”,不能放进同一个 leaderboard 排序。