面向叙事任务的轻量级潜在推理¶
Alexander Gurung、Esmeralda S. Whitammer、Mirella Lapata
爱丁堡大学信息学院;Esmeralda S. Whitammer 同时为 CIFAR Fellow。
译者说明:本文译自 arXiv:2512.02240v2(2026-06-09)。公式、实验数字和章节结构均依据同目录 LaTeX 源码与正式 PDF 核对;为保证网页可读性,原文中的 LaTeX 表格已转换为 Markdown,长篇提示词保留其结构与关键差异。
摘要¶
大语言模型(LLM)通过生成长思维链或“推理轨迹”来解决复杂任务;在给定查询并生成输出的过程中,这些轨迹相当于潜变量。模型生成此类轨迹的能力可以通过强化学习(RL)优化,从而提高轨迹对答案预测的帮助。然而,这种优化的计算代价很高,尤其是叙事类任务往往需要检索和处理大量 token。
为此,我们提出 LiteReason:一种可以与标准 token 采样交错执行、也容易与 RL 方法结合的潜在推理方法。LiteReason 使用一个轻量级 Reasoning Projector(推理投影器),生成连续潜在 token,帮助模型“跳过”部分显式推理步骤。在 RL 期间,策略模型自行决定何时激活投影器,并按需在潜在推理和离散推理之间切换。
在情节漏洞检测与书籍下一章生成任务上的实验表明,LiteReason 优于其他潜在推理基线,性能接近非潜在的 RL 训练,同时把最终推理长度减少 77%–92%。总体而言,LiteReason 能够把 RL 训练引导到性能—计算权衡曲线中更高效的区域。
1 引言¶
通过生成中间 token 再预测最终答案的思维链(Chain-of-Thought, CoT)已经成为提升 LLM 能力的常用范式。后续工作进一步用 RL 优化这些推理轨迹;在数学与代码等答案可验证的领域,验证器可以直接提供奖励信号,因此进展尤其明显。最近,RL 也开始扩展到故事生成与故事理解等不可直接验证的领域。
但 RL 带来的性能提升常常伴随更长的推理轨迹,训练和推理成本也随之增加。潜在推理试图在连续空间而非离散 token 空间中执行部分推理。其动机有二:第一,显式轨迹中的许多 token 未必有助于预测答案;第二,人类的思考也并不总是语言化的。连续表示还可能保留那些在解码为文字时损失的信息,甚至用一个向量近似多个并行推理分支。
LiteReason 为基础 LLM 增加一个 Reasoning Projector,使模型既能通过普通离散采样生成文字,也能进入潜在推理模式生成连续 embedding。模型输出一个特殊的“隐式思维”标记后进入潜在模式;投影器经过预训练后,再通过 RL 微调基础模型,使其在完成任务的同时学会何时使用潜在 token。
我们聚焦两类叙事任务:
- Flawed Fictions:检测故事中的情节漏洞或连续性错误。
- Next Chapter Prediction(NCP):根据故事资料为下一章制定计划,再生成下一章。
这两类任务都要求模型在上千乃至上万 token 的故事上下文上进行推理。它们缺少大规模、高质量推理轨迹,而且输入故事十分多样,因此不能简单依赖已有轨迹蒸馏。LiteReason 的设计目标正是在保留语言模型探索能力的同时降低推理成本。
实验显示,LiteReason 在两个任务上都优于训练式和免训练式潜在推理方法,并获得非潜在 RL 性能增益的 69%–96%;训练期间少生成 50%–53% 的 token,推理期间少生成约 70% 的 token。
本文贡献如下:
- 提出一种把潜在推理与 RL 结合的方法,只依赖预训练 LLM,不要求预先存在推理轨迹数据集,适合低资源叙事任务。
- 在 Flawed Fictions 和 NCP 上,相较潜在推理与 RL 基线取得较强性能。
- 证明该方法能以显著更少的训练和推理 token 得到高效解。
2 相关工作¶
2.1 高效推理与潜在空间推理¶
RL 能够优化推理轨迹,但也容易使轨迹变长,因此研究者开始探索推理长度与任务性能之间的权衡。潜在推理大致分为两类。
免训练方法。 Soft Thinking 用 top-k token embedding 的概率加权混合作为下一步输入,并通过熵决定何时切回离散采样。Mixture of Inputs(MoI)同样混合 embedding,但使用贝叶斯估计确定权重。这类方法实现轻量,但此前主要在基础 CoT 准确率已经很高的数学、科学问答和代码任务上取得收益。
训练式方法。 COCONUT 把 LLM 最后一个隐藏状态直接作为下一步输入 embedding,并用课程学习逐步用隐藏状态替换显式推理。CoLaR 增加一个潜在头来预测被替换推理步骤的 token embedding,并在潜在 token 上直接做 RL。其他方法还包括 CoT2、CODI 和 Token Assorted。它们通常依赖较大的推理数据集,或要求基础模型已经能产生高质量轨迹。
LiteReason 与上述工作的差别在于:它让离散 token 与连续潜在 token 在同一次生成中交错出现;RL 的动作仍是离散 token,潜在步骤由投影器确定性地产生。
2.2 叙事任务¶
Flawed Fictions 通过可控方式向短篇故事注入情节漏洞,用于测试心理理论、状态追踪和整体叙事理解。NCP 则要求模型基于故事大纲、人物卡、前文摘要和上一章,规划并生成下一章。前者可通过 Yes/No 正确性验证,后者输出开放、篇幅长且语言多样,因此更难给出直接奖励。
3 LiteReason 框架¶
LiteReason 的设计建立在三个假设上:
- 没有大规模、高质量推理轨迹数据集,但任务能够给出回复级奖励。
- 输出与推理需要保持多样性,因此希望保留基础模型的一般语言能力。
- 基础模型已经具备一定推理能力,可以用它自己的正确轨迹初始化潜在推理模块。
唯一新增的架构组件是由少量 MLP 层构成的 Reasoning Projector。它读取最后一个隐藏状态,并预测一个与普通 token embedding 同维度的连续向量。普通情况下,隐藏状态进入 LM Head 并采样离散 token;潜在模式下,隐藏状态进入投影器,生成的连续向量直接作为下一步输入。

图 1。 黄色方块表示离散 token embedding,粉色方块表示连续潜在 embedding。模型遇到隐式思维标记后,不再经 LM Head 采样文字,而是连续调用 Reasoning Projector;达到标记指定的步数后,再回到离散生成。一次回复中可以多次切换。
3.1 训练 LiteReason¶
训练分为三个阶段。
阶段一:收集轨迹并构造 SFT 数据¶
对每个训练 prompt 采样 \(n\) 条推理轨迹,再用任务奖励做拒绝采样,只保留正奖励轨迹。Flawed Fictions 使用分类准确性,NCP 使用后文定义的 Contrastive Improvement。
随后按句子把轨迹切成推理步骤,并随机用如下标记替换比例为 \(s_r\) 的句子:
其中 # 是进入潜在模式的步数。每一步都把最后隐藏状态送入 Reasoning Projector,再把预测的 embedding 接到序列后。潜在步数按被替换句子的 token 数乘以 token replacement ratio \(t_r\) 得到。
阶段二:监督微调投影器¶
冻结基础 LLM 的全部参数,只训练 Reasoning Projector,并对未被遮蔽的后续显式推理 token 计算标准交叉熵损失。训练目标不是逐字重建被删掉的句子,而是让潜在 embedding 能够跨过这段缺口,使模型继续生成正确的后续推理。
由于后一个潜在 token 依赖前一个潜在 token,训练需要沿连续多步的潜在 rollout 反向传播。
阶段三:RL 训练¶
论文使用 GRPO,但方法本身不绑定某一种策略梯度算法。对每个训练样本,从旧策略 \(pi_{\text{old}}\) 采样一组输出 \(\{o_1,\ldots,o_G\}\),用组内归一化把奖励转换为 advantage,再更新策略。
RL 会更新整个基础 LLM,但不对潜在 token 的预测计算策略梯度:只有离散 token 采样被视为 action,潜在 embedding 是确定性中间计算。因此 Reasoning Projector 不在 RL 步骤中直接更新。
随着基础模型变化,原投影器可能与当前策略生成的隐藏状态和推理轨迹脱节。为此,每个 RL epoch 结束后,作者都用该 epoch 的新轨迹再执行一次投影器 SFT。去掉这一步的消融称为 LiteReason w/o SFT。
3.2 推理过程¶
推理默认处于离散模式。当最近生成内容匹配隐式思维标记时,系统解析其中的整数预算;若解析有效,就连续执行相应次数的 Reasoning Projector,然后恢复普通 token 采样。该标记不是词表中的特殊 token,而是通过字符串模式匹配触发。
潜在 token 单步计算约比普通 token 贵 8%,但模型最终生成的步骤数显著减少,因此总成本仍下降。
4 在叙事任务上的应用¶
| 数据集 | 样本数 | 平均输入 token | 来源 |
|---|---|---|---|
| Flawed Fictions | 414 | 约 900 | Project Gutenberg |
| NCP | 1,347 | 约 6.5k | 近年出版书籍 |
4.1 Flawed Fictions¶
模型读取故事并判断是否存在情节漏洞,最终回答 Yes 或 No。本文只评估原始二元分类任务,以 Accuracy 作为指标。RL 奖励是标准 RLVR 二值奖励:
4.2 Next Chapter Prediction¶
在第 \(i\) 章,推理模型 \(\pi_\theta^{\mathcal R}\) 读取故事信息 \(SI_i\),输出下一章计划 \(\hat p\);生成模型 \(\pi^{\mathcal G}\) 再根据故事信息和计划生成下一章 \(\hat c_{i+1}\):
两个模型都从 Qwen2.5-7B-Instruct 初始化,但只训练推理模型。原 NCP 工作使用 VR-CLI:若加入计划 \(a\) 后,真实下一章 \(y\) 在生成模型下的困惑度下降,就认为该计划更好:
作者发现,单独优化该目标会产生大量重复、通用的写作建议。于是加入一个来自其他书籍的随机章节 \(c^r\),构造对比奖励:
该奖励要求计划不仅能帮助预测真实下一章,还不能同样适用于无关章节。作者称其为 Contrastive Improvement,并把它同时用于 NCP 训练和自动评测。对比奖励把推理轨迹的 TTR 从 0.072 提高到 0.087(+20.8%),把最终计划的 TTR 从 0.046 提高到 0.136(+200.2%)。
5 实验设置¶
主实验使用 Qwen2.5-7B-Instruct。Flawed Fictions 随机按 70/15/15 划分;NCP 使用原数据集划分。
LiteReason 默认参数为 \(n=5\)、\(t_r=0.2\),并混合使用 \(s_r=10\%\) 与 \(25\%\) 的样本。换言之,约用一个潜在 token 替代五个显式推理 token;每个被替换句子的潜在步数最多为 5。
作者比较三种 LiteReason 变体:
- LiteReason:每个 RL epoch 后用新轨迹刷新投影器,并用 prompt 鼓励隐式思维标记。
- LiteReason w/o SFT:保留初始化投影器,但 RL 期间不再刷新。
- LiteReason w/o RP:RL 后不使用投影器,只通过 prompt 要求模型跳过推理步骤。
基线包括免训练的 MoI、Soft Thinking,训练式的 COCONUT、CoLaR,以及不使用潜在推理的 RL-Trained。所有训练式方法都按验证集性能选取最佳 checkpoint。
5.1 人类评测¶
NCP 还通过成对比较评估生成章节的情节、创造力、发展、语言使用、人物和总体偏好。比较对象为默认 Qwen、RL-Trained、MoI、CoLaR 和 LiteReason;每一对方法收集 20 次比较,并用 Bradley–Terry 模型拟合相对强度。
6 结果¶
6.1 设计消融¶
| 方法 | FF Accuracy | FF 平均 token | NCP Contrastive Improvement | NCP 平均 token |
|---|---|---|---|---|
| Qwen2.5-7B | 57.26 ± 1.58 | 400.04 ± 6.50 | 0.067 ± 0.001 | 831.85 ± 8.26 |
| RL-Trained | 88.71 ± 0.00 | 114.53 ± 2.01 | 0.666 ± 0.01 | 721.33 ± 6.01 |
| LiteReason | 87.42 ± 0.47 | 34.01 ± 0.38 | 0.478 ± 0.01 | 193.11 ± 2.02 |
| w/o SFT | 85.48 ± 0.00 | 8.26 ± 0.17 | 0.560 ± 0.01 | 622.23 ± 1.82 |
| w/o RP | 87.58 ± 0.76 | 260.81 ± 3.68 | 0.449 ± 0.01 | 983.49 ± 5.30 |
完整 LiteReason 在性能与 token 节省之间最均衡:它分别获得非潜在 RL 在 FF 和 NCP 上性能增益的 95.9% 与 68.6%,同时生成的推理 token 少三倍以上。w/o SFT 在 FF 上更短但略弱,在 NCP 上奖励更高却长得多,说明周期性 SFT 的作用取决于任务难度和数据规模。只靠 prompt 跳步的 w/o RP 不仅轨迹更长,性能也低于 RL-Trained。
RL 早期,模型使用潜在思维的频率会快速上升,但到训练后期有时又下降。后续工作可以通过提高隐式标记概率或改变 prompt,更直接地控制潜在推理使用率。
6.2 与其他潜在推理方法比较¶
| 方法 | FF Accuracy | FF token | NCP Contrastive Improvement | NCP token |
|---|---|---|---|---|
| Qwen2.5-7B | 57.26 | 400.04 | 0.067 | 831.85 |
| MoI | 58.06 | 401.73 | 0.045 | 829.14 |
| Soft Thinking | 57.42 | 360.90 | 0.013 | 966.73 |
| COCONUT | 50.65 | 268.07 | 0.083 | 361.84 |
| CoLaR | 53.71 | 226.14 | 0.118 | 218.40 |
| LiteReason | 87.42 | 34.01 | 0.478 | 193.11 |
| RL-Trained | 88.71 | 114.53 | 0.666 | 721.33 |
LiteReason 在两个任务上都显著超过已有潜在推理方法。免训练方法与基础模型的性能和长度接近;COCONUT 与 CoLaR 更像是在压缩现有能力,未能通过小规模叙事数据上的训练得到足够探索。人类评测趋势与 Contrastive Improvement 基本一致:RL-Trained 最好,LiteReason 次之,随后与其他方法拉开明显差距。
6.3 LiteReason 是否受益于 RL?¶
CoLaR 直接在潜在空间做 RL,但实验中 RL 前后提升很小。LiteReason 则从接近默认模型的水平上升到接近非潜在 RL 上界。作者据此认为,token 空间的 RL 探索与间歇性的确定性潜在步骤更容易兼容。
6.4 RL 训练和实际推理效率¶
| 方法 | FF 训练 token | NCP 训练 token |
|---|---|---|
| RL | 61.4M | 108.8M |
| RL + LiteReason | 29.0M(-52.8%) | 54.9M(-49.5%) |
训练步数和样本数相同的情况下,LiteReason 让 RL 期间生成的离散 token 约减半。推理时,相较基础模型,NCP 少生成 77%,FF 少生成 92%;相较 RL-Trained,LiteReason 的轨迹在 FF 上短 73%,在 NCP 上短 70%。
| 任务 | 模型 | 使用潜在模式 | 单样本耗时(秒) | 全测试集批处理耗时/样本(秒) |
|---|---|---|---|---|
| FF | Base | 否 | 3.10 ± 0.28 | 0.13 ± 0.02 |
| FF | RL-Trained | 否 | 0.97 ± 0.02 | 0.06 ± 0.00 |
| FF | LiteReason | 否 | 0.83 ± 0.16 | 0.20 ± 0.10 |
| FF | LiteReason | 是 | 0.31 ± 0.01 | 0.03 ± 0.00 |
| NCP | Base | 否 | 8.02 ± 0.35 | 0.43 ± 0.01 |
| NCP | RL-Trained | 否 | 6.46 ± 0.16 | 0.42 ± 0.02 |
| NCP | LiteReason | 否 | 2.21 ± 0.02 | 0.26 ± 0.04 |
| NCP | LiteReason | 是 | 1.84 ± 0.03 | 0.23 ± 0.00 |

图 3。 横轴越右表示准确率越高,纵轴越低表示生成 token 越少。LiteReason(橙色菱形)与 RL-Trained(粉色三角)都位于性能—成本前沿;LiteReason 牺牲很小的准确率,换取显著更短的输出。

图 4。 横轴越右表示 Contrastive Improvement 越高,纵轴越低表示生成 token 越少。LiteReason 与 RL-Trained 同处 Pareto 前沿,而其他潜在推理方法在性能上明显落后。
6.5 是否保留通用能力?¶
作者在 GSM-Hard、AIME-2025 和 MMLU-Redux 上测试迁移能力。Qwen2.5-7B 版本的 LiteReason 与 RL-Trained 基本保留基础模型能力,而且 LiteReason 通常生成更少 token。COCONUT 在各种设置下都显著退化;CoLaR 在 FF 训练后相对稳定,但在 NCP 训练后出现明显性能崩塌。
6.6 不同模型规模与家族¶
在更弱的 Qwen3-4B-Instruct-2507 上,基础 FF 准确率只有 33.23%。RL-Trained 达到 64.84%,LiteReason 达到 57.42%,平均 token 分别为 1078.57 与 995.38。LiteReason 仍显著优于基础模型,但恢复非潜在 RL 增益的比例低于主实验。
6.7 与长度奖励是否兼容?¶
作者借鉴 DAPO,对截断回复给零奖励,并加入:
| 方法 | FF Accuracy | 平均 token |
|---|---|---|
| RL-Trained | 88.71 ± 0.00 | 114.53 ± 2.01 |
| RL-Trained + 长度惩罚 | 91.94 ± 0.34 | 16.65 ± 4.43 |
| LiteReason | 87.42 ± 0.47 | 34.01 ± 0.38 |
| LiteReason + 长度惩罚 | 93.55 ± 0.00 | 6.00 ± 0.00 |
在二元分类任务 FF 上,长度惩罚本身就很有效,与 LiteReason 结合后同时获得最高准确率和最短输出。作者认为这体现了 RL 中心设计的可组合性,但没有在长篇 NCP 上尝试同一奖励。
6.8 数学任务¶
在 GSM-Hard 上,以 Gemma-3-1B-IT 为基础:
| 方法 | Accuracy | 平均 token |
|---|---|---|
| Base | 14.70 ± 0.39 | 932.82 ± 20.28 |
| RL-Trained | 15.91 ± 0.96 | 941.13 ± 15.08 |
| LiteReason | 15.76 ± 0.28 | 849.92 ± 19.84 |
| CoLaR | 1.14 ± 0.15 | 978.24 ± 10.88 |
| COCONUT | 1.52 ± 0.00 | 25.12 ± 0.02 |
LiteReason 在弱基础模型上仍保持接近 RL-Trained 的性能,并减少约 10% token;CoLaR 与 COCONUT 则发生严重性能崩塌。
7 结论¶
LiteReason 是面向叙事领域的潜在推理方法:它训练轻量级 Reasoning Projector 产生信息充分的连续潜在 token,并让 LLM 在离散采样与潜在思维之间交错切换。
在 Flawed Fictions 和 NCP 上,LiteReason 比现有潜在推理基线更接近传统 RL 的性能,同时训练生成 token 少一半以上,推理轨迹缩短约 70%,并更好地保留通用能力。作者认为,这是首次把连续潜在推理应用到叙事任务,也是首次在 RL 期间把潜在推理与离散 token 采样交错,使模型可以自行决定何时使用潜在 token。
后续方向包括改进投影器结构、递归更新潜在思维,以及把潜在信息注入 token embedding 层之外的位置。
附录 A:对比式 VR-CLI¶
原 VR-CLI 容易鼓励“这一章很有趣”之类可套用于任何文本的通用建议。对比项从其他书中均匀随机选择章节,并减去计划对该随机章节的帮助,从而要求计划更加针对当前故事。实验中的 \(\gamma\) 始终取 0.5。
样例显示,未加对比奖励的计划大量重复“本章结束于……”等泛化表述;加入对比奖励后,推理会引用具体角色、指控、人物关系和下一章梗概,最终计划也更具体。
附录 B:prompt 与 RL 的影响¶
隐式思维 prompt 在普通任务指令上增加如下说明:模型可以在推理中输出 <implicit_thought>number</implicit_thought>,其中 number 为 1–5,表示该思维的复杂度;使用它时可以跳过原本要说出的句子并继续推理。作者建议在推理中部使用,而不是开头或结尾。
移除该说明通常会使使用 Reasoning Projector 的模型准确率略升,但推理轨迹显著变长。因此 prompt 可以作为测试时调节性能—效率权衡的手段。RL 前后比较进一步显示:LiteReason 明显受益于 RL,而 CoLaR 的改善有限。
附录 C:性能—成本曲线¶
作者把任务奖励作为性能、生成 token 数作为成本绘图。FF 与 NCP 的结果都表明 LiteReason 推进了 Pareto 前沿:它与非潜在 RL 性能接近,但成本显著更低;其他方法要么成本较高,要么性能明显不足。
附录 D:训练与超参数¶
- LiteReason:SFT 学习率 \(10^{-4}\),RL 学习率 \(5\times10^{-7}\),最大生成长度 2048,\(t_r=0.2\),\(s_r=(10\%,25\%)\)。FF:SFT 1 epoch、RL 30 epoch、batch size 48、group size 16;NCP:SFT 2 epoch、RL 20 epoch、batch size 64、group size 8。
- CoLaR:SFT/RL 学习率相同,压缩因子 5,最大 64 个 latent;训练轮数和 batch 设置与 LiteReason 对齐。
- COCONUT:学习率 \(5\times10^{-5}\),14 epoch,每个推理步骤一个 continuous thought,每阶段 2 epoch,共 10 个 latent stage。
- MoI:在验证集上搜索 \(\beta\in\{0.25,0.5,1,2,4\}\);FF 选 0.5,NCP 选 4。
- 免训练方法:搜索 temperature 0.6/0.7、top-p 0.8/0.95、top-k 20/30;Soft Thinking 还搜索 Gumbel/Dirichlet 设置。
附录 E:报告方法与限制¶
NCP 指标取整个测试集上 \(k=5\) 次运行的平均,FF 取 \(k=10\);报告的 \(\pm\mathrm{SEM}\) 是运行级均值的标准差除以 \(\sqrt{k}\),反映 LLM 采样带来的运行间波动。
除训练期 token 统计表外,报告的 token 数包含生成的潜在 token。训练期没有完整记录所有 latent token,因此 50% 左右的离散 token 降幅不能直接等价为 FLOPs 或显存降幅。不同方法的推理实现也不同:LiteReason 与 vLLM 集成,而其他训练式潜在方法未必有同等工程优化。论文因此另行报告 wall-clock 时间,以更接近实际效率。
附录 F:NCP 人类评测细节¶
人类评测维度包括:
- 情节:事件与转折是否合乎逻辑地推进故事。
- 创造力:人物、主题和意象是否吸引人,是否避免陈词滥调。
- 发展:人物和场景是否以恰当的细节和复杂度展开。
- 语言使用:语言是否丰富多样,是否使用修辞、语言和文学手法。
- 人物:角色是否可信且概念一致,人物弧光是否合理。
- 总体偏好:两种续写中更偏好哪一个。
标注员通过 Prolific 招募,限制为从事创意写作的英语母语者。除两篇候选章节外,标注员还会看到模型使用的同一套故事信息,包括全局故事大纲、前文摘要、人物卡、上一章和下一章梗概。报酬为每三个数据点 £14,估算时薪 £9.33。