跳转至

面向叙事任务的轻量级潜在推理

Alexander Gurung、Esmeralda S. Whitammer、Mirella Lapata

爱丁堡大学信息学院;Esmeralda S. Whitammer 同时为 CIFAR Fellow。

译者说明:本文译自 arXiv:2512.02240v2(2026-06-09)。公式、实验数字和章节结构均依据同目录 LaTeX 源码与正式 PDF 核对;为保证网页可读性,原文中的 LaTeX 表格已转换为 Markdown,长篇提示词保留其结构与关键差异。

摘要

大语言模型(LLM)通过生成长思维链或“推理轨迹”来解决复杂任务;在给定查询并生成输出的过程中,这些轨迹相当于潜变量。模型生成此类轨迹的能力可以通过强化学习(RL)优化,从而提高轨迹对答案预测的帮助。然而,这种优化的计算代价很高,尤其是叙事类任务往往需要检索和处理大量 token。

为此,我们提出 LiteReason:一种可以与标准 token 采样交错执行、也容易与 RL 方法结合的潜在推理方法。LiteReason 使用一个轻量级 Reasoning Projector(推理投影器),生成连续潜在 token,帮助模型“跳过”部分显式推理步骤。在 RL 期间,策略模型自行决定何时激活投影器,并按需在潜在推理和离散推理之间切换。

在情节漏洞检测与书籍下一章生成任务上的实验表明,LiteReason 优于其他潜在推理基线,性能接近非潜在的 RL 训练,同时把最终推理长度减少 77%–92%。总体而言,LiteReason 能够把 RL 训练引导到性能—计算权衡曲线中更高效的区域。

1 引言

通过生成中间 token 再预测最终答案的思维链(Chain-of-Thought, CoT)已经成为提升 LLM 能力的常用范式。后续工作进一步用 RL 优化这些推理轨迹;在数学与代码等答案可验证的领域,验证器可以直接提供奖励信号,因此进展尤其明显。最近,RL 也开始扩展到故事生成与故事理解等不可直接验证的领域。

但 RL 带来的性能提升常常伴随更长的推理轨迹,训练和推理成本也随之增加。潜在推理试图在连续空间而非离散 token 空间中执行部分推理。其动机有二:第一,显式轨迹中的许多 token 未必有助于预测答案;第二,人类的思考也并不总是语言化的。连续表示还可能保留那些在解码为文字时损失的信息,甚至用一个向量近似多个并行推理分支。

LiteReason 为基础 LLM 增加一个 Reasoning Projector,使模型既能通过普通离散采样生成文字,也能进入潜在推理模式生成连续 embedding。模型输出一个特殊的“隐式思维”标记后进入潜在模式;投影器经过预训练后,再通过 RL 微调基础模型,使其在完成任务的同时学会何时使用潜在 token。

我们聚焦两类叙事任务:

  1. Flawed Fictions:检测故事中的情节漏洞或连续性错误。
  2. Next Chapter Prediction(NCP):根据故事资料为下一章制定计划,再生成下一章。

这两类任务都要求模型在上千乃至上万 token 的故事上下文上进行推理。它们缺少大规模、高质量推理轨迹,而且输入故事十分多样,因此不能简单依赖已有轨迹蒸馏。LiteReason 的设计目标正是在保留语言模型探索能力的同时降低推理成本。

实验显示,LiteReason 在两个任务上都优于训练式和免训练式潜在推理方法,并获得非潜在 RL 性能增益的 69%–96%;训练期间少生成 50%–53% 的 token,推理期间少生成约 70% 的 token。

本文贡献如下:

  • 提出一种把潜在推理与 RL 结合的方法,只依赖预训练 LLM,不要求预先存在推理轨迹数据集,适合低资源叙事任务。
  • 在 Flawed Fictions 和 NCP 上,相较潜在推理与 RL 基线取得较强性能。
  • 证明该方法能以显著更少的训练和推理 token 得到高效解。

2 相关工作

2.1 高效推理与潜在空间推理

RL 能够优化推理轨迹,但也容易使轨迹变长,因此研究者开始探索推理长度与任务性能之间的权衡。潜在推理大致分为两类。

免训练方法。 Soft Thinking 用 top-k token embedding 的概率加权混合作为下一步输入,并通过熵决定何时切回离散采样。Mixture of Inputs(MoI)同样混合 embedding,但使用贝叶斯估计确定权重。这类方法实现轻量,但此前主要在基础 CoT 准确率已经很高的数学、科学问答和代码任务上取得收益。

训练式方法。 COCONUT 把 LLM 最后一个隐藏状态直接作为下一步输入 embedding,并用课程学习逐步用隐藏状态替换显式推理。CoLaR 增加一个潜在头来预测被替换推理步骤的 token embedding,并在潜在 token 上直接做 RL。其他方法还包括 CoT2、CODI 和 Token Assorted。它们通常依赖较大的推理数据集,或要求基础模型已经能产生高质量轨迹。

LiteReason 与上述工作的差别在于:它让离散 token 与连续潜在 token 在同一次生成中交错出现;RL 的动作仍是离散 token,潜在步骤由投影器确定性地产生。

2.2 叙事任务

Flawed Fictions 通过可控方式向短篇故事注入情节漏洞,用于测试心理理论、状态追踪和整体叙事理解。NCP 则要求模型基于故事大纲、人物卡、前文摘要和上一章,规划并生成下一章。前者可通过 Yes/No 正确性验证,后者输出开放、篇幅长且语言多样,因此更难给出直接奖励。

3 LiteReason 框架

LiteReason 的设计建立在三个假设上:

  1. 没有大规模、高质量推理轨迹数据集,但任务能够给出回复级奖励。
  2. 输出与推理需要保持多样性,因此希望保留基础模型的一般语言能力。
  3. 基础模型已经具备一定推理能力,可以用它自己的正确轨迹初始化潜在推理模块。

唯一新增的架构组件是由少量 MLP 层构成的 Reasoning Projector。它读取最后一个隐藏状态,并预测一个与普通 token embedding 同维度的连续向量。普通情况下,隐藏状态进入 LM Head 并采样离散 token;潜在模式下,隐藏状态进入投影器,生成的连续向量直接作为下一步输入。

图 1:LiteReason 的离散与潜在推理交错流程

图 1。 黄色方块表示离散 token embedding,粉色方块表示连续潜在 embedding。模型遇到隐式思维标记后,不再经 LM Head 采样文字,而是连续调用 Reasoning Projector;达到标记指定的步数后,再回到离散生成。一次回复中可以多次切换。

3.1 训练 LiteReason

训练分为三个阶段。

阶段一:收集轨迹并构造 SFT 数据

对每个训练 prompt 采样 \(n\) 条推理轨迹,再用任务奖励做拒绝采样,只保留正奖励轨迹。Flawed Fictions 使用分类准确性,NCP 使用后文定义的 Contrastive Improvement。

随后按句子把轨迹切成推理步骤,并随机用如下标记替换比例为 \(s_r\) 的句子:

<implicit_thought>#</implicit_thought>

其中 # 是进入潜在模式的步数。每一步都把最后隐藏状态送入 Reasoning Projector,再把预测的 embedding 接到序列后。潜在步数按被替换句子的 token 数乘以 token replacement ratio \(t_r\) 得到。

阶段二:监督微调投影器

冻结基础 LLM 的全部参数,只训练 Reasoning Projector,并对未被遮蔽的后续显式推理 token 计算标准交叉熵损失。训练目标不是逐字重建被删掉的句子,而是让潜在 embedding 能够跨过这段缺口,使模型继续生成正确的后续推理。

由于后一个潜在 token 依赖前一个潜在 token,训练需要沿连续多步的潜在 rollout 反向传播。

阶段三:RL 训练

论文使用 GRPO,但方法本身不绑定某一种策略梯度算法。对每个训练样本,从旧策略 \(pi_{\text{old}}\) 采样一组输出 \(\{o_1,\ldots,o_G\}\),用组内归一化把奖励转换为 advantage,再更新策略。

RL 会更新整个基础 LLM,但不对潜在 token 的预测计算策略梯度:只有离散 token 采样被视为 action,潜在 embedding 是确定性中间计算。因此 Reasoning Projector 不在 RL 步骤中直接更新。

随着基础模型变化,原投影器可能与当前策略生成的隐藏状态和推理轨迹脱节。为此,每个 RL epoch 结束后,作者都用该 epoch 的新轨迹再执行一次投影器 SFT。去掉这一步的消融称为 LiteReason w/o SFT

3.2 推理过程

推理默认处于离散模式。当最近生成内容匹配隐式思维标记时,系统解析其中的整数预算;若解析有效,就连续执行相应次数的 Reasoning Projector,然后恢复普通 token 采样。该标记不是词表中的特殊 token,而是通过字符串模式匹配触发。

潜在 token 单步计算约比普通 token 贵 8%,但模型最终生成的步骤数显著减少,因此总成本仍下降。

4 在叙事任务上的应用

数据集 样本数 平均输入 token 来源
Flawed Fictions 414 约 900 Project Gutenberg
NCP 1,347 约 6.5k 近年出版书籍

4.1 Flawed Fictions

模型读取故事并判断是否存在情节漏洞,最终回答 Yes 或 No。本文只评估原始二元分类任务,以 Accuracy 作为指标。RL 奖励是标准 RLVR 二值奖励:

\[ R_{\text{flawed}}= \begin{cases} 0, & \text{prediction}\neq\text{answer}\\ 1, & \text{prediction}=\text{answer} \end{cases} \]

4.2 Next Chapter Prediction

在第 \(i\) 章,推理模型 \(\pi_\theta^{\mathcal R}\) 读取故事信息 \(SI_i\),输出下一章计划 \(\hat p\);生成模型 \(\pi^{\mathcal G}\) 再根据故事信息和计划生成下一章 \(\hat c_{i+1}\)

\[ \hat p\leftarrow \pi_\theta^{\mathcal R}(SI_i) \]
\[ \hat c_{i+1}\leftarrow \pi^{\mathcal G}(SI_i,\hat p) \]

两个模型都从 Qwen2.5-7B-Instruct 初始化,但只训练推理模型。原 NCP 工作使用 VR-CLI:若加入计划 \(a\) 后,真实下一章 \(y\) 在生成模型下的困惑度下降,就认为该计划更好:

\[ I_{\pi^{\mathcal G}}(x,y,a)= \frac{\mathcal P_{\pi^{\mathcal G}}(y\mid x)-\mathcal P_{\pi^{\mathcal G}}(y\mid x,a)} {\mathcal P_{\pi^{\mathcal G}}(y\mid x)}\times100 \]

作者发现,单独优化该目标会产生大量重复、通用的写作建议。于是加入一个来自其他书籍的随机章节 \(c^r\),构造对比奖励:

\[ R_{\text{contr}}=I(SI_i,c_{i+1},\hat p)-\gamma I(SI_i,c^r,\hat p) \]

该奖励要求计划不仅能帮助预测真实下一章,还不能同样适用于无关章节。作者称其为 Contrastive Improvement,并把它同时用于 NCP 训练和自动评测。对比奖励把推理轨迹的 TTR 从 0.072 提高到 0.087(+20.8%),把最终计划的 TTR 从 0.046 提高到 0.136(+200.2%)。

5 实验设置

主实验使用 Qwen2.5-7B-Instruct。Flawed Fictions 随机按 70/15/15 划分;NCP 使用原数据集划分。

LiteReason 默认参数为 \(n=5\)\(t_r=0.2\),并混合使用 \(s_r=10\%\)\(25\%\) 的样本。换言之,约用一个潜在 token 替代五个显式推理 token;每个被替换句子的潜在步数最多为 5。

作者比较三种 LiteReason 变体:

  • LiteReason:每个 RL epoch 后用新轨迹刷新投影器,并用 prompt 鼓励隐式思维标记。
  • LiteReason w/o SFT:保留初始化投影器,但 RL 期间不再刷新。
  • LiteReason w/o RP:RL 后不使用投影器,只通过 prompt 要求模型跳过推理步骤。

基线包括免训练的 MoI、Soft Thinking,训练式的 COCONUT、CoLaR,以及不使用潜在推理的 RL-Trained。所有训练式方法都按验证集性能选取最佳 checkpoint。

5.1 人类评测

NCP 还通过成对比较评估生成章节的情节、创造力、发展、语言使用、人物和总体偏好。比较对象为默认 Qwen、RL-Trained、MoI、CoLaR 和 LiteReason;每一对方法收集 20 次比较,并用 Bradley–Terry 模型拟合相对强度。

6 结果

6.1 设计消融

方法 FF Accuracy FF 平均 token NCP Contrastive Improvement NCP 平均 token
Qwen2.5-7B 57.26 ± 1.58 400.04 ± 6.50 0.067 ± 0.001 831.85 ± 8.26
RL-Trained 88.71 ± 0.00 114.53 ± 2.01 0.666 ± 0.01 721.33 ± 6.01
LiteReason 87.42 ± 0.47 34.01 ± 0.38 0.478 ± 0.01 193.11 ± 2.02
w/o SFT 85.48 ± 0.00 8.26 ± 0.17 0.560 ± 0.01 622.23 ± 1.82
w/o RP 87.58 ± 0.76 260.81 ± 3.68 0.449 ± 0.01 983.49 ± 5.30

完整 LiteReason 在性能与 token 节省之间最均衡:它分别获得非潜在 RL 在 FF 和 NCP 上性能增益的 95.9% 与 68.6%,同时生成的推理 token 少三倍以上。w/o SFT 在 FF 上更短但略弱,在 NCP 上奖励更高却长得多,说明周期性 SFT 的作用取决于任务难度和数据规模。只靠 prompt 跳步的 w/o RP 不仅轨迹更长,性能也低于 RL-Trained。

RL 早期,模型使用潜在思维的频率会快速上升,但到训练后期有时又下降。后续工作可以通过提高隐式标记概率或改变 prompt,更直接地控制潜在推理使用率。

6.2 与其他潜在推理方法比较

方法 FF Accuracy FF token NCP Contrastive Improvement NCP token
Qwen2.5-7B 57.26 400.04 0.067 831.85
MoI 58.06 401.73 0.045 829.14
Soft Thinking 57.42 360.90 0.013 966.73
COCONUT 50.65 268.07 0.083 361.84
CoLaR 53.71 226.14 0.118 218.40
LiteReason 87.42 34.01 0.478 193.11
RL-Trained 88.71 114.53 0.666 721.33

LiteReason 在两个任务上都显著超过已有潜在推理方法。免训练方法与基础模型的性能和长度接近;COCONUT 与 CoLaR 更像是在压缩现有能力,未能通过小规模叙事数据上的训练得到足够探索。人类评测趋势与 Contrastive Improvement 基本一致:RL-Trained 最好,LiteReason 次之,随后与其他方法拉开明显差距。

6.3 LiteReason 是否受益于 RL?

CoLaR 直接在潜在空间做 RL,但实验中 RL 前后提升很小。LiteReason 则从接近默认模型的水平上升到接近非潜在 RL 上界。作者据此认为,token 空间的 RL 探索与间歇性的确定性潜在步骤更容易兼容。

6.4 RL 训练和实际推理效率

方法 FF 训练 token NCP 训练 token
RL 61.4M 108.8M
RL + LiteReason 29.0M(-52.8%) 54.9M(-49.5%)

训练步数和样本数相同的情况下,LiteReason 让 RL 期间生成的离散 token 约减半。推理时,相较基础模型,NCP 少生成 77%,FF 少生成 92%;相较 RL-Trained,LiteReason 的轨迹在 FF 上短 73%,在 NCP 上短 70%。

任务 模型 使用潜在模式 单样本耗时(秒) 全测试集批处理耗时/样本(秒)
FF Base 3.10 ± 0.28 0.13 ± 0.02
FF RL-Trained 0.97 ± 0.02 0.06 ± 0.00
FF LiteReason 0.83 ± 0.16 0.20 ± 0.10
FF LiteReason 0.31 ± 0.01 0.03 ± 0.00
NCP Base 8.02 ± 0.35 0.43 ± 0.01
NCP RL-Trained 6.46 ± 0.16 0.42 ± 0.02
NCP LiteReason 2.21 ± 0.02 0.26 ± 0.04
NCP LiteReason 1.84 ± 0.03 0.23 ± 0.00

图 3:Flawed Fictions 的性能—成本曲线

图 3。 横轴越右表示准确率越高,纵轴越低表示生成 token 越少。LiteReason(橙色菱形)与 RL-Trained(粉色三角)都位于性能—成本前沿;LiteReason 牺牲很小的准确率,换取显著更短的输出。

图 4:NCP 的性能—成本曲线

图 4。 横轴越右表示 Contrastive Improvement 越高,纵轴越低表示生成 token 越少。LiteReason 与 RL-Trained 同处 Pareto 前沿,而其他潜在推理方法在性能上明显落后。

6.5 是否保留通用能力?

作者在 GSM-Hard、AIME-2025 和 MMLU-Redux 上测试迁移能力。Qwen2.5-7B 版本的 LiteReason 与 RL-Trained 基本保留基础模型能力,而且 LiteReason 通常生成更少 token。COCONUT 在各种设置下都显著退化;CoLaR 在 FF 训练后相对稳定,但在 NCP 训练后出现明显性能崩塌。

6.6 不同模型规模与家族

在更弱的 Qwen3-4B-Instruct-2507 上,基础 FF 准确率只有 33.23%。RL-Trained 达到 64.84%,LiteReason 达到 57.42%,平均 token 分别为 1078.57 与 995.38。LiteReason 仍显著优于基础模型,但恢复非潜在 RL 增益的比例低于主实验。

6.7 与长度奖励是否兼容?

作者借鉴 DAPO,对截断回复给零奖励,并加入:

\[ r_{\text{length}}=-0.5\frac{|y|}{\text{max length}} \]
方法 FF Accuracy 平均 token
RL-Trained 88.71 ± 0.00 114.53 ± 2.01
RL-Trained + 长度惩罚 91.94 ± 0.34 16.65 ± 4.43
LiteReason 87.42 ± 0.47 34.01 ± 0.38
LiteReason + 长度惩罚 93.55 ± 0.00 6.00 ± 0.00

在二元分类任务 FF 上,长度惩罚本身就很有效,与 LiteReason 结合后同时获得最高准确率和最短输出。作者认为这体现了 RL 中心设计的可组合性,但没有在长篇 NCP 上尝试同一奖励。

6.8 数学任务

在 GSM-Hard 上,以 Gemma-3-1B-IT 为基础:

方法 Accuracy 平均 token
Base 14.70 ± 0.39 932.82 ± 20.28
RL-Trained 15.91 ± 0.96 941.13 ± 15.08
LiteReason 15.76 ± 0.28 849.92 ± 19.84
CoLaR 1.14 ± 0.15 978.24 ± 10.88
COCONUT 1.52 ± 0.00 25.12 ± 0.02

LiteReason 在弱基础模型上仍保持接近 RL-Trained 的性能,并减少约 10% token;CoLaR 与 COCONUT 则发生严重性能崩塌。

7 结论

LiteReason 是面向叙事领域的潜在推理方法:它训练轻量级 Reasoning Projector 产生信息充分的连续潜在 token,并让 LLM 在离散采样与潜在思维之间交错切换。

在 Flawed Fictions 和 NCP 上,LiteReason 比现有潜在推理基线更接近传统 RL 的性能,同时训练生成 token 少一半以上,推理轨迹缩短约 70%,并更好地保留通用能力。作者认为,这是首次把连续潜在推理应用到叙事任务,也是首次在 RL 期间把潜在推理与离散 token 采样交错,使模型可以自行决定何时使用潜在 token。

后续方向包括改进投影器结构、递归更新潜在思维,以及把潜在信息注入 token embedding 层之外的位置。

附录 A:对比式 VR-CLI

原 VR-CLI 容易鼓励“这一章很有趣”之类可套用于任何文本的通用建议。对比项从其他书中均匀随机选择章节,并减去计划对该随机章节的帮助,从而要求计划更加针对当前故事。实验中的 \(\gamma\) 始终取 0.5。

样例显示,未加对比奖励的计划大量重复“本章结束于……”等泛化表述;加入对比奖励后,推理会引用具体角色、指控、人物关系和下一章梗概,最终计划也更具体。

附录 B:prompt 与 RL 的影响

隐式思维 prompt 在普通任务指令上增加如下说明:模型可以在推理中输出 <implicit_thought>number</implicit_thought>,其中 number 为 1–5,表示该思维的复杂度;使用它时可以跳过原本要说出的句子并继续推理。作者建议在推理中部使用,而不是开头或结尾。

移除该说明通常会使使用 Reasoning Projector 的模型准确率略升,但推理轨迹显著变长。因此 prompt 可以作为测试时调节性能—效率权衡的手段。RL 前后比较进一步显示:LiteReason 明显受益于 RL,而 CoLaR 的改善有限。

附录 C:性能—成本曲线

作者把任务奖励作为性能、生成 token 数作为成本绘图。FF 与 NCP 的结果都表明 LiteReason 推进了 Pareto 前沿:它与非潜在 RL 性能接近,但成本显著更低;其他方法要么成本较高,要么性能明显不足。

附录 D:训练与超参数

  • LiteReason:SFT 学习率 \(10^{-4}\),RL 学习率 \(5\times10^{-7}\),最大生成长度 2048,\(t_r=0.2\)\(s_r=(10\%,25\%)\)。FF:SFT 1 epoch、RL 30 epoch、batch size 48、group size 16;NCP:SFT 2 epoch、RL 20 epoch、batch size 64、group size 8。
  • CoLaR:SFT/RL 学习率相同,压缩因子 5,最大 64 个 latent;训练轮数和 batch 设置与 LiteReason 对齐。
  • COCONUT:学习率 \(5\times10^{-5}\),14 epoch,每个推理步骤一个 continuous thought,每阶段 2 epoch,共 10 个 latent stage。
  • MoI:在验证集上搜索 \(\beta\in\{0.25,0.5,1,2,4\}\);FF 选 0.5,NCP 选 4。
  • 免训练方法:搜索 temperature 0.6/0.7、top-p 0.8/0.95、top-k 20/30;Soft Thinking 还搜索 Gumbel/Dirichlet 设置。

附录 E:报告方法与限制

NCP 指标取整个测试集上 \(k=5\) 次运行的平均,FF 取 \(k=10\);报告的 \(\pm\mathrm{SEM}\) 是运行级均值的标准差除以 \(\sqrt{k}\),反映 LLM 采样带来的运行间波动。

除训练期 token 统计表外,报告的 token 数包含生成的潜在 token。训练期没有完整记录所有 latent token,因此 50% 左右的离散 token 降幅不能直接等价为 FLOPs 或显存降幅。不同方法的推理实现也不同:LiteReason 与 vLLM 集成,而其他训练式潜在方法未必有同等工程优化。论文因此另行报告 wall-clock 时间,以更接近实际效率。

附录 F:NCP 人类评测细节

人类评测维度包括:

  1. 情节:事件与转折是否合乎逻辑地推进故事。
  2. 创造力:人物、主题和意象是否吸引人,是否避免陈词滥调。
  3. 发展:人物和场景是否以恰当的细节和复杂度展开。
  4. 语言使用:语言是否丰富多样,是否使用修辞、语言和文学手法。
  5. 人物:角色是否可信且概念一致,人物弧光是否合理。
  6. 总体偏好:两种续写中更偏好哪一个。

标注员通过 Prolific 招募,限制为从事创意写作的英语母语者。除两篇候选章节外,标注员还会看到模型使用的同一套故事信息,包括全局故事大纲、前文摘要、人物卡、上一章和下一章梗概。报酬为每三个数据点 £14,估算时薪 £9.33。