跳转至

title: 中文译文 · DPWriter paper_id: '2601.09609' year: '2026'


DPWriter:面向创意写作的多样化规划分支强化学习

Qian Cao¹†*Yahui Liu²†、Wei Bi²、Yi Zhao¹、Ruihua Song¹ᴮ、Xiting Wang¹ᴮ、Ruiming Tang²、Guorui Zhou²、Han Li²

¹中国人民大学,²快手科技

*本工作在快手科技实习期间完成。†共同第一作者。ᴮ通讯作者。

译者注:本文为 arXiv:2601.09609(DPWriter, 2026-01)的中文译文。公式、表格、图说明均按原文翻译;图示(Figure)以文字说明代替,原图见 PDF。作者所属组织已在作者区补充。

摘要

基于强化学习(RL)对大语言模型(LLM)的提升,往往会导致输出多样性的下降,从而削弱模型在创意写作这类开放式任务中的实用性。现有方法缺乏显式引导多样化探索的机制,转而把优化效率和性能置于多样性之上。本文提出一个围绕半结构化长思维链(long Chain-of-Thought, CoT)构建的 RL 框架,将生成过程分解为经过显式规划的若干中间步骤。我们提出多样化规划分支(Diverse Planning Branching, DPB)方法,在规划阶段依据多样性变化策略性地引入分歧,并配合组感知的多样性奖励(group-aware diversity reward)以鼓励彼此区分的轨迹。在多个创意写作基准上的实验表明,本方法在不损害生成质量的前提下显著提升了输出多样性,稳定优于现有基线。

1 引言

多样性是世界的基本特征,也是人类创造力的核心体现(Fischer, 2005; Edmonds, 2008)。随着 LLM 的推理能力不断增强(Chen et al., 2025a),尤其是近期借助强化学习(Schulman et al., 2017; Shao et al., 2024; Lu, 2025; Bhaskar et al., 2025),其生成文本的多样性变得格外重要。然而,当用户与 LLM 协作进行创意写作时,可能会感受到内容多样性的显著流失(Padmakumar and He, 2024);这一问题在使用人类反馈强化学习(RLHF)训练的模型上更为突出(O'Mahony et al., 2024)。

为缓解 RL 训练造成的多样性下降(Kirk et al., 2024; Padmakumar and He, 2024; Shypula et al., 2025),近年来涌现了一批工作(He et al., 2025; Li et al., 2025a; Anschel et al., 2025),但在有效提升 LLM 多样性方面仍存在若干挑战:

  1. 许多方法聚焦于修改奖励函数(Tuyls et al., 2025; He et al., 2025; Li et al., 2025a)。然而这些方法大多对 rollout 过程不加约束,对 RL 中如何探索多样化轨迹的控制有限。
  2. 部分方法研究分支/分叉策略来探索多样轨迹(Zheng et al., 2025a; Li et al., 2025c; Guo et al., 2025),但它们主要关注提升样本效率(Zheng et al., 2025b; Wen et al., 2025)或整体性能(Liu et al., 2025b),而非把多样性作为内在目标显式优化。此外,它们通常从高熵 token 处分支(Wang et al., 2025b),使分支过程难以控制。

本文提出 DPWriter,以半结构化长 CoT 为脚手架引导 RL 过程,从而提升 LLM 的多样性。如图 1 所示,我们把生成过程分解为多个阶段:先进行全局规划(planning),再进行长 CoT 推理,最后生成最终回复。这一方式提供了显式的中间阶段,便于多样化探索。具体而言:

  • 我们提出 多样化规划分支(DPB) 方法,在 rollout 时的 DPB 阶段依据候选规划的多样性策略性地分支出多样规划,从而更可控、更有效地探索多样轨迹。
  • 我们还引入一个多样性奖励,依据每个回复在其所属组内的多样性贡献进行评估,与 rollout 时的 DPB 策略协同,进一步鼓励多样化生成。

在多个创意写作基准上的大量实验表明,本方法在保持高质量的同时显著增强了 LLM 生成文本的多样性,稳定优于现有基线。主要贡献如下:

  • 多样性引导的 RL 框架。 提出一个利用半结构化长 CoT 引导生成过程的新 RL 框架;为此构建了一个精选数据集,包含 43K 条带半结构化长 CoT 与高质量回复的写作指令。
  • 规划级多样性机制。 提出 DPB 方法,在规划阶段策略性地分支候选规划;并设计一个依据组内贡献评估每个回复的多样性奖励。该设计支持可控探索并有效促进多样化的生成轨迹。
  • 实验验证。 在多个创意写作基准上的实验表明,本方法在保持高质量的同时显著提升多样性,稳定优于基线;进一步分析显示 DPB 与多样性奖励协同工作,共同促进更丰富的生成。

图 1

图 1(三种生成范式对比)。 (a) 直接生成:指令 → 回复,质量较低、可控性差。(b) 非结构化长 CoT 推理:指令 → 长 CoT → 回复,质量更高但可控性仍低。(c) 本文的半结构化推理(带规划):指令 → 规划 → 长 CoT → 回复,质量更高更可控——在推理前引入全局规划,提供高层引导。

2 相关工作

非 RL 训练中的多样性。 此前研究表明,监督微调(SFT)或偏好优化可能降低输出多样性(O'Mahony et al., 2024; Kirk et al., 2024),由此催生了在训练阶段缓解该问题的研究。Li et al. (2025e) 强调 SFT 中的过拟合问题,引入博弈论框架以弥补交叉熵损失的局限。在偏好优化方面,一些工作(Lanchantin et al., 2025; Deshpande et al., 2025)对 DPO(Rafailov et al., 2023)做出修改,聚焦于更优地选择多样化数据样本;另一些工作(Chung et al., 2025; Nath et al., 2025)通过加权训练目标同时促进输出多样性与质量,以更好捕捉细腻的偏好。

RL 类多样性方法。 近期,强化学习在提升模型能力上展现出强效(Wei et al., 2025; Bhaskar et al., 2025),使得"在 RL 训练中提升多样性"受到更多关注。一类主要策略是在 GRPO(Shao et al., 2024)等策略梯度方法中修改奖励:引入多样性感知的奖励加成(Anschel et al., 2025; Tuyls et al., 2025)或惩罚项(Chen et al., 2025b; He et al., 2025; Li et al., 2025a),这些项基于一组生成回复的多样性度量计算,共同目标是塑造策略梯度以偏向多样且高质量的输出。此外,也有研究者探索其他调整 RL 目标的方式,如引入 token 级熵正则(Yao et al., 2025)、设计语义多样性项(Chen et al., 2025c),或将熵分量从 KL 散度项中解耦(Slocum et al., 2025)。

尽管有研究利用分支/分叉策略增强 RL 探索(Zheng et al., 2025a; Li et al., 2025c; Guo et al., 2025),但它们主要旨在提升样本效率(Zheng et al., 2025b; Wen et al., 2025)和整体性能(Liu et al., 2025b),而非显式促进多样性;而且大多从高熵 token(Wang et al., 2025b)作为分支点(Zheng et al., 2025a; Liu et al., 2025b)或设定固定段长分支(Li et al., 2025c; Guo et al., 2025),导致 rollout 可控性较差。与以往工作不同,本方法将半结构化长 CoT 推理过程多样性感知分支策略相结合,显式鼓励探索多条发散的规划路径,适合开放式创意写作任务。

3 预备知识

3.1 任务形式化

给定来自创意写作等开放式任务的指令 \(q \sim \mathcal{Q}\),模型 \(M\) 的目标是生成对指令的回复 \(y\),即 \(y \sim M(\cdot|q)\)。用长 CoT 推理生成回复可表述为:先生成推理链 \(c\),再生成最终回复,即 \(c \sim M(\cdot|q)\)\(y \sim M(\cdot|q, c)\)。但现有 CoT 推理过程是非结构化且隐式学习的,缺乏显式的规划表示。

为让高层目标直接塑造后续推理与最终回复,本文提出半结构化长 CoT 推理范式,在推理前引入显式规划阶段:模型先为回复生成一个全局规划 \(p\),再在指令与规划共同条件下生成推理链 \(c\),最后在三者条件下生成回复:

\[p \sim M(\cdot|q),\quad c \sim M(\cdot|q,p),\quad y \sim M(\cdot|q,p,c)\]

如图 1 所示,规划 \(p\) 为后续自由形式的推理与回复生成提供高层结构指引,在非结构化推理链的灵活性与显式规划带来的可控性之间取得平衡。

3.2 LLM 的强化学习

在 LLM 的 RL 中,模型 \(M\) 被视为参数为 \(\theta\) 的策略 \(\pi_\theta\),生成过程被表述为马尔可夫决策过程(MDP)。在时间步 \(t\),生成 token \(a_t\) 被视为在状态 \(s_t\) 下采取动作,状态由指令与此前所有 token 构成,即 \(s_t = (q, a_1, a_2, \ldots, a_{t-1})\)。在本文的半结构化推理范式下,一条 rollout \(o\) 的分布可表示为:

\[\pi_\theta(o \mid q) = \prod_{\tau \in \{p,c,y\}} \prod_{l=1}^{L^\tau} \pi_\theta\bigl(a_l^{(\tau)} \mid q, \tau_{<l}\bigr) \tag{1}\]

其中 \(\tau\) 在规划 \(p\)、推理链 \(c\)、回复 \(y\) 上迭代;\(L^\tau\) 为序列 \(\tau\) 的长度,\(a_l^{(\tau)}\) 为其中的第 \(l\) 个 token。RL 的目标是最大化期望累计奖励:

\[J(\theta) = \mathbb{E}_{o \sim \pi_\theta(\cdot|q)}\bigl[r(q, o)\bigr] \tag{2}\]

其中 \(r(q,o)\) 是给定指令 \(q\) 评估 rollout \(o\) 质量的奖励函数。

Group Relative Policy Optimization(GRPO)。 本方法基于 GRPO(Shao et al., 2024)——一种丢弃 critic 模型、在由旧策略 \(\pi_{\theta_{\text{old}}}\) 生成的 \(n\) 条 rollout \(\{o_i\}_{i=1}^n\) 组内估计优势的近期 RL 算法。GRPO 通过最大化以下目标优化策略 \(\pi_\theta\)

\[J_{\text{GRPO}}(\theta) = \mathbb{E}_{q \sim \mathcal{Q},\, \{o_i\}_{i=1}^n \sim \pi_{\theta_{\text{old}}}(\cdot|q)} \left[ \frac{1}{n}\sum_{i=1}^{n} \frac{1}{|o_i|}\sum_{t=1}^{|o_i|} \Bigl( \mathrm{CLIP}(\rho_{i,t}, A_{i,t}) - \beta\, \mathcal{D}_{KL}(\pi_\theta \| \pi_{\theta_{\text{ref}}}) \Bigr) \right] \tag{3}\]

其中 \(\rho_{i,t} = \dfrac{\pi_\theta(o_{i,t} \mid q, o_{i,<t})}{\pi_{\theta_{\text{old}}}(o_{i,t} \mid q, o_{i,<t})}\) 是 rollout \(o_i\) 在第 \(t\) 步的重要性采样比率;截断函数 \(\mathrm{CLIP}(\rho_{i,t}, A_t) = \min\bigl(\rho_{i,t} A_t,\, \mathrm{clip}(\rho_{i,t}, 1-\epsilon, 1+\epsilon) A_t\bigr)\) 用于限制策略更新步长(Schulman et al., 2017);\(\mathcal{D}_{KL}\) 项惩罚偏离参考策略 \(\pi_{\theta_{\text{ref}}}\) 的程度以保障稳定性,\(\beta\) 为惩罚系数。给定一组 rollout \(\{o_i\}_{i=1}^n\) 的奖励 \(\{r_i\}_{i=1}^n\),每条 rollout 的优势 \(A_t\) 计算为 \(A_t = \dfrac{r_i - \bar{r}}{\sigma_r}\),其中 \(\bar{r}\)\(\sigma_r\) 为组内奖励的均值与标准差。

4 构建带规划的半结构化 CoT 数据

我们提出一种两步法,通过多维度规划(multi-aspect planning)规划一致的推理(plan-consistent reasoning)构建半结构化 CoT 数据,以增强连贯性与可控性。

多维度规划生成。 给定输入指令 \(q\)、长 CoT 推理 \(c\) 与目标回复 \(y\),目标是生成规划 \(p\),概述用于引导 CoT 与回复生成的关键维度。受修辞与写作理论启发(Bitzer, 1968; Flower and Hayes, 1981; Spangher et al., 2025),我们设计如下多维度规划框架:

  • 目标与受众(Goal and Audience):界定并识别主要目标与目标受众。
  • 信息与视角(Information and Perspective):点明需包含的关键信息及采用的视角/观点。
  • 结构与逻辑(Structure and Logic):概述回复的逻辑流程与结构,包括主要论点及其组织。
  • 语言与风格(Language and Style):指定期望的语气、词汇与风格元素。
  • 呈现与体验(Presentation and Experience):描述信息应如何呈现以提升读者参与度与体验。

我们使用 GPT-4.1(OpenAI, 2025)基于指令 \(q\) 与回复 \(y\) 生成规划 \(p\),所用提示见附录 C。

规划一致的 CoT 生成。 直接将生成的规划 \(p\) 插入长 CoT \(c\) 的开头,可能在规划与推理之间引入不一致。为此,我们用规划 \(p\) 把原始 CoT \(c\) 修订为规划一致的 CoT \(c'\):用 GPT-4.1 基于规划 \(p\) 修订原始 CoT \(c\),确保与各规划维度对齐,同时保留原始信息以避免信息漂移。修订提示见附录 C。

我们引入特殊 token(如 <goal>...</goal><info>...</info> 等)来包裹规划 \(p\) 的各维度,使结构显式、便于模型识别与遵循。图 2 给出原始样本 \((q,c,y)\) 与半结构化 CoT 样本 \((q,p,c',y)\) 的示例。

图 2

图 2(示例)。 指令:"不描写春景,写一篇设定在春天的 1000 字故事,叙事细致接地气。" 半结构化长 CoT 在 <think> 中先给出多维度规划(<goal> 目标与受众;<info> 信息与视角——聚焦一家老面馆与店主,第三人称;<struct> 线性叙事结构;<lang> 朴素口语化语言;<pres> 沉浸式场景细节),再展开长 CoT 推理,最终生成回复《一场春日的相遇》。

5 方法

本节介绍多样化规划分支(DPB)方法与奖励多样性贡献(Rewarding Diversity Contribution)策略,利用半结构化 CoT 的规划可控性来增强 rollout 多样性与回复质量。

5.1 多样化规划分支(DPB)

规划能力冷启动。 初始的半结构化长 CoT \((p, c')\) 提供显式规划线索与一致的 CoT 推理过程,二者都体现在最终回复 \(y\) 中。为让模型具备此能力,我们先用半结构化 CoT 数据对基础模型做监督微调(SFT)冷启动,使其学会规划格式并能生成连贯的 CoT 推理。如 6.3 节所示,使用本半结构化数据的 SFT 性能可比肩甚至超过其他 CoT 数据集。

对规划段分支。 在 RL 阶段,冷启动后的模型充当策略模型 \(\pi_\theta\)。给定指令 \(q\),模型先生成规划部分,再产出 CoT \(c'\) 与回复 \(y\)。通过在每个规划点显式鼓励对多样规划策略的探索,策略会诱导出多样的推理路径与最终输出;这反过来为奖励模型提供了更广的高质量候选集,同时提升生成质量与多样性。

如图 3 所示,我们在半结构化 CoT 格式中识别出 \(S\) 个规划段,每段 \(s\) 由起止 token(如 <goal></goal>)界定(\(t_s^{\text{start}}, t_s^{\text{end}}\))。生成时,对每个规划段 \(s\),从当前候选集 \(\mathcal{C}\) 中的每个候选出发,采样 \(K\) 条续写,从 \(t_s^{\text{start}}\) 起直到对应的结束 token \(t_s^{\text{end}}\)。其中 \(K\)分支因子(branch factor),控制每个候选生成多少条多样续写。此过程得到大小为 \(|\mathcal{C}| \times K\) 的候选池。为选出进入下一段的 \(G\) 个候选(\(G\)组大小),我们用预定义多样性度量 \(\mathcal{D}(\cdot)\) 衡量候选多样性,选出最多样的候选:第一段直接从整个池中选 \(G\) 个;后续段则从源自同一前驱候选的每组续写中各选一个,从而保证跨分支的多样性。处理完所有 \(S\) 段后,对 \(\mathcal{C}\) 中每个候选进行解码补全,得到 \(B \times G\) 条最终回复(\(B\) 为一批指令数)。

图 3

图 3(DPB 概览)。 指令:"写一个关于三个朋友凌晨四点的故事,不使用任何对话。" 在每个规划段(如 <goal><info>),从每个候选分支出多条多样续写形成候选池,再用 \(\mathcal{D}(\cdot)\) 选出最多样的分支进入下一段,最终生成多样回复(如《四点的回响》《寂静的黎明》等)。

多样性度量。 为衡量分支时的候选多样性,考虑两类度量:(1) 基于 N-gram 的多样性,统计候选间不同的 n-gram 以鼓励词汇变化;(2) 语义多样性,用现成嵌入模型(Qwen3-Embedding-0.6B,Zhang et al., 2025a)计算候选嵌入间的平均成对余弦距离以捕捉语义差异。二者联合鼓励探索多样的推理路径。

5.2 奖励质量与多样性

为鼓励产生既高质量又多样的回复的推理路径,我们沿用以往工作(Chen et al., 2025b; He et al., 2025; Li et al., 2025a)的做法,在 RL 训练中联合使用质量与多样性奖励。

质量奖励。 用一个在人类偏好数据上训练的奖励模型 \(\mathcal{R}_\phi\) 评估生成回复质量。给定指令 \(q\) 的回复 \(y_i\),质量奖励定义为:

\[r_i^{\text{qua}}(q, y_i) = \mathcal{R}_\phi(q, y_i) \tag{4}\]

该奖励鼓励模型生成符合人类偏好的回复。

多样性贡献奖励。 为进一步促进回复间的多样性,引入多样性贡献奖励,衡量一个回复对整组回复整体多样性的贡献大小。核心直觉是:奖励那些引入了他人所没有的独特元素的回复,从而促进内容多变的生成。形式上,给定指令 \(q\) 的回复组 \(Y = \{y_1, y_2, \ldots, y_n\}\),回复 \(y_i\) 的多样性贡献奖励定义为:

\[r_i^{\text{div}}(q, y_i, Y) = \mathrm{Norm}\!\left( \frac{\mathcal{D}(y_i, Y \setminus \{y_i\})}{|y_i|} \right) \tag{5}\]

其中 \(\mathcal{D}(\cdot)\) 统计 \(y_i\) 中那些不出现在其他回复 \(Y \setminus \{y_i\}\) 中的独特 n-gram 数量,\(|y_i|\)\(y_i\) 的 token 数;归一化函数 \(\mathrm{Norm}(\cdot)\) 确保奖励在各回复间处于可比尺度。

为平衡质量与多样性,将两者结合:

\[r_i(q, y_i, Y) = (1 - \lambda)\cdot r_i^{\text{qua}} + \lambda \cdot r_i^{\text{div}} \tag{6}\]

其中 \(\lambda \in [0,1]\) 控制多样性奖励的权重。多样性贡献奖励仅当回复质量超过某阈值时激活,即当 \(r_i^{\text{qua}} > \tau\) 时;否则置 \(\lambda = 0\)。该设计确保只有在满足最低质量门槛时才因多样性给予奖励,偏好那些既有高质量又能贡献有意义多样性的回复,引导模型生成兼具质量与多样性的回复。

6 实验

我们在若干基准数据集上评估所提方法并与相关基线比较,进一步通过消融研究分析关键组件并讨论结果。

6.1 实验设置

训练数据集。 采用开放创意写作数据集训练模型,包括 DeepWriting(Wang et al., 2025a)、WritingPrompts(Fan et al., 2018)、CreateSet(Cao et al., 2025)、COIG-Writer(Li et al., 2025d)。由于 CreateSet 与 WritingPrompts 规模较大,分别随机采样 13K 与 12K 条。对于只含指令-回复的数据,用 GPT-4.1 生成长 CoT(提示见附录 C)。去重后,冷启动 SFT 用的最终数据集含 43K 样本。为提升 RL 训练效果,我们做数据过滤,保留 SFT 模型表现不佳的样本:用 SFT 模型为所有训练样本生成回复,并用 RewardBench 第一名的 Skywork-Reward-V2-Llama-3.1-8B(Liu et al., 2025a)打分;保留最高奖励分低于整体均值的样本,得到 10K 条用于 RL 训练。

骨干与基线。 实验在两个骨干上进行:Qwen3-4B-Base(Yang et al., 2025)与 Llama-3.2-3B-Instruct(Dubey et al., 2024)。比较的强基线包括:(1) GRPO(Shao et al., 2024):第 3 节描述的标准 GRPO;(2) GRPO-Unlikeliness(He et al., 2025):GRPO 的修订版,按生成概率的反向对回复加权(概率越低权重越高);(3) Darling(Li et al., 2025a):结合一个学习到的多样性分类器从划分中计算多样性奖励;(4) GAPO(Anschel et al., 2025):GRPO 的扩展,使模型学习均匀采样等分布性质。代码基于 VeRL(Sheng et al., 2025)框架。RL 训练 batch size 为 128,更新 batch size 为 32,组大小 \(n=8\)。所有基线在相同数据与设置下训练以保证公平。

评测基准。 为同时评估质量与多样性,在三个基准上实验:WritingBench(Wu et al., 2025)、Creative Writing v3(EQ-Bench, Paech 2023)、ArenaHard v2.0(创意写作子集, Li et al., 2025b)。报告 WritingBench 的平均质量分(Score)、ArenaHard v2.0 上经风格控制的归一化 ELO 分(代表质量,由胜率得到)与胜率(WR)。进一步用 NoveltyBench(Zhang et al., 2025c)评估多样性,报告 Distinct 指标——它用一个训练来预测生成样本间功能等价性的二分类器,将模型输出划分为等价类。WritingBench 与 Creative Writing v3 用 Claude Sonnet 4(Anthropic, 2025)作裁判,ArenaHard v2.0 用 DeepSeek-V3(Liu et al., 2024)。多样性通过对每个 prompt 生成 16 条回复,计算基于嵌入的平均余弦距离(Emb)与基于 n-gram 的 distinct(即 Expectation-Adjusted Distinct, EAD, Liu et al., 2022)。更多细节见附录 A。

6.2 主结果

三个基准上的主结果见表 1。所提 DPWriter 在不同骨干上的 WritingBench 与 Creative Writing v3 上,质量与多样性指标均稳定优于所有基线。值得注意的是,在 WritingBench 上以 Qwen3-4B 为骨干,相较标准 GRPO,DPWriter 在基于嵌入的多样性指标上提升 15%、在 EAD 上提升 9.9%,且不以质量为代价——DPWriter 同时取得最高总分 6.43。Creative Writing v3 与 ArenaHard v2.0 上的结果进一步验证了方法有效性,DPWriter 取得最佳多样性指标并在质量指标上有可观提升。虽然在 Llama 骨干的 ArenaHard v2.0 上 GRPO-Unlikeliness 在基于嵌入的多样性上表现接近,但其在胜率与 EAD 上明显落后,表明它可能通过生成更低质量内容来"钻营"基于嵌入的多样性指标。

我们还在 NoveltyBench 上评估多样性(图 4),DPWriter 在 Distinct 指标上优于所有基线,展现更强的多样内容生成能力。多基准上的一致结果印证了 DPWriter 在提升创意写作质量与多样性上的有效性。

表 1: 在 WritingBench、Creative Writing v3、ArenaHard v2.0(创意写作子集)上各方法对比(最佳加粗)。Emb/EAD 分别为基于嵌入/基于 n-gram 的多样性指标;WR 为对 gemini-2.0-flash 的胜率。

方法 WritingBench Score WritingBench Emb WritingBench EAD Creative v3 ELO Creative v3 Emb Creative v3 EAD ArenaHard WR ArenaHard Emb ArenaHard EAD
Qwen3-4B-Base 3.74 15.84 5.94 43.88 33.21 5.20 1.9 33.27 6.26
GRPO 6.32 9.07 8.02 659.83 17.00 15.67 11.0 22.27 15.82
GRPO-Unlikeliness 6.28 9.46 8.33 660.46 17.07 15.15 12.1 22.79 15.92
Darling 6.23 8.82 7.66 666.10 16.73 16.43 10.1 21.67 16.21
GAPO 6.25 9.83 8.11 619.89 17.61 15.73 11.8 23.16 16.27
DPWriter(本文) 6.43 10.45 8.81 694.69 17.69 17.02 13.9 23.65 17.68

(表 1 还给出 Llama-3.2-3B-Instruct 骨干上的对比:Base 3.54/11.27/6.97/445.05/17.22/10.16/5.4/19.91/6.32;GRPO 5.25/12.01/9.42/754.08/21.7/23.32/2.5/24.87/6.17;GRPO-Unlikeliness 4.47/11.34/8.42/718.31/2.5/6.17;Darling 4.57/9.31/7.79/759.05/19.5/21.25/15.18;GAPO 4.57/10.65/8.05/730.24/20.5/23.57/15.37;DPWriter 5.31/12.03/9.60/829.05/29.0/22.56/15.45/17.72/12.50。)

6.3 消融研究

不同 SFT 策略的消融。 首先考察冷启动 SFT 中"带规划的半结构化长 CoT"的有效性。与以下变体比较:(1) DeepWriter(Wang et al., 2025a)——从好回复"倒推"合成推理轨迹;(2) 仅长 CoT 的标准 SFT;(3) 仅带规划的 SFT。如表 2 所示,同时含规划与思考步的本文 SFT 在各指标、各骨干上达到可比甚至更优的性能。这表明模型能更好地遵循"规划+思考"范式生成高质量多样内容,为后续 RL 奠定坚实基础;此外本文半结构化长 CoT 比无 CoT 或标准推理轨迹更具可控性,便于规划生成时的多样分支过程。

表 2: SFT 阶段规划步(P)与思考步(T)的影响(WritingBench)。

SFT 方式 P T Qwen3 Score Qwen3 Emb Qwen3 EAD Qwen3 Distinct Llama3.2 Score Llama3.2 Emb Llama3.2 EAD
SFT(标准) 5.87 10.87 8.19 4.56 12.75 8.04
w/ think 5.93 11.04 8.58 4.75 12.89 8.67
w/ plan 5.97 10.83 8.67 4.84 12.58 8.62
w/ plan+think(本文) 6.00 10.98 8.84 4.77 12.85 8.89

不同组件的消融。 见表 3。首先把基于 n-gram 的分支策略替换为基于嵌入的(DPWriter-emb),性能略降但仍优于 GRPO 基线,说明整体框架有效。接着移除分支策略(w/o branching),WritingBench 多样性指标进一步下降,表明所提分支策略有效鼓励模型在生成时探索多样内容。最后移除多样性奖励(w/o diversity reward),所有多样性指标显著下降,凸显了显式奖励多样性以引导模型学习的必要性。

表 3: RL 中各组件的消融(NB = NoveltyBench)。

方法 Qwen3 Score Qwen3 Emb Qwen3 EAD Qwen3 NB Llama3.2 Score Llama3.2 Emb Llama3.2 EAD
DPWriter-emb 6.39 10.24 8.74 8.38
w/o branching 6.41 10.05 8.63 8.59
w/o diversity reward 6.30 9.19 8.08 7.99
GRPO 6.32 9.07 8.02 7.77
DPWriter(完整) 6.43 10.45 8.81 8.66

图 4

图 4(NoveltyBench 结果)。 在 Distinct 指标上,DPWriter(Qwen 8.66 / Llama 4.64 / GRPO 对照更低)优于各基线。

6.4 案例研究

图 5 给出 NoveltyBench 上一个样本,定性比较 DPWriter 与 GRPO 的生成。可见 DPWriter 生成五条互不相同、覆盖多本哈利·波特书的回复,而 GRPO 产生的答案彼此相似——五条里有四条都是"Harry Potter and the Philosopher's Stone"。这展示了由本文分支策略与多样性奖励带来的 DPWriter 卓越多样性。更多比较见附录 D。

分支与奖励的协同。 为理解分支策略与多样性奖励的相互作用,我们分析不同分支因子 \(K \in \{16,32,64,128\}\)、有/无多样性奖励时多样性指标的变化(图 6)。观察到:分支与多样性奖励结合在所有 \(K\) 上都稳定取得最高多样性分;且随 \(K\) 增大多样性指标提升,说明更大分支因子让模型探索更广内容。当施加多样性奖励时,多样性曲线随 \(K\) 的上升斜率比无奖励时更陡——说明在多样性奖励引导下,分支策略在增强多样性上更为有效。

图 5(案例)。 指令"命名一本哈利·波特书"。GRPO 的 5 条回复里 4 条都是《魔法石》;DPWriter 的 5 条分别覆盖《密室》《阿兹卡班囚徒》《死亡圣器》《混血王子》《凤凰社》,彼此明显区分。

图 6

图 6(协同分析)。 WritingBench、Qwen3-4B 骨干,\(K \in \{16,32,64,128\}\)w/ div reward(带多样性奖励)曲线在各 \(K\) 上都高于无奖励曲线,且斜率更陡。

7 结论

本工作针对 RL 提升的一个根本局限——在一致性与性能改善的同时伴随着持续的多样性坍缩——提出一个新的半结构化长 CoT 推理框架。该框架通过规划阶段分支机制组感知的多样性贡献奖励显式引导多样性探索。在多个创意写作任务上的实验表明,本框架在不牺牲质量的前提下有效促进了输出多样性。多样规划与定向奖励信号相结合,为开放式应用中更具表现力与通用性的语言生成提供了一条有原则的路径。

局限性

尽管 DPWriter 有效提升了创意写作的输出多样性,仍存在若干局限与改进空间:(1) 依赖半结构化 CoT 与 DPB 方法会引入额外计算开销,可能限制其在超大模型或数据集上的可扩展性;(2) 虽然本工作在不损害质量的前提下提升了多样性,但二者之间的"跷跷板"效应可能未被完全解决,仍需进一步研究以更好平衡;(3) 除质量提升外,多样性是否能惠及创造力等其他方面,仍是更开放的问题。

附录 A 实现细节

RL 中模型训练 5 个 epoch,最大 prompt 长度 1024,最大回复长度 3072。分支因子 \(K=32\),DPB 中用基于 n-gram 的策略评估多样性。奖励函数中多样性权重 \(\lambda=0.6\),质量阈值 \(\tau=10\)。基于嵌入的相似度计算用 Qwen3-Embedding-0.6B 提取生成规划或回复的嵌入。推理时最大生成长度 4096,核采样 \(p=0.8\)、温度 \(T=0.7\),与 WritingBench 设置一致。

附录 B 补充相关工作

提升 LLM 多样性以缓解模式坍缩的研究大致分两类:推理时方法训练时方法(正文已讨论训练时方法)。

推理时多样性。 为在推理时增强多样性,各类方法修改下一个 token 的选择过程,无需改动模型参数即可快速灵活生成。一类常用做法是提高解码温度(Zhu et al., 2024; Peeperkorn et al., 2024),或在不同截断策略后从 token 分布中采样(Vijayakumar et al., 2016; Holtzman et al., 2020; Nguyen et al., 2024; Franceschelli and Musolesi, 2025)。一些研究聚焦提示工程,鼓励 LLM 借助更广的意图策略(Ahmed et al., 2025; Ruan et al., 2025)或在生成中引入更大随机性(Misaki and Akiba, 2025)。已有观察指出较小规模模型常展现更大输出多样性(Padmakumar and He, 2024),因此有研究探索大小模型间的协同解码,利用小模型的多样性增强大模型输出(Li et al., 2023; Wang et al., 2025c)。

附录 C 提示词

表 4:生成多维度规划的提示

任务描述: 你是一位逻辑严密、具有发散思维的作家。我会给你一对"指令—回复",请基于给定内容,从以下五个维度分析并总结该回复的核心创意构思:1)目标与受众;2)信息与视角;3)结构与逻辑;4)语言与风格;5)呈现与体验。

请注意: (1) 回复必须完整包含上述五维度,且为 JSON 格式,不要输出其他内容;(2) 回复必须体现"基于指令对回复的设计"(仿佛回复尚未写出),避免对回复做总结或评论,不使用"本文""这个""那个"等指代词;(3) 结构、写作手法等应足够具体详细。回复语言须与指令、回复的语言一致。

格式示例: {"xxx": "xxx", ...}

### Instruction: {{Instruction}} ### Response: {{Response}} ### Your reply:

表 5:生成规划一致 CoT 的提示

任务描述: 你是一位逻辑严谨、具发散思维的创意作家。我会提供一对"指令—回复",以及对回复的五维度概述(称为 Plans)。请严格参照回复与 Plans 的内容,保持 Think 的开放格式,修改 Think 中的内容以反映 Plans 的五个维度,并按要求展开思考。

请注意: (1) 确保回复完整包含 Think 风格的思考过程,直接从心理活动开始,不输出其他内容;(2) 确保回复基于指令所期望的思考过程(仿佛回复尚未写出),避免对给定回复或 Think 做总结评论,不使用"这篇""这个"等指代词,保持实验与反思的语气,避免过于技术化;(3) 不要直接写出各维度名称,而是在分开的开放段落中分别体现各维度信息;(4) 段落间过渡自然,逐步把思考引向回复,适度发散展开;(5) 在每段分析中识别问题要点并从多角度探索,提出多种可能的回复方向或方法,权衡创意后选定其一,并确保与 Plans 一致;(6) 必要时可用"用户"称呼或直接描述问题,避免"读者"一词;(7) 回复须与指令、回复的语言一致。

### Instruction: {{Instruction}} / ### Response: {{Response}} / ### Reference Think: {{Reference Think}} / ### Plans: {{Plans}} / ### Your reply:

表 6:生成长 CoT 的提示

任务描述: 你是一位具发散思维与丰富想象力的逻辑专家。我会给你一条指令和一个回复,请参照其信息,给出回复的完整思考过程。

请注意: (1) 以第一人称自语形式思考指令,呈现自然真实的心理过程,避免机械罗列要点,用数段表达;(2) 思考应有清晰结构与连贯性、严格逻辑、层层递进,用合理连词使各层自然衔接并逐步导向回复;(3) 分析中识别要点,围绕核心多方面头脑风暴,提出多种可能方向;给出可选方案后需验证创意,并确保 Think 中选定的想法与最终回复一致;(4) 思考应洞察且连贯地反映真实创作过程,展现探索中的不确定与权衡,力求阐明简洁的总览性想法而非过多细节;(5) 避免在 Think 中直接暴露回复全部信息,让各元素在自然引导下逐步浮现;(6) 确保思考体现"期望的生成"(仿佛回复尚未写出),避免总结评论给定回复,不使用"思考过程""根据上述提示""那个回复"等说法;(7) 思考须与指令、回复的语言一致。

### Given Instruction: {{Instruction}} / ### Given Response: {{Response}} / ### Thought:

附录 D 更多案例研究

图 7(WritingBench 案例)。 指令:"我要写一篇关于 AI 医学影像辅助诊断系统的研究论文,请帮我起草论文大纲。" DPWriter 先在 <think> 中给出五维度规划(目标受众为医学专业人员与研究者;信息整合医学影像基础、AI 算法、系统架构、数据管理、临床流程集成、评估指标、监管、未来方向;结构按摘要—引言—文献综述—方法—结果讨论—未来方向—结论组织;语言采用正式精准的学术语言;呈现强调可导航性与案例),再展开长 CoT 推理,最终产出层次清晰、涵盖系统架构、数据采集预处理、算法开发选择、临床流程集成、评估框架、结果讨论、未来方向(高级算法、多模态融合、临床部署、伦理监管)等完整大纲。

图 8(NoveltyBench 案例)。 DPWriter 遵循生成的规划与思考过程,产出创意且连贯的故事(如"五句话:女孩与狗"的多版本,涵盖温情、直白、暗黑反转等不同走向),每个版本都满足五句话约束并具有情感深度。