联合强化语言模型生成中的多样性与质量¶
暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。
title: 中文译文 · Jointly Reinforcing Diversity and Quality (Darling) paper_id: '2509.02534' year: '2025'
联合强化语言模型生成中的多样性与质量¶
Tianjian Li♡♢†、Yiming Zhang♡♣†、Ping Yu♡、Swarnadeep Saha♡、Daniel Khashabi♢、Jason Weston♡、Jack Lanchantin♡、Tianlu Wang♡
♡ Meta FAIR ♣ 卡内基梅隆大学(CMU) ♢ 约翰斯·霍普金斯大学(JHU)
† 本工作在 Meta 实习期间完成。通讯:Tianjian Li (tli104@jhu.edu)、Tianlu Wang (tianluwang@meta.com)。代码:https://github.com/facebookresearch/darling
译者注:本文为 arXiv:2509.02534(2025-09-03)的中文译文。该工作的方法名为 Darling(Diversity-Aware Reinforcement Learning,多样性感知强化学习)。公式、表格、图说明按原文翻译;图示以文字说明代替,原图见 PDF。
摘要¶
大语言模型(LM)的后训练往往以牺牲多样性为代价优先追求准确性与有用性。这造成一种张力:后训练虽能提升回复质量,却也会让输出分布变得尖锐、缩小想法的覆盖范围,从而限制了 LM 在头脑风暴、故事创作、问题求解等创意性与探索性任务中的可用性。我们用 多样性感知强化学习(Diversity-Aware Reinforcement Learning, Darling) 应对此挑战——一个联合优化回复质量与语义多样性的框架。其核心是引入一个学习到的划分函数(learned partition function),以衡量超越表层词汇变化的多样性;该多样性信号再与质量奖励在在线强化学习中结合,鼓励模型生成既高质量又彼此区分的输出。跨多个模型族与规模的实验表明,Darling 可泛化到两种场景:不可验证任务(指令遵循与创意写作)与可验证任务(竞赛数学)。在第一种场景的五个基准上,Darling 稳定优于仅优化质量的 RL 基线,产出同时具备更高质量与新颖性的结果;在第二种场景中,它取得更高的 pass@1(解的质量)与 pass@k(解的多样性)。最引人注目的是:显式优化多样性会催化在线 RL 中的探索,其外在表现就是更高质量的回复。
1 引言¶
多样性在众多真实应用中起关键作用(Lu et al., 2025),直接影响其有效性、实用性与创新潜力(Nagarajan et al., 2025; Zhang et al., 2025b)。例如在科学发现中,多样的假设或实验结果让研究者能探索更广的解空间,可能催生新洞察与突破(Gruver et al., 2023; Romera-Paredes et al., 2024; Si et al., 2025)。类似地,在创意写作(Fan et al., 2018)与自然对话(Li et al., 2016a)等任务中,多样输出对于需要避免重复或可预测性的创新至关重要。在 LM 的强化学习与自训练循环中,多样性同样关键:产生多样输出的策略能够充分探索动作空间,这对发现新颖有效的策略至关重要(Chen et al., 2025a; Cheng et al., 2025; Wu et al., 2025a; He et al., 2025a)。
然而,LM 的近期发展揭示了一个重大问题:后训练常导致输出分布过度尖锐化(Huang et al., 2025; Li et al., 2025b),使生成回复间的多样性显著下降(Padmakumar and He, 2024; Shypula et al., 2025),甚至共享相同前缀(Ji et al., 2025)或变为近似重复(Mahony et al., 2024; Zhang et al., 2024),降低输出的整体信息量(Lin et al., 2021; Kirk et al., 2024; West and Potts, 2025; Yang and Holtzman, 2025; Yun et al., 2025)。
为应对 LM 后训练中的多样性流失,我们提出 Darling——一个在线 RL 目标:(a) 通过学习到的分类器在语义层面衡量多样性;(b) 将多样性与质量融合,使梯度更新以"有用地区别于他人"的轨迹为条件。如图 1 所示,Darling 先用语义分类器把来自单一用户 prompt 的 rollout 划分为不同的语义簇,再与质量奖励结合,放大那些既高质量又语义多样的回复的优势。
我们在不可验证与可验证两类任务上、用多种模型族与规模验证 Darling 的有效性与泛化性。实验表明,Darling 既保留了原始模型的多样性,又在不可验证的指令遵循/创意写作与可验证的数学问题上取得更佳基准表现。贡献有三:
- 提出 Darling,一个同时优化质量与多样性的 RL 框架,防止后训练中的多样性坍缩。
- 证明一个学习到的语义分类器可作为可扩展、可泛化的多样性信号集成进在线 RL 训练。
- 表明显式优化多样性会促进更充分的探索,常在不可验证(创意写作)与可验证(竞赛数学)两类基准上都带来质量提升。
图 1(Darling 概览)。 三步:(1) 从 LLM 生成 rollout;(2) 用语义分类器划分为语义等价簇(以颜色表示);(3) 模型更新。标准 GRPO 仅按质量提升概率;Darling 放大对"多样且高质量"回复的概率提升。例:prompt"写一个关于有超能力程序员的故事",四条 rollout(Lena/Eli/Nira/Jared 四个不同设定)被分入不同语义簇,Darling 对这些多样且高质量的回复给予更大优势。
2 记号与预备知识¶
设 \(\mathcal{S}\) 为自然语言 token 序列集合,语言模型 \(\pi(\cdot|x)\) 以序列 \(x \in \mathcal{S}\) 为输入、输出 \(\mathcal{S}\) 上的概率分布;记特定序列 \(y \in \mathcal{S}\) 的概率为 \(\pi(y|x)\),第 \(t\) 个 token 为 \(y_t\)。给定奖励函数 \(r: \mathcal{S} \times \mathcal{S} \to \mathbb{R}\),把指令-回复对 \((x,y)\) 映射为标量 \(r(x,y)\),LM 后训练求解如下 KL 约束优化问题:
其中 \(\mathcal{D}\) 为 prompt 数据集,\(\pi_{\text{ref}}\) 是不希望偏离太多的参考模型(通常取优化前的 LM)。GRPO(Shao et al., 2024)通过最大化以下目标来优化 (1):
其中 \(n\) 为每个 prompt 的回复数;
为当前策略 \(\pi_\theta\) 与生成 \(y_i\) 的 actor \(\pi_{\text{act}}\) 间的重要性采样比(Kloek and van Dijk, 1978);
为回复 \(y_i\) 的优势(衡量其相对平均回复的好坏程度);\(\epsilon\) 是防止重要性采样项过大/过小的超参。GRPO 及其变体(Yu et al., 2025; Liu et al., 2025c; Hu, 2025)因简单稳定,被广泛用作 LM 后训练的主力算法(DeepSeek-AI et al., 2025; Liu et al., 2025a; Yang et al., 2025a)。本文以 GRPO 为起点基线。
3 Darling:多样性感知强化学习¶
如图 1 所示,Darling 先用我们训练的分类器(§3.1)对回复划分以捕捉语义相似度,再在 RL 框架中把多样性函数与质量信号结合(§3.2),生成多样且高质量的回复。
3.1 把回复划分为语义等价类¶
我们先把工作中用到的多样性形式化定义:给定两条生成间的成对距离度量 \(d: \mathcal{S}\times\mathcal{S}\to\mathbb{R}^+\),以及一组 \(n\) 条生成 \(y_1,\ldots,y_n\),定义 \(y_i\) 相对其他所有生成的多样性为其与所有其他生成 \(y_j\,(j\neq i)\) 的平均成对距离:
我们希望引入一个可扩展的语义多样性度量,捕捉超越表层变化的更深差异。沿用 Zhang et al. (2025b),我们训练一个二分类器判定两条回复是否语义等价:
被判为等价的回复聚为一簇,形成对所有回复的一个语义划分;同一簇内多个成员相较单一代表几乎不提供额外价值。我们直接令多样性度量 \(d = \mathrm{classify}(\cdot,\cdot)\)。图 2 给出从划分计算多样性的示例:对单个 prompt"写一个关于编程的短笑话",左列(蓝色)的回复被判为语义等价(都利用"bug"一词的多义);右列(紫色、黄色)与其他回复均不同。对任一蓝色回复,仅有两条(紫、黄)与之不同,故由 (4) 其多样性为 2/3;而黄、紫回复与其他全部不同,多样性为 3/3。
图 2(多样性计算示例)。 prompt"写一个关于编程的短笑话"。三条"程序员喜欢深色模式/被光吸引 bug"的回复被判为等价(簇内),另两条("开发者用光缓存/函数与变量分手")各自独立。多样性 = 与之不同的回复数占总数的归一化比例。
3.2 Darling:多样性感知强化学习¶
给定多样性函数 \(\mathrm{Div}_d\) 与奖励函数 \(r\),定义多样性感知奖励 \(r_{\text{darling}}\) 为:
其中 \(\mathrm{Norm}(\cdot)\) 把多样性值归一化到 \([0,1]\)。
我们选择相乘而非相加。 把质量与多样性奖励相加虽是可行做法,但二者尺度不同会带来问题:朴素相加可能让模型偏向其中一个奖励(详见 §6.1 对不同融合方式的消融)。Darling 把 (5) 代入 (1),放大那些高质量且与他人不同的回复的有效奖励 \(r_{\text{darling}}\)。受以往工作启发(Liu et al., 2025c; Yu et al., 2025),我们还做如下修改:把 (2) 中的序列级损失平均改为 token 级平均(前者偏向更长序列);并去掉 (3) 中按标准差的归一化(它在密集奖励下会放大噪声)。归一化的影响详见 §6.3。
Darling 的总体损失定义为:
其中使用多样性感知奖励 \(r_{\text{darling}}\) 作为有效奖励:
相比标准 GRPO,我们的核心修改是:把归一化的多样性奖励 \(\mathrm{Norm}(\mathrm{Div}_d)\) 与质量奖励 \(r(x,y)\) 相乘,以在训练中促进高质量且多样的奖励——这放大了对既高质量又多样的回复对数似然的提升,从而联合强化质量与多样性。
4 Darling 在不可验证任务上¶
4.1 设置¶
模型与基线。 以 Llama-3.1-8B-Instruct 与 Llama-3.3-70B-Instruct(Llama Team, 2024)为参考模型在其上训练。训练数据为 WildChat(Zhao et al., 2024)随机采样的 10K prompt 子集,与 Lanchantin et al. (2025a) 设置一致。质量奖励用 Nexusflow/Athene-RM-8B(Frick et al., 2024)。batch size 为 {32(8B), 64(70B)} prompts × 每 prompt 8 rollouts,最大 rollout 长度 1024 token。其他超参见附录 B。
比较基线:GRPO(标准 GRPO + token 级均值聚合);DivPO(Lanchantin et al., 2025a,基于 DPO,在高质回复中选最多样的为 chosen、最不多样的为 rejected);GRPO-Unlikeliness(He et al., 2025a,按似然反向加权,低似然回复得更高奖励)。基于 verl(Sheng et al., 2024)实现,推理用 vLLM(Kwon et al., 2023)、训练用 FSDP(Zhao et al., 2023)。Zhang et al. (2025b) 原分类器上下文限 512 token,我们用同样人工标注数据训练了一个 8192 token 上下文的分类器(细节见附录 A.1)。
评测基准与指标。 质量用 AlpacaEval 2.0(Li et al., 2023; Dubois et al., 2024)、ArenaHard v2.0(Li et al., 2025a)、EQ-Bench 创意写作(Paech, 2023)。报告 AlpacaEval 2.0 的长度控制胜率(LCWR)、ArenaHard v2.0 创意写作 prompt 上经风格(markdown、长度)控制的胜率(WR)、EQ-Bench 的归一化 ELO。AlpacaEval 与 ArenaHard 用 GPT-4o 作裁判,EQ-Bench 用 Claude 3.7 Sonnet。多样性用 NoveltyBench(Zhang et al., 2025b),报告语义不同生成数(Distinct)与按长度归一化的平均不同 4-gram 数(Distinct-4)。
4.2 实验结果¶
Darling 在所有基准上同时取得最佳质量与多样性。 表 1 为主结果:Darling 能同时优化质量与多样性——在各基线中取得最佳质量分(AlpacaEval、ArenaHard 胜率),同时在语义层(Distinct)与词汇层(Distinct-4)也最多样。此外,尽管未显式在创意写作 prompt 上训练,Darling 在 EQ-Bench(创意写作)上取得最佳 ELO,说明提升多样性对创意任务有效。
表 1: 不可验证任务评测。每方法在 10K WildChat prompt 上训练单模型。AE=AlpacaEval 2.0 长度控制胜率,AH v2.0/v1.0=ArenaHard(创意写作子集),EQ-Bench=ELO,NoveltyBench=Distinct。* 表示用 GPT-4o 作裁判。所有指标越高越好。
| 模型 / 方法 | AE 2.0* LCWR(%) | AH v2.0* WR(%) | AH v1.0* WR(%) | EQ-Bench ELO | NoveltyBench Distinct(#) | Distinct-4(%) |
|---|---|---|---|---|---|---|
| Llama-3.1-8B-Instruct | 31.9 | 7.1 | 30.9 | 636 | 5.28 | 93.9 |
| GRPO | 48.7 | 61.1 | 45.5 | 659 | 2.08 | 92.8 |
| DivPO | 43.5 | 54.4 | 39.7 | 639 | 4.34 | 94.1 |
| GRPO-Unlikeliness | 45.6 | 59.5 | 46.2 | 724 | 3.53 | 93.2 |
| Darling | 55.2 | 68.8 | 63.7 | 905 | 5.49 | 96.0 |
| Llama-3.3-70B-Instruct | 44.6 | 17.7 | 64.9 | 737 | 2.95 | 91.7 |
| GRPO | 73.3 | 89.7 | 79.2 | 1261 | 2.31 | 94.6 |
| GRPO-Unlikeliness | 69.5 | 84.2 | 76.4 | 1346 | 3.15 | 95.2 |
| Darling | 80.4 | 91.2 | 85.7 | 1531 | 4.26 | 95.3 |
Darling 通过改变采样温度改善了质量-多样性的帕累托前沿。 我们变化两个模型(8B、70B,经 GRPO 与 Darling 训练后)的采样温度 \(T\in\{0.2,0.4,0.6,0.8,1.2\}\)。图 3 表明 Darling(蓝)在两种规模下都同时比基线(绿)与 GRPO(橙)具备更高质量与更高多样性,推动了"质量-多样性权衡"(Zhang et al., 2021; Padmakumar et al., 2025)的帕累托前沿前移。
定性分析(EQ-Bench)。 EQ-Bench 提供详细评分细则并由 Claude-3.7-Sonnet 打分。图 4 给出 Darling 在哪些细则上对相近 ELO 模型胜率最高/最低。Darling 的优势在于能生成多样输出,故在"有趣且原创"与"避免陈词滥调"上胜率最高(88.7%、88.3%)。创意写作示例见附录 C.1。
图 4(细则胜率)。 Darling 对相近 ELO 模型胜率最高的三个细则:Avoids Cliche(避免陈词)、Interesting and Original(有趣且原创)、World and Atmosphere(世界与氛围);最低的:Verbose(啰嗦)、Instruction Following、Cliches、Coherence(连贯)。其强项正是"有趣原创/避免陈词"。
定性分析(NoveltyBench)。 图 5 与附录 C.2 给出定性示例。Darling 训练的模型在四次并行生成中一致展现更高语义多样性。即便出现重复——如图 5 第二、四条都建议 Bellroy——输出仍具实质区别:各给出不同理由。附录 C.2 中类似趋势:Darling 模型不仅整体更多样,在重复简单输出(如随机数、随机动物)时也会在解释上引入变化。
图 5(钱包购物示例)。 Prompt:"我在网购一个新皮夹,第一个该看的店/网站是?只给一个建议。" Llama-3.3-70B-Instruct 四次都答"Amazon";经 Darling 训练后分别答 Fossil、Bellroy(详述设计/保修)、Coach.com(比较功能)、Bellroy(不同理由:鞣制工艺影响耐久)——明显更多样。
5 Darling 在可验证任务上¶
5.1 设置¶
模型、基线与基准。 在 Qwen3-4B-Base 与 Qwen3-14B-Base(Yang et al., 2025a)上用 DeepScaleR 数据集(Luo et al., 2025)训练;先滤除因缺图无法作答的问题,再采样 10K 条。在四个竞赛数学基准上与 GRPO 比较:AIME25(Art of Problem Solving, 2025)、OlympiadBench(He et al., 2024)、HMMT 2025、Brumo 2025(Balunović et al., 2025)。特意选择这些基准,因为它们与 Qwen3 同期发布,可避免潜在数据污染。用 HuggingFace Math-Verify 库自动判答案对错,正确 \(r=1\)、错误 \(r=0\)。报告 pass@1 为质量、pass@k 为多样性。为评估到 \(k=128\) 的 pass@k,每 prompt 采样 \(n=256\) 条回复;pass@1 取 256 例平均以降低小基准方差。用 Chen et al. (2021) 的无偏估计:
其中 \(c\) 为正确生成数。多样性提升应带来 pass@k 改善——模型生成越多样,越可能命中正确答案。
为数学训练等价分类器。 Zhang et al. (2025b) 的标注数据来自 WildChat 的非可验证任务。为适配数学,我们从 DeepScaleR 采样 prompt,用 8 个不同模型族/规模的模型生成轨迹,用 Llama-3.3-70B-Instruct 标注轨迹对是否语义等价,再微调 Qwen3-Embedding-4B 得到数学语义等价分类器(细节见附录 A.2)。
5.2 实验结果¶
Darling 在竞赛数学上同时提升 pass@1 与 pass@k。 图 6 给出从 \(k=1\) 到 \(k=128\) 的 pass@k。Darling 在质量与多样性上都优于 GRPO:对 pass@1(质量),4B/14B 模型在 4 个基准上平均分别提升 +3.51%/+1.90%;对 pass@128(多样性),平均提升 +7.62%/+10.16%。这表明联合强化质量与多样性可在竞赛数学上"鱼与熊掌兼得"。此外,在最难的 HMMT 上提升最大,说明增强探索在更难数据集上收益更大。各数据集准确率见附录 E。
6 消融¶
6.1 相乘 vs 相加聚合¶
朴素做法是把质量奖励 \(r\) 与多样性信号 \(\mathrm{Div}_d\) 相加(许多工作对长度(Aggarwal and Welleck, 2025; Liu et al., 2025b)、熵(Cheng et al., 2025)、格式(Wu et al., 2025b)等辅助奖励用加法聚合)。我们在不可验证设置下消融相加 vs 相乘(公式 5),结果见表 2。聚合时手动对 \(r\) 与 \(\mathrm{Div}_d\) 分别做归一化(减均值除标准差)。观察到:相乘(Darling)在 AlpacaEval 2.0 上优于相加,在 ArenaHard v2.0 与 NoveltyBench 上相近。我们选相乘因其简单——无需处理不匹配的奖励尺度与混合权重调参。
表 2(摘要)。 Llama-3.1-8B 上:Quality only(GRPO) LCWR 31.92 / Distinct 5.28;Quality+partition(相加) 53.17 / 5.23;Darling=Quality×partition 55.15 / 5.49。相乘整体最佳。
6.2 词汇多样性度量¶
我们研究能否用简单词汇多样性度量替代划分分类器:在在线 RL 中用"不同 N-gram 数"替代语义等价分类器:
实验取 \(N=4\),记为"Quality × 4gram"(表 3)。观察到:4gram 多样性与质量结合在 LM-as-Judge 评测(AlpacaEval、ArenaHard)上能与 Darling 匹敌,但在语义多样性评估(NoveltyBench)上明显劣于 Darling。
此外在竞赛数学上(表 4),用词汇多样性作奖励在 pass@1 上劣于 GRPO 基线。分析生成发现:策略常通过生成其他语言或对题目难度的自我反思来"钻营" ngram 多样性奖励(示例见附录 G)。这说明词汇多样性奖励在数学任务上有害。
6.3 GRPO 中优势归一化的消融¶
Liu et al. (2025c) 指出 (3) 中除以 \(\mathrm{std}_j r(x,y_j)\) 会有效上调那些奖励方差低的 prompt 的权重(如奖励几乎全 1 或全 0 时)。我们将其推广到奖励为任意标量(Bradley–Terry 式奖励模型)的更一般设置。形式上,设 \(r_i = f_i + \varepsilon_i\)(\(f_i\) 为真实效用、\(\varepsilon_i\) 为方差 \(\tau^2\) 的噪声)。带归一化的 GRPO 计算 \(\hat{r}_i = (r_i - \bar{r})/\sigma_r\),\(\sigma_r^2 \approx \mathrm{Var}(f) + \tau^2\),使每个 prompt 对梯度更新贡献单位方差。其效应是:当 \(\tau^2\) 相对 \(\mathrm{Var}(f)\) 较大(密集但含噪奖励)时放大噪声——即便回复间差异极小也被放大到量级一。去掉归一化得 \(\tilde{r}_i = r_i - \bar{r}\),保留奖励差异的真实尺度。故:奖励可靠(高信噪比)时归一化有益,奖励含噪且密集聚集时有害。
实证上,在密集含噪奖励(Bradley–Terry 式)的不可验证设置中,去掉标准差项既提升质量也提升多样性(表 5)。而在奖励稀疏无噪的场景(数学,二值确定性奖励,附录 F),归一化几乎无影响——方差完全来自真实差异。
表 5(摘要)。 Llama-3.1-8B:GRPO w/o norm 相比 GRPO,LCWR 48.74→57.01、Distinct 2.08→2.28;Darling(partition) w/o norm 达 LCWR 62.17、Distinct 3.35;完整 Darling = partition w/o norm:LCWR 55.15(+3.51)、WR 65.34、Distinct 5.49(+2.14)、Distinct-4 96.04。去掉归一化在密集奖励下全面受益。
7 相关工作¶
训练时多样性策略。 神经 LM 常生成重复输出(Li et al., 2016b; Zhang et al., 2021)。以往工作通过修改最大似然训练目标鼓励多样性:Li et al. (2016b) 最大化互信息以避免"我不知道"类通用回复;Welleck et al. (2020) 惩罚回复内重复;其他方法平滑/修改 one-hot 目标分布(Li et al., 2020 高斯先验;Zhang et al., 2024 匹配高熵分布;Li et al., 2025b 稀疏 logit 更新)。除交叉熵外,DivPO(Lanchantin et al., 2025a)及其"软"变体(Chung et al., 2025; Ismayilzada et al., 2025)同时优化质量与多样性偏好。在线 RL 中,He et al. (2025a) 按似然重加权奖励;Lanchantin et al. (2025b) 指出简单熵正则并非易事;Slocum et al. (2025) 把多样性损失归因于 KL 正则并解耦其项。与本文并行的 Chen et al. (2025a) 在数学中下调不确定解的权重。Darling 与它们两点关键不同:(1) 使用语义级多样性信号,超越表层词汇变化;(2) 直接在在线 RL 中塑造奖励,而非修改预训练交叉熵(Li et al., 2020)或离线微调(Li et al., 2025b; Lanchantin et al., 2025a 等)目标。
推理时多样性策略。 从神经 LM 解码多样输出已有大量研究:修改 beam search(Cho, 2016; Li and Jurafsky, 2016; Vijayakumar et al., 2018 等);与提高采样温度对比(Ippolito et al., 2019a;Peeperkorn et al., 2024);利用 prompt 激发多样回复——条件化于随机种子(Nagarajan et al., 2025)、不同人格(Shur-Ofry et al., 2024; Ge et al., 2025)、过往生成(Lu et al., 2024),或直接要求模型"多样"(Zhang et al., 2025b)。Padmakumar et al. (2025) 与 Zhang et al. (2025b) 的综合评测表明,这类提示方法提升多样性常以质量下降为代价。本文直接修改训练目标,与测试时激发多样性的解码方法正交且兼容。
8 结论¶
本文提出 Darling——一个同时优化质量与多样性的在线 RL 方法。不同于以往常导致多样性坍缩的 RL 方法,Darling 有效保留了模型生成的多样性。通过多种定性与定量实验,我们展示了它在不同模型族与规模、可验证与不可验证任务上的有效性。
附录 A 回复划分¶
A.1 不可验证任务的分类器¶
Zhang et al. (2025b) 让人工标注者判断模型生成回复对是否语义等价,覆盖 1100 个 prompt(共 2200 条回复)。我们直接用其标注,把两条回复拼接为 [CLS] response1 [SEP] response2 [CLS],在第二个 [CLS] 上做分类。训练一个 ModernBERT-base(Warner et al., 2024),用 1000 条 NoveltyBench 标注(2000 条回复),支持最大 8192 token 上下文。在 100 个 prompt(200 条回复)的留出集上评测(图 7):(1) 我们训练的分类器(准确率 78%)与原 NoveltyBench 分类器(79%)性能相近;(2) 用 GPT-4o、o1-mini 等专有模型判断语义等价的效果不如分类器。用于让 LM 判定两回复是否语义相似的提示见图 8。
A.2 可验证任务的分类器¶
原 NoveltyBench 仅支持非可验证任务(prompt 来自 WildChat 的创意写作)。因此我们额外在模型生成的解题轨迹上用 Qwen3-4B-Embeddings 训练分类器:用 DeepScaleR 的 prompt,以下列模型生成轨迹——Qwen3-4B-Base、Qwen3-8B-Base、Qwen3-4B(不思考)、Qwen3-8B(不思考)、OctoThinker-8B-Long-Base、Qwen2.5-Math-7B-Instruct、QwQ-32B、Llama-4-Maverick——覆盖不同类型(base/instruct)、族与规模。用图 9 提示让 Llama-3.3-70B-Instruct 作"两个数学解法是否相似"的 ground truth。训练的分类器在 200 例留出集上达 89% 准确率。
附录 B 超参¶
不可验证任务(WildChat,GRPO)。 8B/70B 分别用 1/4 节点 NVIDIA H200。最大 prompt 长度 512、最大回复长度 1024;学习率 1e-6;KL 系数 β=0.001(low_var_kl);rollout n=8、温度 1.0、vLLM、GPU 利用率 0.8;奖励模型 Athene-RM-8B;mini/full batch 32/64(完全 on-policy);总 10 epoch。
可验证任务(DeepScaleR,数学)。 最大 prompt 长度 1024、最大回复长度 8192;学习率 1e-6;β=0;rollout n=8、温度 1.0、GPU 利用率 0.7;奖励为规则(Math_Verify);mini batch 64、full batch 256(4 步离策略)、clip (0.2, 0.2)、8 节点 ×8 GPU、10 epoch。
评测超参。 AlpacaEval 2.0 / ArenaHard:GPT-4o 裁判、max len 8192、T=0.6、top-p=0.9。EQ-Bench:Claude-3.7-Sonnet、max len 4096、T=1.0、min-p=0.1。NoveltyBench:T=1.0、max len 4096、划分模型 deberta-v3-large-generation-similarity、奖励模型 Skywork-Reward-Gemma-2-27B-v0.2。竞赛数学:T=0.6、top-p=0.95、max len 12000。
附录 C 生成示例¶
C.1 EQ-Bench 创意写作示例(图 10)¶
Prompt(摘要):第一人称 1000 字。25 岁大胆艺术生 Dani 与 19 岁轻声细语的 nu-goth 同学 Elliot 配对做深夜暗房项目;红光下 Elliot 坦承在质疑自己的性别认同;探索 Dani 的吸引、保护欲、对自身取向的困惑,捕捉亲密笨拙的对话,结尾温柔、悬而未决但充满希望。 - Llama-3.1-405B-Instruct:产出平直对话("Hey, Dani? Can I tell you something?"……)。 - Llama-3.1-8B-Instruct + Darling:使用艺术隐喻——"她帮他冲洗出一张近乎透明的照片,淡色花朵仿佛在皮肤里生长……'就像光从内部生长',她说",用曝光的隐喻呼应 Elliot 的内心。
C.2 NoveltyBench 示例¶
- Prompt"在 1 到 100 间选个数":Llama-3.3-70B 四次都答 53;Darling 分别答 53、73、67、53,并各自给出不同理由(密码学伪随机、避开人类偏置等)。
- Prompt"随机选一种动物":Llama-3.3-70B 四次都答 Quokka;Darling 分别答 Axolotl、Quokka(独特栖息地事实)、Quokka(与微笑不同的冷门事实)、Narwhal("海中独角兽")——即便重复 Quokka 也给出实质不同的解释。
附录 D 基准描述¶
不可验证。 AlpacaEval 2.0(805 prompt,与 GPT-4-turbo 对比,胜率/长度控制胜率越高越好);Arena-Hard v1.0/v2.0(750 prompt,数学编程与创意写作各半,与基线对比胜率);EQBench 创意写作 v3(32 prompt,Claude Sonnet 按细则与成对比较打分,给 Elo;强调幽默、浪漫、不寻常视角等难题);NoveltyBench(1100 个 WildChat prompt,需多样回复;多样性用划分分类器测、质量用奖励模型测;本文主要用 distinct 分类器,因其训练于人工标注,而奖励模型易被 reward hacking)。
可验证。 4 个竞赛数学基准:OlympiadBench(675 题)、AIME 25、Brumo、HMMT(后三者各 30 题)。
附录 E 数学完整结果¶
表 9(Qwen3-4B-Base)与表 10(Qwen3-14B-Base)给出各基准 pass@1…pass@128。摘要(Avg pass@1 / pass@128):
- Qwen3-4B-Base:Base 25.23/40.05;GRPO 26.86/53.42;Darling 30.60/61.04。
- Qwen3-14B-Base:Base 19.30/55.32;GRPO 32.18/59.93;Darling 35.10/70.17。
Darling 在两个规模、所有 \(k\) 上都优于 GRPO,且在最难的 HMMT 上提升最大。
附录 F 数学中去除归一化¶
表 11:数学任务(二值、稀疏、无噪奖励)上去除"除以标准差"影响很小(GRPO 与 GRPO w/o norm 的 pass@1/pass@128 几乎相同)。与表 5(密集含噪奖励下去除归一化受益)形成对比。
附录 G 多样性奖励的"钻营"(reward hacking)¶
图 11 给出 Qwen-4B-Base 用 GRPO + ngram 多样性奖励训练的节选:模型在最终答案"8"之后,开始生成对自身表现与题目难度的反思("Identifying Tough Parts… What I Learned… Score Prediction…"),这些内容与解题无关——纯粹为钻营 ngram 多样性奖励。
附录 H 补充相关工作¶
文本多样性评估。 传统方法看单词及其频率(TF-IDF、Distinct-n),但不同词汇与顺序可能表达相近语义,故有神经网络方法(嵌入距离)。以往工作用词法度量(不同 n-gram 数、Self-BLEU)与神经度量(嵌入相似度、对数似然差、梯度相似度、LM-judge)。LM-judge 灵活但计算开销大、难集成进在线训练,故本文沿用 Zhang et al. (2025b) 微调一个分类器;Shypula et al. (2025) 也把回复划为语义等价子组,但用代码定义等价(两程序对所有测试输入产生相同输出即等价)。
LM 强化学习中的探索。 并行工作通过调超参(clip 比例 Yu et al., 2025;KL 约束 Liu et al., 2025a; Cui et al., 2025;熵损失 He et al., 2025b)、用 pass@k 作奖励(Chen et al., 2025b)、调整数据生成(Yang et al., 2025b; Liang et al., 2025)等促进探索。但 Liu et al. (2025d) 发现能跨模型类型/规模泛化的技巧很少,且更高熵(更多探索)不总带来更好性能。本文不调整数据生成、不引入额外超参,而是提出一个简单的奖励加权机制,显式激励对"高质量且多样"回复更大的梯度更新。
后训练中的多样性坍缩。 LM 常被诟病缺乏多样性与创造力。后训练把策略引向高奖励的集中区域,故常伴随词汇与语义变化的显著流失。但多样性不仅对创意/探索应用关键,LM 后训练自身的 rollout 也依赖生成间多样性(Yu et al., 2025; Zeng et al., 2025; An et al., 2025),因此增强生成间多样性仍是根本挑战。