WritingBench:面向生成式写作的综合基准¶
暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。
WritingBench:面向生成式写作的综合基准¶
原题:WritingBench: A Comprehensive Benchmark for Generative Writing
arXiv:2503.05244,v4,2025-11-27
作者:Yuning Wu、Jiahao Mei、Ming Yan、Chenliang Li、Shaopeng Lai、Yuran Ren、Zijia Wang、Ji Zhang、Mengyue Wu、Qin Jin、Fei Huang
机构:阿里巴巴集团;中国人民大学;上海交通大学
通讯作者:Ming Yan、Qin Jin
会议:NeurIPS 2025
翻译依据:arXiv v4 PDF 与 LaTeX source。数值均按论文表格保留;参考文献引用以作者在源码中的引用键或模型名表述,完整书目见 source/acl_latex.bib。
摘要¶
大语言模型(LLM)的近期进展显著增强了文本生成能力,但如何评估其生成式写作表现仍是难题。现有基准主要关注通用文本生成,或只覆盖有限的写作任务,无法反映不同领域中高质量写作内容的多样要求。
为弥补这一缺口,本文提出 WritingBench:一个覆盖 6 个核心写作领域和 100 个子领域的综合基准。作者还提出查询依赖评估(query-dependent evaluation)框架,让 LLM 为每个实例动态生成专属评价准则;再配合一个微调后的 critic model,依据这些准则评分,并专门评估风格、格式与长度。该框架还可用于数据筛选:用它筛出的数据训练 7B 模型,写作表现超过 GPT-4o。作者公开基准、评估工具与模块化框架组件,以推动 LLM 写作研究。
- 代码:https://github.com/X-PLUG/WritingBench
- 排行榜:https://huggingface.co/spaces/WritingBench/WritingBench
1. 引言¶
LLM 已在创意内容、教育辅助和专业工作流等场景展示出强大文本生成能力。然而,生成式写作同时要求连贯性、创造性、逻辑推理和精确的文体控制,现有评估方法难以充分覆盖。

图 1: 用颜色标出不同要求的查询示例;红色短语与灰底的写作支持材料相对应。
现有生成式写作基准有两类主要缺陷:
- 任务范围与多样性有限。 不少基准只覆盖小说等单一领域;任务常是单句提示或少量固定模板;输入材料来源也高度同质,难以表现现实写作中复杂、定制化的要求。
- 复杂写作任务的评价指标不足。 LLM judge 能捕捉语义,但通常只使用流畅性、连贯性等少数预定义准则。随着写作能力提高,这些静态准则不足以衡量创造性、论证强度和领域规范遵循等多维能力。

图 2: WritingBench 查询的构建流程。细化池包含五类写作要求,其中三个黑框项目是核心能力,紫色项目是表达形式。勾选的策略把初始查询改写为包含多项要求的提示;红色文本引用灰色材料。
WritingBench 先依据真实写作需求设计二级领域分类,再采用四阶段查询构建流水线:LLM 生成和多样化写作请求,人类收集材料并优化数据。所得任务覆盖面广、要求多样,且能够结合异构材料。
在评估侧,框架让 LLM 为每个查询动态生成五条准则,再由微调后的 critic model 评分。作者还用这一框架过滤写作训练数据并训练小模型,以验证其识别高质量样本的能力。
本文贡献如下:
- 发布 WritingBench:1,000 条查询,覆盖 6 个一级领域、100 个子领域,包含风格、格式和长度要求;输入从数十词到数千词,可系统分析真实写作能力及其短板,并显示 CoT 对创造性任务的潜力。
- 提出查询依赖评估框架,把实例级准则生成与准则感知评分模型结合。其人类一致性为 84%,高于静态准则基线的 67% 和 58%。
- 证明该框架能筛选写作数据:用筛选数据训练的小模型写作表现超过 GPT-4o。作者公开评估协议、准则生成工具、critic model 与写作增强模型。
源码单位差异: 引言贡献段把输入范围写成“数十到数千 words”,但基准比较表和数据统计表的对应列明确使用 token,最大值为 19,361 token。译文不把二者强行统一:叙述处保留作者的“词”表述,数值表按源码列名保留 token。
2. 相关工作¶
2.1 写作基准¶
现有写作基准在领域覆盖和任务粒度上都有明显限制。EQ-Bench 的创意写作子集主要是故事类模板查询;LongBench-Write 在 120 个查询中加入长度约束,但两者都缺少层次化领域分类及风格、格式等多维要求。HelloBench 等基准常依赖固定指令模板、短上下文或单一来源材料。
WritingBench 提供 1,000 条自由形式查询,分布在 6 个一级领域和 100 个子领域,能够控制风格、格式和长度,输入长度从数十词到数千词。
表 1:现有写作基准比较。 “—”表示论文未提供或不适用。
| 基准 | 数量 | 一级领域 | 二级领域 | 风格 | 格式 | 长度 | 平均输入 token | 最大输入 token | 自由查询形式 | 多样材料来源 |
|---|---|---|---|---|---|---|---|---|---|---|
| EQ-Bench | 241 | 1 | — | ✗ | ✗ | ✗ | 130 | 213 | ✗ | — |
| LongBench-Write | 120 | 7 | — | ✗ | ✗ | ✓ | 87 | 684 | ✓ | — |
| HelloBench | 647 | 5 | 38 | ✗ | ✗ | ✓ | 1,210 | 7,766 | ✗ | ✗ |
| WritingBench | 1,000 | 6 | 100 | ✓ | ✓ | ✓ | 1,699 | 19,361 | ✓ | ✓ |
2.2 评估方法¶
LLM-as-a-judge 已成为评价生成结果的常用方法。研究者通常预先定义一组适用于全部样本的固定维度:SuperCLUE 使用 3 个维度,LongBench-Write 使用 6 个维度;HelloBench 有任务专属维度,但同一任务中的所有查询仍共用这些维度。静态维度难以适应不同写作风格、复杂规范及材料丰富的输入。
Fennec 曾训练模型为单个查询动态生成评价维度,但生成范围仍受限于一个较小的预定义集合。WritingBench 则让 LLM 生成开放、多样、实例专属的准则,并微调专用 critic model 执行评分。
2.3 写作增强模型¶
Weaver、Suri、LongWriter 等模型分别在特定写作领域或长度控制上有优势,但跨领域和多约束场景会明显退化。本文利用评估框架筛选高质量数据,训练跨任务写作增强模型。
3. WritingBench¶
本节介绍四阶段人机协作构建流程、查询依赖评估框架及其 critic model,并通过训练写作增强模型验证数据筛选能力。
3.1 基准构建¶
WritingBench 将模型生成的查询细化与人工标注结合,以保证多样性和现实相关性。
3.1.1 模型增强的查询生成¶
这一阶段先由 LLM 生成初始写作查询,再通过系统化指引扩充并多样化;需要时,模型同时建议应补充哪些材料。

图 3: WritingBench 领域分类。内圈为 6 个一级领域,外圈为 100 个二级子领域。
表 2:WritingBench 数据统计。
| 分组 | 类别 | 数量 | 平均 token | 最大 token |
|---|---|---|---|---|
| 领域 | 学术与工程 | 167 | 1,944 | 15,534 |
| 领域 | 金融与商业 | 210 | 1,867 | 19,361 |
| 领域 | 政治与法律 | 201 | 2,363 | 18,317 |
| 领域 | 文学与艺术 | 183 | 1,266 | 7,675 |
| 领域 | 教育 | 111 | 1,345 | 10,737 |
| 领域 | 广告与营销 | 128 | 984 | 6,504 |
| 要求 | 风格 | 442 | 1,728 | 19,361 |
| 要求 | 格式 | 498 | 1,715 | 15,534 |
| 要求 | 长度 | 222 | 1,362 | 14,097 |
| 输入长度 | 0–1K | 550 | 470 | 994 |
| 输入长度 | 1K–3K | 292 | 1,832 | 2,991 |
| 输入长度 | 3K–5K | 87 | 3,828 | 4,966 |
| 输入长度 | 超过 5K | 71 | 8,053 | 19,361 |
阶段 1:初始查询生成。 作者建立由 6 个一级领域和 100 个子领域组成的二级领域池,覆盖传统与新兴 AI 辅助写作需求。六个一级领域是:学术与工程、金融与商业、政治与法律、文学与艺术、教育、广告与营销。以领域标签为条件,GPT-4o 与 Claude-3.5-Sonnet 生成大量模拟真实用户请求的初始草稿。
阶段 2:查询多样化。 作者设计 3 项核心要求和 3 个辅助维度:
- 风格调整,例如使用儿童易懂的友好、简单语气;
- 格式规范,例如遵循 IEEE 会议模板;
- 长度约束,例如生成 500 词的执行摘要;
- 个性化,例如从有 20 年经验的教育工作者视角写作;
- 内容具体化,例如详述 2023 年第三季度财务指标;
- 表达方式,例如把查询改得更简洁。
前三项会进入专项评估。细化查询时,LLM 还会建议必要材料,如市场分析需要的财报。

图 4: 针对 WritingBench 查询动态生成评价准则的示例;不同底色代表不同类型的要求。
3.1.2 人在回路中的细化¶
模型输出只用作规模大、语言多样的草稿池。人类专家负责核验查询、补充所需材料、保证场景真实,并清除有害内容。
阶段 1:材料收集。 30 名受训标注员参与,报酬为每小时 18 美元;其领域知识通过测试验证。他们收集任务所需的公开材料,如财报或法律模板。每条查询可以对应多份材料,也可能不需要外部材料。为避免异构文档解析错误和网页广告等噪声,标注员只提取并核验最相关的文本片段。
阶段 2:专家优化。 5 名有 LLM 使用经验或相关行业背景的专家筛选数据。先剔除不现实、过度泛化、低质量或可能有害的条目,再进行两阶段复核:
- 查询适配:修改含混表达,使其更贴合材料与实际场景;
- 材料裁剪:删除冗余或无关信息,保持上下文聚焦、相关且无害。
专家也可创作原创高质量查询,再由同行交叉核验。最终得到 1,000 条查询,其中中文 445 条、英文 555 条。
3.2 查询依赖评估框架¶
静态写作准则存在三类局限:
- 领域覆盖不足: 无法适应技术文档、创意写作等专业领域的独特性质;
- 要求不够具体: 不能灵活覆盖风格、格式或长度控制;
- 材料依赖缺失: 无法核验回答是否正确使用参考材料,例如是否纳入指定数据、是否维持叙事连续性。
本文框架包含两个阶段。
阶段 1:动态准则生成¶
给定查询 \(q\),LLM 自动生成五条评价准则:
选择五条准则与多个当代评估设置的常见做法一致。作者使用 Claude-3.7,因为它生成的准则比 GPT-4o 更全面、更多样。每条准则包含:简短名称、详细评价焦点和细粒度的分档量表。人类标注员再审核准则是否合理并确认不含有害内容。
作者从现实写作场景中识别出风格、格式和长度三类常见要求,并为每类要求构建两个子集。两名标注员把每个 \(C_q\) 中的准则标为风格、格式、长度或无关:
- 要求涉及子集(R1/R2/R3): 只要某查询的任一准则涉及某项要求,就把该查询和完整的五条准则纳入;得分是五条准则的平均。
- 类别专项子集(C): 只保留与特定要求直接相关的准则。例如 \(c_1\) 与 \(c_4\) 属于格式,则只计算这两项。
前者评价“包含某类要求时的整体写作质量”,后者更精确地诊断该专项能力。
阶段 2:基于量表评分¶
对每条准则 \(c_i \in C_q\),评价器给回答 \(r\) 独立打 1–10 分并给出理由;总体分是五项平均。
为降低 LLM 评估的计算成本,作者训练专用 critic model \(\mathcal{M}\):
其中输出包含数值得分和遵循预定义量表的理由文本 \(\mathcal{J}\)。训练数据由 Claude-3.7 打分,共约 155K 个有效样本;查询和准则来自 WritingBench,回答由约 40 个不同类型和规模的模型生成。删除评分失败实例后用于 SFT。
3.3 评估引导的数据筛选与写作增强¶
为验证框架的数据筛选能力,作者构建写作 SFT 数据。按 100 个子领域,GPT-4o 和 Claude-3.5-Sonnet 分别为每个子领域生成中英文各 60 条查询,总计 24K;回答统一由 Deepseek-R1 生成。
随后用动态准则与 critic model 对每个子领域分别排序,保留前 50%,得到 12K 高质量样本。作者分别微调 Llama-3.1-8B-Instruct 与 Qwen-2.5-7B-Instruct。两个 filtered 模型在 WritingBench 和 LongBench-Write 上都显著超过基础模型,并超过 Llama-3.3-70B-Instruct、Qwen-2.5-72B-Instruct 等更大模型。
4. 实验¶

图 5: 各模型在 WritingBench 100 个子领域的平均得分。红色较高,蓝色较低。
4.1 实验设置¶
生成协议。 所有模型在 WritingBench 上的最大序列长度设为 16,000 token;若平台上限更低,则使用平台上限。生成温度为 0.7,top-k 为 20,top-p 为 0.8。critic model 与 LLM judge 的评分温度均为 1.0,与 Arena-Hard-Auto 一致;top-p 为 0.95,不使用 top-k,最大输出长度为 2,048 token。
模型训练。 critic model 以 Qwen-2.5-7B-Instruct 为基座,使用 AdamW,学习率 \(7\times10^{-6}\);在 155K 条 SFT 数据上训练 3 个 epoch,使用 16 张 A100,batch size 64,梯度累积 4 步。写作模型分别以 Qwen-2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 为基座,在 32 张 A100 上训练 5 个 epoch,总 batch size 128,梯度累积 4 步。
表 3:不同准则生成方法与人类偏好的一致率。 Claude 指 Claude-3.7;Critic 指本文 critic model。
| 评估准则 | Judge | 一致率 |
|---|---|---|
| 全局静态 | GPT-4o | 69% |
| 领域专属静态 | GPT-4o | 40% |
| 查询依赖动态 | GPT-4o | 79% |
| 全局静态 | Claude | 67% |
| 领域专属静态 | Claude | 58% |
| 查询依赖动态 | Claude | 87% |
| 查询依赖动态 | Critic | 84% |
表 4:写作增强模型在两个基准上的表现。 “filtered”使用筛选后的 12K 数据,“all”使用完整 24K;Eval2 为 LongBench-Write。
| 模型 | WritingBench | Eval2 |
|---|---|---|
| Deepseek-R1 | 7.70 | 4.79 |
| Qwen-2.5-7B-Instruct | 5.64 | 4.39 |
| Llama-3.1-8B-Instruct | 4.42 | 3.12 |
| Qwen-2.5-7B-all | 7.36 | 4.69 |
| Qwen-2.5-7B-filtered | 7.44 | 4.70 |
| Llama-3.1-8B-all | 7.34 | 4.65 |
| Llama-3.1-8B-filtered | 7.39 | 4.65 |
4.2 模型比较¶
论文评估 17 个模型:GPT-4o(gpt-4o-2025-01-29)、o1-Preview、Claude-3.7、Claude-3.7-thinking、Gemini-1.5-Pro、Qwen-Max、Deepseek-R1、Deepseek-V3、Mistral-Large-Instruct、Qwen-2.5-72B-Instruct、Qwen-2.5-7B-Instruct、Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Suri、LongWriter,以及本文的 Qwen-2.5-7B-filtered 和 Llama-3.1-8B-filtered。对推理模型,评估回答时排除其推理内容。
每条查询使用五条实例专属准则,由 critic model 按 10 分制评分。主表中的 D1–D6 依次为学术与工程、金融与商业、政治与法律、文学与艺术、教育、广告与营销;R1–R3 依次为风格、格式、长度;每个 R 后的 C 是专项准则得分。总体分的标准差由 3 次采样计算。
表 5:WritingBench 主结果。
| 模型 | 总体 | 中 | 英 | D1 | D2 | D3 | D4 | D5 | D6 | R1 | C | R2 | C | R3 | C |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude-3.7-thinking | 7.91±0.111 | 7.9 | 7.9 | 7.9 | 7.8 | 7.8 | 8.0 | 8.0 | 8.1 | 7.9 | 8.7 | 8.0 | 8.4 | 8.0 | 8.1 |
| Claude-3.7 | 7.85±0.110 | 7.9 | 7.8 | 7.8 | 7.8 | 7.7 | 7.9 | 8.0 | 8.1 | 7.9 | 8.6 | 7.9 | 8.3 | 8.0 | 8.1 |
| Qwen-Max | 7.16±0.041 | 7.2 | 7.1 | 7.1 | 6.9 | 7.0 | 7.3 | 7.4 | 7.5 | 7.2 | 8.3 | 7.3 | 7.8 | 7.2 | 7.5 |
| o1-Preview | 6.89±0.039 | 6.8 | 7.0 | 6.9 | 6.8 | 6.7 | 7.0 | 7.1 | 7.2 | 6.9 | 8.0 | 7.0 | 7.5 | 7.1 | 7.3 |
| GPT-4o | 6.81±0.028 | 6.9 | 6.7 | 6.8 | 6.6 | 6.7 | 6.8 | 7.0 | 7.1 | 6.9 | 8.0 | 7.0 | 7.5 | 6.8 | 6.8 |
| Gemini-1.5-Pro | 6.21±0.018 | 6.2 | 6.2 | 6.2 | 5.8 | 6.0 | 6.4 | 6.6 | 6.7 | 6.2 | 7.2 | 6.4 | 7.1 | 6.4 | 6.0 |
| Deepseek-R1 | 7.70±0.053 | 8.0 | 7.5 | 7.6 | 7.4 | 7.6 | 7.8 | 7.8 | 8.1 | 7.7 | 8.4 | 7.9 | 8.3 | 7.7 | 7.5 |
| Deepseek-V3 | 6.35±0.022 | 6.3 | 6.4 | 6.4 | 6.1 | 6.2 | 6.3 | 6.6 | 6.8 | 6.4 | 7.6 | 6.5 | 7.1 | 6.5 | 6.4 |
| Mistral-Large-Instruct | 6.00±0.076 | 5.9 | 6.1 | 6.2 | 5.9 | 5.9 | 5.7 | 6.4 | 6.4 | 6.1 | 7.3 | 6.1 | 6.5 | 6.0 | 6.0 |
| Qwen-2.5-72B-Instruct | 6.40±0.061 | 6.4 | 6.4 | 6.6 | 6.2 | 6.4 | 6.2 | 6.7 | 6.6 | 6.5 | 7.7 | 6.5 | 6.9 | 6.5 | 6.5 |
| Qwen-2.5-7B-Instruct | 5.64±0.083 | 5.5 | 5.8 | 5.9 | 5.6 | 5.6 | 5.1 | 6.1 | 5.9 | 5.7 | 7.0 | 5.7 | 6.1 | 5.6 | 5.6 |
| Llama-3.3-70B-Instruct | 5.05±0.011 | 4.5 | 5.5 | 5.1 | 4.9 | 4.8 | 4.8 | 5.3 | 5.6 | 5.0 | 5.0 | 5.1 | 5.9 | 5.1 | 5.0 |
| Llama-3.1-8B-Instruct | 4.42±0.004 | 3.7 | 5.0 | 4.1 | 4.4 | 4.0 | 4.1 | 4.7 | 5.0 | 4.4 | 4.4 | 4.5 | 5.3 | 4.4 | 4.3 |
| Suri | 3.20±0.042 | 2.5 | 3.8 | 3.6 | 3.5 | 3.0 | 2.5 | 3.2 | 3.6 | 3.2 | 3.7 | 3.1 | 3.2 | 3.0 | 3.0 |
| LongWriter | 6.27±0.081 | 6.2 | 6.4 | 6.4 | 6.4 | 6.3 | 6.0 | 6.5 | 6.0 | 6.3 | 7.4 | 6.3 | 6.7 | 6.3 | 6.8 |
| Qwen-2.5-7B-filtered | 7.44±0.058 | 7.7 | 7.2 | 7.4 | 7.2 | 7.5 | 7.3 | 7.7 | 7.7 | 7.5 | 8.4 | 7.6 | 8.1 | 7.4 | 7.2 |
| Llama-3.1-8B-filtered | 7.39±0.045 | 7.5 | 7.3 | 7.4 | 7.2 | 7.3 | 7.3 | 7.5 | 7.8 | 7.4 | 8.3 | 7.5 | 8.0 | 7.4 | 7.1 |
领域结果。 教育(D5)与广告营销(D6)普遍得分较高;学术工程(D1)与金融商业(D2)更难,因为它们要求更复杂的信息加工与整合。100 个子领域的细分结果显示,投标书、财报和白皮书等知识密集型任务持续困难,需要知识、长文本生成及上下文一致性。
文学艺术(D4)上的模型差异尤其明显。Claude-3.7-thinking、Deepseek-R1、o1-Preview 等推理模型优于非推理版本,说明 CoT 可能有助于叙事和创意内容。作者又在 12K SFT 数据上分别以带 CoT 和不带 CoT 的方式微调 Qwen-2.5-32B-Instruct,并在 WritingBench-D4 与 EQBench 上验证。
要求结果。 多数模型在风格上最好,其次是格式,长度最弱。高级模型的专项 C 分数通常高于对应 R 总体分,说明风格、格式或长度之外的内容要求——材料整合、写作深度等——反而更难。
长度约束尤其困难,包括章节级字数约束和超长输出。高级模型对不同输入长度大体稳定,但多数模型的输出天然停在约 3,000 token;Claude-3.7、Claude-3.7-thinking 与 Qwen-Max 的长输出能力较突出。
总体而言:(1)Claude-3.7-thinking 在领域和要求维度上领先;(2)创意任务中 CoT 模型明显更强;(3)Deepseek-R1、Llama-3.3-70B-Instruct 等存在跨语言不一致;(4)知识密集型子领域和长输出仍是共同短板。在线榜单使用相同计算方式,但为展示清楚缩放到 100 分制。
4.3 人类一致性¶
作者另构建 300 条、不属于 WritingBench 的查询,邀请 5 名有语言学背景的专业标注员做成对比较。每条查询随机选择 17 个被测模型中的两个回答,在同一页面展示“查询、回答 A、回答 B”,标注员选择 A、B 或平局;不提供评价准则,避免引导偏差。
若 critic model 给 A 更高分且人类也选 A,则记为一致。作者还比较全局静态准则与领域专家设计的静态准则,并让 GPT-4o、Claude-3.7 以同一量表评分。动态查询依赖准则取得更高的一致率;critic model 达到 84%。领域专属静态准则尽管经过定制,却因任务与材料过于多样而表现较差。
4.4 写作增强模型的数据筛选消融¶
作者比较两套数据:原始 24K,以及经查询依赖框架筛出的 12K。两种架构的模型在 WritingBench 和 LongBench-Write 上均显示:filtered 模型明显优于基础模型,也略优于使用全部 24K 数据训练的模型。这说明动态准则策略与 critic model 能可靠地筛选高质量写作样本,让小模型在广泛写作任务上接近或超过大模型。
5. 结论¶
WritingBench 用 1,000 条查询覆盖 6 个一级领域、100 个子领域,并针对风格、格式和长度要求提供分析维度。查询依赖评估框架与 critic model 取得较高人类一致性;其数据筛选能力又通过小模型超过 GPT-4o 的实验得到验证。公开的基准与工具旨在推动 LLM 写作能力和评估方法继续发展。
附录 A:补充实验¶
A.1 领域分类与要求维度的验证¶
为让分类体系反映现实写作场景,团队在严格数据安全协议下使用超过 20 万条匿名真实用户写作查询,并结合团队成员的产业经验。初始二级分类参考成熟产品团队的工作流,每个一级领域都设“其他”类别。每轮随机抽取 2,000 条查询,用附录提示让 GPT-4o 按现有标签多标签分类;人类再验证标签、减少重叠和“其他”比例。三轮后标签稳定。
团队还在生产团队提供的另一套标签体系上验证 GPT-4o 自动标注:该体系含 8 个一级领域、44 个子领域和 3,000 条已人工核验数据。若人工标签出现在模型标签列表中即算召回;一级领域召回率约 96%,子领域约 93%。
对生产查询的分析得到三个高频要求维度:风格约占 29.4%,格式约占 22.48%,长度约占 20.8%;其余大多与具体材料或难以抽象归类的要求有关。
A.2 创意内容中的 CoT 消融¶
作者在筛选后的数据上微调 Qwen-2.5-32B-Instruct,构造两个版本:(1)遵循 DeepSeek-R1 原始输出格式、使用 CoT 指令的数据;(2)只保留回答正文、不含 CoT 的消融版本。
源码命名差异: 正文实验分析把该基座简称为
Qwen-32b-Instruct,附录实验段和表格则明确写作Qwen-2.5-32B-Instruct;译文采用信息更具体的附录名称。
表 A1:两个基准上的创意内容 CoT 消融。
| 模型 | WritingBench-D4 | EQBench |
|---|---|---|
| Deepseek-R1 | 7.70 | 84.99 |
| Qwen-2.5-32B-Instruct | 5.59 | 48.17 |
| Qwen-2.5-32B-CoT | 7.58 | 82.48 |
| 不含 CoT | 7.54 | 79.43 |
带 CoT 的模型在两个基准上都优于不带 CoT 的版本,支持 CoT 对创意内容生成有帮助的结论。
A.3 人类一致性标注细节¶
标注通过钉钉文档中的标准化表格完成。查询用黄色突出,说明置于蓝色表头。为减轻位置偏差,每个实例随机排列回答顺序;标注员可放大单元格查看全文并跨查询、回答检索关键词。测试排除超过 5,000 token 的输入,以降低认知负荷;说明明确要求关注内容质量,而非文本长度或表面格式。5 名语言学标注员的 Fleiss/Cohen 一致性指标为 \(\kappa=0.69\),达到较高一致水平。

图 6: 标注界面。
A.4 长度消融¶
作者按不同输入、输出长度评估 LLM;样本少于 5 条的区间不纳入,以保证统计有效性。多数 SOTA 模型对输入长度变化较稳定,反映其长上下文理解能力;但输出长度呈现明显限制,不少模型停在约 3,000 token。Suri、Qwen-2.5-7B-Instruct、Llama-3.1-8B-Instruct 等小模型在长输出下更易重复、性能下降。Claude-3.7、Claude-3.7-thinking、Qwen-Max 与 LongWriter 更能支持长回答。

图 7: WritingBench 上不同输入与输出长度区间的模型得分。
A.5 长度约束失败案例¶
当前模型常不能严格遵守长度要求。WritingBench 第 539 条查询要求为宠物美容沙龙写:10–15 词主标语、15–20 词副标语、8–12 词服务短句、10–15 词品牌承诺;措辞要温暖、友好、轻快又易记。Gemini-1.5-Pro 的回答是:
表 A2:长度要求失败案例。 查询来自 WritingBench 第 539 条,回答由 Gemini-1.5-Pro 生成。
| 类型 | 回答 |
|---|---|
| 主标语 | Pamper Your Pet, Delight Your Heart. |
| 副标语 | Expert grooming and loving care, making your furry friend feel fabulous, inside and out. |
| 服务短句 | Gentle paws, happy pets, stress-free smiles. |
| 品牌承诺 | Quality grooming, compassionate care, every time. |
多个条目没有达到指定词数,因此即使内容和语气看起来合理,仍是长度遵循失败。
A.6 准则生成比较¶
作者比较多个模型后选择 Claude-3.7。相同查询下,Claude-3.7 的准则在多样性、完整性与合理性上更强,描述也更能结合查询的具体要求;GPT-4o 更常重复相似准则,且未充分考虑材料信息。

图 8: Claude-3.7 与 GPT-4o 对同一查询生成的评价准则对比。
附录 B:基准领域统计¶
B.1 六个一级领域¶
- 学术与工程: 覆盖结构化、规范化的学术写作流程,强调清晰、精确和严格标准,包括论文大纲、摘要、文献综述、实验报告、专利、测试报告等。写作重视逻辑论证、深入分析与经验证据整合。
- 金融与商业: 具有分析性和战略性,服务于决策与企业目标,包括合同、市场分析、投资报告、战略规划、产品规格、销售报告等;强调清晰简洁、金融判断与战略洞察。
- 政治与法律: 要求权威、正式的语气,包括政府公文、法律文本与政治传播;在清晰与正式之间平衡,严格遵守法律和程序标准。
- 文学与艺术: 包括小说、诗歌、剧本、艺术设计与书影评论;探索主题与情感深度,语言通常丰富、有感染力,强调个性化表达及人类共鸣。
- 教育: 包括教案、课程设计、反馈、作业、招生宣传、家长会讲稿等教学材料和教育沟通;强调清楚、易懂、有效教学与促进参与。
- 广告与营销: 包括社交媒体脚本、广告文案、品牌故事、多媒体活动材料;文风生动、有说服力,需要理解受众心理和趋势,以兼顾吸引力与战略效果。
B.2 一百个二级子领域¶
表 B1:学术与工程(17 个)。
| 子领域 | 定义 |
|---|---|
| 论文大纲 | 研究组成部分与逻辑流的层次化组织 |
| 致谢 | 对机构和个人支持的正式感谢 |
| 局限 | 系统识别方法约束与适用范围边界 |
| 答辩演示 | 答辩用幻灯片等演示支持材料 |
| 研究计划 | 包含验证路线图的研究蓝图 |
| 技术文档 | 实现规范与系统接口协议 |
| 实验 | 参数化验证框架及受控变量分析 |
| 引言 | 建立研究缺口与重要性的背景基础 |
| 结论 | 综合研究或项目的主要发现 |
| 测试报告 | 测试活动和性能的评估记录 |
| 贡献 | 区别于既有研究的新颖之处 |
| 实习报告 | 按时间记录实践工作经历 |
| 文献综述 | 通过学术文献分类做批判性缺口分析 |
| 答辩讲稿 | 研究答辩的口头陈述与问答准备 |
| 摘要 | 研究目标、方法、结果和意义的概述 |
| 工程报告 | 对任务、方法与结果的技术分析 |
| 专利 | 对可实施新颖权利要求的法律—技术说明 |
表 B2:金融与商业(20 个)。
| 子领域 | 定义 |
|---|---|
| 会议纪要 | 精炼记录讨论要点、决定与行动项 |
| 用户研究 | 收集用户需求与行为洞察,指导产品或服务设计 |
| 商务函件 | 与内外部利益相关者的正式商务沟通 |
| 人力资源管理 | 有效管理劳动力的战略与流程 |
| 招聘 | 吸引、筛选及入职合适候选人的策略 |
| 简报 | 在任务或会议前向利益相关者提供摘要信息 |
| 活动策划 | 协调活动执行所需的后勤与活动安排 |
| 市场调研 | 系统收集并分析市场和消费者信息 |
| 市场分析 | 评价市场趋势、规模、竞争者与动态 |
| 风险管理 | 识别、评估、排序风险并制定缓解策略 |
| 销售报告 | 特定时期的销售活动、业绩与收入摘要 |
| 路演材料 | 向投资者传达商业创意或提案的视觉演示 |
| 合同 | 规定商业交易条款的法律约束协议 |
| 招标文件 | 含项目规范与投标说明的正式邀标材料 |
| 投资分析 | 评价投资的潜在回报与风险 |
| 产品提案 | 说明新产品开发、功能与潜力的详细计划 |
| 战略规划 | 设定商业目标并制定行动策略 |
| 财务报告 | 反映财务表现和状态的综合报表 |
| 需求规格 | 记录项目功能与非功能需求 |
| 投标书 | 按既定价格满足客户需求的商品或服务正式报价 |
表 B3:政治与法律(20 个)。
| 子领域 | 定义 |
|---|---|
| 法律意见 | 对法律事项或问题的权威评估与指引 |
| 政府演讲 | 政府官员阐述政策或立场的正式讲话 |
| 裁判文书 | 法院签发的正式书面决定或命令 |
| 法律协议 | 规定各方条款与义务的有约束力合同 |
| 案例研究 | 用于教学或专业工作的法律案件深度分析 |
| 案例通报 | 对进行中或已结案件的摘要与更新 |
| 法律咨询 | 关于法律权利、责任或策略的专业建议 |
| 法规分析 | 分析影响合规与执法的规章制度 |
| 会议摘要 | 简述会议讨论、决定与结果 |
| 思想报告 | 对政治或思想趋势与观点的分析评论 |
| 政策解读 | 面向公众或组织的政策解释与澄清 |
| 公文 | 政府实体或官员签发的正式书面记录 |
| 法治宣传 | 向公众普及法律权利与责任的活动 |
| 答辩状 | 法律程序中被告方提交的正式书面论证 |
| 入党申请 | 加入政党的申请文本与程序材料 |
| 政策倡议 | 影响或推动特定政策变革与实施的工作 |
| 工作报告 | 特定时期的活动、成绩与挑战总结 |
| 事迹材料 | 突出重要成绩和贡献的记录 |
| 诉讼文书 | 诉讼过程中提交的法律文件 |
| 白皮书 | 就某问题提供信息或方案的权威报告 |
表 B4:文学与艺术(20 个)。
| 子领域 | 定义 |
|---|---|
| 角色设计 | 为故事或视觉媒体创作、发展详细角色 |
| 问候语 | 各类场合使用的友好或正式开场语 |
| 主持稿 | 活动或节目主持人的引导叙述与台词 |
| 小说大纲 | 规划小说情节、角色和场景的结构化方案 |
| 播客脚本 | 规划播客对话和节目环节的文本 |
| 衍生作品 | 基于或受既有作品启发的创作 |
| 读后感 | 对文学作品的个人感想与分析 |
| 视频脚本 | 规定视频对话和动作的脚本 |
| 书评 | 对书籍内容与影响的批评性评价和摘要 |
| 游戏设计 | 设计游戏机制、故事与界面 |
| 歌词创作 | 兼顾押韵和格律的歌曲文字创作 |
| 头脑风暴 | 创造性思考时产生的粗略想法和笔记 |
| 情节发展 | 规划故事线与叙事结构的过程 |
| 散文 | 不采用格律结构的普通书面或口头语言 |
| 影视剧本 | 含对白与场景指示的电影或电视蓝本 |
| 小说手稿 | 准备出版的完整小说文本 |
| 传记 | 对个人经历与成就的详细叙述 |
| 影视评论 | 对影视内容与效果的分析性评论 |
| 诗歌 | 使用节奏和隐喻语言的艺术创作 |
| 同人小说 | 爱好者用既有媒体角色创作的故事 |
表 B5:教育(12 个)。
| 子领域 | 定义 |
|---|---|
| 培训心得 | 对培训经历和所学内容的个人评价 |
| 课堂活动 | 用于吸引学生参与学习的练习或任务 |
| 家长会 | 教师与家长就学生进展进行正式交流 |
| 教案 | 教学目标与方法的结构化方案 |
| 教学材料 | 辅助向学生呈现信息的资源 |
| 作业评分 | 按具体标准评价并给学生作业打分 |
| 课程设计 | 设计教学内容、结构与交付方式 |
| 教育报告 | 对教育结果与表现的分析或总结 |
| 课程作业 | 课程中布置给学生的学术任务 |
| 评价评语 | 对学生表现与改进方向的反馈 |
| 教育咨询 | 关于教育策略与体系的专业指导 |
| 招生宣传 | 鼓励学生入读教育机构的策略与活动 |
表 B6:广告与营销(11 个)。
| 子领域 | 定义 |
|---|---|
| 销售信 | 旨在推动潜在购买者行动的说服性文字 |
| 产品描述 | 详细说明产品功能、优势与用途 |
| 社交媒体内容 | 为线上平台制作的有吸引力文字、图片或视频内容 |
| 多媒体脚本 | 整合多种媒体形式的营销脚本 |
| 推广文案 | 用于提升产品兴趣和销量的有说服力文本 |
| 推广配音稿 | 配合营销画面或广告的录音旁白文本 |
| 旅行指南 | 为旅行者提供见解与建议的信息内容 |
| 品牌故事 | 说明品牌历史、价值观和使命的叙事 |
| 个人博客 | 在线非正式分享的个人评论或故事 |
| 营销评论 | 对营销趋势与策略的分析性观点 |
| 标语 | 传达品牌身份的简短、醒目、易记短语 |
附录 C:提示词¶
以下为论文附录中的完整提示结构。为保持中文稿可读性,指令翻译为中文,变量名和 JSON 字段保留。
源码提示模板中的未消解问题:(1)查询分类 JSON 的行内注释把
style示例写成 “academic format”,把format示例写成 “child-friendly tone”,与同一提示前文对 style/format 的定义正好对调;下文按字段语义翻译,不静默沿用错置示例。(2)domain的源码示例包含6c. Marketing Letter和8d. Educational Consulting,但同一模板列出的顶层编号只到7. Other,示例编号无法与该 taxonomy 对齐。(3)初始查询生成框的源码标题误写为 “Query Classification Prompt”,正文功能实际是生成初始查询。(4)查询细化模板中material字段的英文说明在 “if not needed, return” 处截断;下文“否则返回空值”是依据字段语义和前后文作出的可读化补全。
C.1 查询分类提示¶
系统提示:
你是一名查询分析专家。
每次迭代时,把当前二级领域标签放在“Domains”下。例如,“1. Academic & Engineering”代表一级领域,“1a. Thesis Outline”代表子领域。
用户提示:
请判断下列查询属于哪些领域,并识别其中是否存在风格、格式或长度要求。
格式要求示例:模仿上传文档的格式、遵循给定大纲、符合学术论文格式规范等。
风格要求示例:适合儿童阅读、语言严谨、语气幽默等。
长度要求示例:字数、时长或其他输出规模约束。
Query
{query}
Domains
1. Academic & Engineering
1a. Thesis Outline
1b. Literature Review
...
1r. Others related to Academic & Engineering
2. Finance & Business
2a. Market Research
2b. Sales Report
...
2l. Others related to Finance & Business
...
7. Other
7a. Others
Output format
只返回下列 JSON,不要输出其他内容:
{
"domain": ["xx.yyy", ...],
"style": "存在时填写风格要求,否则为空字符串",
"format": "存在时填写格式要求,否则为空字符串",
"length": "存在时填写长度要求,否则为空字符串"
}
若数据无效或无法判断,“domain”返回空列表。
C.2 初始查询生成提示¶
可在提示中指定生成语言:
请在一级领域 {primary_domain} 的子领域 {subdomain} 下,以英文/中文生成 {NUM} 个不同的写作请求。
请求应尽量详细、具体,并反映真实用户的语气和需求。
只返回以下 JSON 数组,不要输出 JSON 之外的内容:
[
"写作请求 1",
"写作请求 2",
...
]
C.3 查询细化指引池¶
每次随机选 0–6 项:
- 加入生成特定长度的要求。
- 加入格式遵循要求,例如按照指定大纲写作或以特定格式输出。
- 加入风格要求,例如适合特定场合的演讲风格、适合特定受众,或模仿某种语气。
- 纳入用户个性化需要,例如考虑用户身份或结合个人经历。
- 加入更具体的内容要求,例如某一事件的细节或聚焦特定内容。
- 用一句话简洁表达。
C.4 查询细化提示¶
请根据给定指引,对一级领域 {domain1} 中子领域 {domain2} 的原始写作要求进行细化和增强。
尽可能加入细节,并说明是否需要额外写作材料。
Original Writing Requirements
{query}
Guidance for Modification
{guidance}
Output Requirements
严格返回下列 JSON,不要输出其他内容:
{
"query": "修改后的写作要求",
"material": "是否需要额外参考材料;如需要,给出材料建议;如不需要则返回空值"
}
C.5 准则生成提示¶
系统提示:
你是一名经验丰富的评价专家,擅长评价给定查询的回答。
用户提示:
请为下列查询的回答生成五条严格评价准则。
每条准则包含 name、criteria_description、1-2、3-4、5-6、7-8、9-10。
准则应支持精细评价并区分细微质量差异,能够识别相关性、连贯性、深度、具体性以及对查询上下文的遵循情况。
不要输出任何附加文字,只按指定 JSON 格式输出。
Query
{query}
Output format
[
{
"name": "first_criteria_name",
"criteria_description": "第一条准则的说明,强调详细、严格的评价",
"1-2": "低分:存在关键缺陷和重大问题,无法实现基本功能",
"3-4": "低于平均:有明显不足,影响整体有效性,需要改进",
"5-6": "平均:达到基本要求但并不突出;多数模型可能达到",
"7-8": "高于平均:执行有力,仅需少量改进即可达到优秀",
"9-10": "高分:各方面均得到最佳处理,效果和质量卓越且无缺陷"
},
...
]
C.6 基于量表的评分提示¶
由于查询和回答可能很长,变量 “{criteria}” 在查询与回答前后各出现一次。
系统提示:
你是一名经验丰富的评价专家,擅长评价给定查询的回答。
用户提示:
请依据 Query 和 Criteria,并遵循以下 Scoring Rules 评价 Response。
Scoring Rules
1-2:存在关键缺陷和重大问题,无法实现基本功能。
3-4:有明显不足,影响整体有效性,需要改进。
5-6:达到基本要求但并不突出;多数模型可能达到。
7-8:执行有力,仅需少量改进即可达到优秀。
9-10:各方面均得到最佳处理,效果和质量卓越且无缺陷。
- 给出具体理由,指出回答中的优点或缺陷,并引用确切文本;理由应与准则一致,并说明离理想回答还缺什么。
- 必须非常严格,不要被格式或长度迷惑;要穿透表面现象彻底评价回答。
- 仔细判断回答是否只是看起来内容丰富,实际上完全是编造。
- 有时模型只给引言或概述,并未真正完成任务;这种情况应判为失败。
- 打 1–10 的整数分。
Output format
删除妨碍 JSON 解析的符号;reason 内不要使用双引号。只输出:
{
"score": 1 到 10 的整数,
"reason": "使用文本证据给出具体、详细的评分理由"
}
Criteria
{criteria}
Query
{query}
Response
{response}
请依据下面再次给出的准则评价:
{criteria}
Output format
删除妨碍 JSON 解析的符号;reason 内不要使用双引号。只输出:
{
"score": 1 到 10 的整数,
"reason": "使用文本证据给出具体、详细的评分理由"
}
附录 D:局限¶
本文有三项主要局限。
第一,写作模型与 critic model 主要使用常规 SFT 训练,没有系统探索更先进的优化方法。作者虽展示 CoT 在创意领域的部分效果,但与其在数学推理中的成熟应用相比,写作领域的潜力仍未充分研究。
第二,框架在复杂、多维长度要求上精度下降,包括时间顺序约束和章节级字数限制。未来需要把学习到的评价指标与结构化、基于规则的评价结合,更精确地控制输出规范。
第三,写作任务的成对偏好标注很难做到完全可靠。即使有严格流程,面对两个质量都尚可的回答时,人类仍会因叙事偏好和上下文理解产生主观偏差。共识流程可以降低波动,却理论上无法与多样的用户偏好绝对对齐。
附录 E:影响¶
E.1 综合 AI 写作评估生态¶
WritingBench 覆盖广泛领域和要求,可同时评估通用写作能力与特定领域专长。研究者既可分析模型整体通用性,也可聚焦故事创作、科学写作、商务沟通等子集。公开评估协议、准则生成工具与 critic model 有助于透明性和复现。
作者提醒:每条公开查询虽经过人工审查以移除有害内容,但经 API 生成的回答依赖底层模型,不能保证完全安全或准确,也不应直接用于商业用途。
E.2 促进领域专属研发¶
100 个子领域让法律、医疗文档、营销等行业能够在相关子集上比较模型并做定向优化。当某领域缺少专门评估数据时,WritingBench 的查询构建策略也可用于生成多样查询,支持开发高度专门化的写作工具。
E.3 推动强化学习与自适应评估¶
查询依赖框架可被接入强化学习流水线:实例专属准则能形成精确奖励,用于基于奖励的优化;按自适应准则比较预测结果,还可以构造成对偏好数据,以改善模型与人类偏好的对齐。论文在这里提出的是未来用途;本文实际训练的写作模型和 critic model 仍以 SFT 为主,并未实施写作 RL。
附录 F:NeurIPS 论文检查表(作者回答)¶
以下保留论文作者对检查表各项的实质回答;会议提供的通用解释性指南不重复翻译。
| 项目 | 回答 | 作者说明 |
|---|---|---|
| 主张是否准确反映贡献和范围 | 是 | 方法见第 3 节各子节,实验验证见第 4 节 |
| 是否讨论局限 | 是 | 见附录 D |
| 理论假设与证明是否完整 | 是 | 作者称第 4 节与补充实验为结论提供了详细实验和分析;本文主要是经验研究 |
| 实验结果是否可复现 | 是 | 构建流程、提示、评估数据与代码、训练参数、模型及榜单均已提供或给出入口 |
| 数据和代码是否开放 | 是 | GitHub 仓库提供数据、代码和 README |
| 是否给出实验设置细节 | 是 | 评估设置、critic model 与写作模型的数据和参数见第 3、4 节 |
| 是否报告统计显著性信息 | 是 | 主结果表报告 3 次采样的标准差 |
| 是否给出计算资源 | 是 | 见实验设置中的 A100 数量等信息 |
| 是否遵守 NeurIPS 伦理规范 | 是 | 作者声明遵守 NeurIPS Code of Ethics |
| 是否讨论更广泛影响 | 是 | 见附录 E |
| 是否设置安全保障 | 是 | 基准只用于评估,公开提示均人工审查以移除有害信息 |
| 既有资产许可与归属是否合规 | 是 | 作者称所有使用资产均已正确引用 |
| 新资产是否有文档 | 是 | GitHub 提供说明和使用条款 |
| 众包/人类受试信息是否充分 | 是 | 论文给出标注说明、截图和报酬 |
| 是否说明 IRB 或同等审批 | 是 | 作者称遵守当地伦理审批法律;标注员受雇于专业公司,已获知数据用途并同意 |
| 是否声明 LLM 使用 | 是 | LLM 在基准构建和评分中的参与见第 3.1、3.2 节 |
检查表内部不一致: 作者对“每项理论结果是否给出完整假设和正确证明”回答“是”,但理由只指向实验章节和补充实验;正文没有定理、引理或证明。上表忠实保留作者选择,同时注明这一 checklist 回答与论文的经验研究性质并不吻合。
参考文献说明¶
论文的参考文献条目未作意译,以免改变题名、作者或出版信息。完整书目原样保存在 source/acl_latex.bib,正文中的模型、基准和方法名称可据此追溯。