跳转至

WritingBench:面向生成式写作的综合基准

原题:WritingBench: A Comprehensive Benchmark for Generative Writing
arXiv:2503.05244,v4,2025-11-27
作者:Yuning Wu、Jiahao Mei、Ming Yan、Chenliang Li、Shaopeng Lai、Yuran Ren、Zijia Wang、Ji Zhang、Mengyue Wu、Qin Jin、Fei Huang
机构:阿里巴巴集团;中国人民大学;上海交通大学
通讯作者:Ming Yan、Qin Jin
会议:NeurIPS 2025
翻译依据:arXiv v4 PDF 与 LaTeX source。数值均按论文表格保留;参考文献引用以作者在源码中的引用键或模型名表述,完整书目见 source/acl_latex.bib。

摘要

大语言模型(LLM)的近期进展显著增强了文本生成能力,但如何评估其生成式写作表现仍是难题。现有基准主要关注通用文本生成,或只覆盖有限的写作任务,无法反映不同领域中高质量写作内容的多样要求。

为弥补这一缺口,本文提出 WritingBench:一个覆盖 6 个核心写作领域和 100 个子领域的综合基准。作者还提出查询依赖评估(query-dependent evaluation)框架,让 LLM 为每个实例动态生成专属评价准则;再配合一个微调后的 critic model,依据这些准则评分,并专门评估风格、格式与长度。该框架还可用于数据筛选:用它筛出的数据训练 7B 模型,写作表现超过 GPT-4o。作者公开基准、评估工具与模块化框架组件,以推动 LLM 写作研究。

  • 代码:https://github.com/X-PLUG/WritingBench
  • 排行榜:https://huggingface.co/spaces/WritingBench/WritingBench

1. 引言

LLM 已在创意内容、教育辅助和专业工作流等场景展示出强大文本生成能力。然而,生成式写作同时要求连贯性、创造性、逻辑推理和精确的文体控制,现有评估方法难以充分覆盖。

WritingBench 查询示例

图 1: 用颜色标出不同要求的查询示例;红色短语与灰底的写作支持材料相对应。

现有生成式写作基准有两类主要缺陷:

  1. 任务范围与多样性有限。 不少基准只覆盖小说等单一领域;任务常是单句提示或少量固定模板;输入材料来源也高度同质,难以表现现实写作中复杂、定制化的要求。
  2. 复杂写作任务的评价指标不足。 LLM judge 能捕捉语义,但通常只使用流畅性、连贯性等少数预定义准则。随着写作能力提高,这些静态准则不足以衡量创造性、论证强度和领域规范遵循等多维能力。

WritingBench 查询构建流程

图 2: WritingBench 查询的构建流程。细化池包含五类写作要求,其中三个黑框项目是核心能力,紫色项目是表达形式。勾选的策略把初始查询改写为包含多项要求的提示;红色文本引用灰色材料。

WritingBench 先依据真实写作需求设计二级领域分类,再采用四阶段查询构建流水线:LLM 生成和多样化写作请求,人类收集材料并优化数据。所得任务覆盖面广、要求多样,且能够结合异构材料。

在评估侧,框架让 LLM 为每个查询动态生成五条准则,再由微调后的 critic model 评分。作者还用这一框架过滤写作训练数据并训练小模型,以验证其识别高质量样本的能力。

本文贡献如下:

  1. 发布 WritingBench:1,000 条查询,覆盖 6 个一级领域、100 个子领域,包含风格、格式和长度要求;输入从数十词到数千词,可系统分析真实写作能力及其短板,并显示 CoT 对创造性任务的潜力。
  2. 提出查询依赖评估框架,把实例级准则生成与准则感知评分模型结合。其人类一致性为 84%,高于静态准则基线的 67% 和 58%。
  3. 证明该框架能筛选写作数据:用筛选数据训练的小模型写作表现超过 GPT-4o。作者公开评估协议、准则生成工具、critic model 与写作增强模型。

源码单位差异: 引言贡献段把输入范围写成“数十到数千 words”,但基准比较表和数据统计表的对应列明确使用 token,最大值为 19,361 token。译文不把二者强行统一:叙述处保留作者的“词”表述,数值表按源码列名保留 token。

2. 相关工作

2.1 写作基准

现有写作基准在领域覆盖和任务粒度上都有明显限制。EQ-Bench 的创意写作子集主要是故事类模板查询;LongBench-Write 在 120 个查询中加入长度约束,但两者都缺少层次化领域分类及风格、格式等多维要求。HelloBench 等基准常依赖固定指令模板、短上下文或单一来源材料。

WritingBench 提供 1,000 条自由形式查询,分布在 6 个一级领域和 100 个子领域,能够控制风格、格式和长度,输入长度从数十词到数千词。

表 1:现有写作基准比较。 “—”表示论文未提供或不适用。

基准 数量 一级领域 二级领域 风格 格式 长度 平均输入 token 最大输入 token 自由查询形式 多样材料来源
EQ-Bench 241 1 130 213
LongBench-Write 120 7 87 684
HelloBench 647 5 38 1,210 7,766
WritingBench 1,000 6 100 1,699 19,361

2.2 评估方法

LLM-as-a-judge 已成为评价生成结果的常用方法。研究者通常预先定义一组适用于全部样本的固定维度:SuperCLUE 使用 3 个维度,LongBench-Write 使用 6 个维度;HelloBench 有任务专属维度,但同一任务中的所有查询仍共用这些维度。静态维度难以适应不同写作风格、复杂规范及材料丰富的输入。

Fennec 曾训练模型为单个查询动态生成评价维度,但生成范围仍受限于一个较小的预定义集合。WritingBench 则让 LLM 生成开放、多样、实例专属的准则,并微调专用 critic model 执行评分。

2.3 写作增强模型

Weaver、Suri、LongWriter 等模型分别在特定写作领域或长度控制上有优势,但跨领域和多约束场景会明显退化。本文利用评估框架筛选高质量数据,训练跨任务写作增强模型。

3. WritingBench

本节介绍四阶段人机协作构建流程、查询依赖评估框架及其 critic model,并通过训练写作增强模型验证数据筛选能力。

3.1 基准构建

WritingBench 将模型生成的查询细化与人工标注结合,以保证多样性和现实相关性。

3.1.1 模型增强的查询生成

这一阶段先由 LLM 生成初始写作查询,再通过系统化指引扩充并多样化;需要时,模型同时建议应补充哪些材料。

WritingBench 领域分布

图 3: WritingBench 领域分类。内圈为 6 个一级领域,外圈为 100 个二级子领域。

表 2:WritingBench 数据统计。

分组 类别 数量 平均 token 最大 token
领域 学术与工程 167 1,944 15,534
领域 金融与商业 210 1,867 19,361
领域 政治与法律 201 2,363 18,317
领域 文学与艺术 183 1,266 7,675
领域 教育 111 1,345 10,737
领域 广告与营销 128 984 6,504
要求 风格 442 1,728 19,361
要求 格式 498 1,715 15,534
要求 长度 222 1,362 14,097
输入长度 0–1K 550 470 994
输入长度 1K–3K 292 1,832 2,991
输入长度 3K–5K 87 3,828 4,966
输入长度 超过 5K 71 8,053 19,361

阶段 1:初始查询生成。 作者建立由 6 个一级领域和 100 个子领域组成的二级领域池,覆盖传统与新兴 AI 辅助写作需求。六个一级领域是:学术与工程、金融与商业、政治与法律、文学与艺术、教育、广告与营销。以领域标签为条件,GPT-4o 与 Claude-3.5-Sonnet 生成大量模拟真实用户请求的初始草稿。

阶段 2:查询多样化。 作者设计 3 项核心要求和 3 个辅助维度:

  1. 风格调整,例如使用儿童易懂的友好、简单语气;
  2. 格式规范,例如遵循 IEEE 会议模板;
  3. 长度约束,例如生成 500 词的执行摘要;
  4. 个性化,例如从有 20 年经验的教育工作者视角写作;
  5. 内容具体化,例如详述 2023 年第三季度财务指标;
  6. 表达方式,例如把查询改得更简洁。

前三项会进入专项评估。细化查询时,LLM 还会建议必要材料,如市场分析需要的财报。

动态生成写作评价准则示例

图 4: 针对 WritingBench 查询动态生成评价准则的示例;不同底色代表不同类型的要求。

3.1.2 人在回路中的细化

模型输出只用作规模大、语言多样的草稿池。人类专家负责核验查询、补充所需材料、保证场景真实,并清除有害内容。

阶段 1:材料收集。 30 名受训标注员参与,报酬为每小时 18 美元;其领域知识通过测试验证。他们收集任务所需的公开材料,如财报或法律模板。每条查询可以对应多份材料,也可能不需要外部材料。为避免异构文档解析错误和网页广告等噪声,标注员只提取并核验最相关的文本片段。

阶段 2:专家优化。 5 名有 LLM 使用经验或相关行业背景的专家筛选数据。先剔除不现实、过度泛化、低质量或可能有害的条目,再进行两阶段复核:

  1. 查询适配:修改含混表达,使其更贴合材料与实际场景;
  2. 材料裁剪:删除冗余或无关信息,保持上下文聚焦、相关且无害。

专家也可创作原创高质量查询,再由同行交叉核验。最终得到 1,000 条查询,其中中文 445 条、英文 555 条。

3.2 查询依赖评估框架

静态写作准则存在三类局限:

  1. 领域覆盖不足: 无法适应技术文档、创意写作等专业领域的独特性质;
  2. 要求不够具体: 不能灵活覆盖风格、格式或长度控制;
  3. 材料依赖缺失: 无法核验回答是否正确使用参考材料,例如是否纳入指定数据、是否维持叙事连续性。

本文框架包含两个阶段。

阶段 1:动态准则生成

给定查询 \(q\),LLM 自动生成五条评价准则:

\[ C_q = \{c_1,\ldots,c_5\}. \]

选择五条准则与多个当代评估设置的常见做法一致。作者使用 Claude-3.7,因为它生成的准则比 GPT-4o 更全面、更多样。每条准则包含:简短名称、详细评价焦点和细粒度的分档量表。人类标注员再审核准则是否合理并确认不含有害内容。

作者从现实写作场景中识别出风格、格式和长度三类常见要求,并为每类要求构建两个子集。两名标注员把每个 \(C_q\) 中的准则标为风格、格式、长度或无关:

  1. 要求涉及子集(R1/R2/R3): 只要某查询的任一准则涉及某项要求,就把该查询和完整的五条准则纳入;得分是五条准则的平均。
  2. 类别专项子集(C): 只保留与特定要求直接相关的准则。例如 \(c_1\)\(c_4\) 属于格式,则只计算这两项。

前者评价“包含某类要求时的整体写作质量”,后者更精确地诊断该专项能力。

阶段 2:基于量表评分

对每条准则 \(c_i \in C_q\),评价器给回答 \(r\) 独立打 1–10 分并给出理由;总体分是五项平均。

为降低 LLM 评估的计算成本,作者训练专用 critic model \(\mathcal{M}\)

\[ \mathcal{M}_c:(q,r,c_i)\mapsto [1,10]\times\mathcal{J}, \]

其中输出包含数值得分和遵循预定义量表的理由文本 \(\mathcal{J}\)。训练数据由 Claude-3.7 打分,共约 155K 个有效样本;查询和准则来自 WritingBench,回答由约 40 个不同类型和规模的模型生成。删除评分失败实例后用于 SFT。

3.3 评估引导的数据筛选与写作增强

为验证框架的数据筛选能力,作者构建写作 SFT 数据。按 100 个子领域,GPT-4o 和 Claude-3.5-Sonnet 分别为每个子领域生成中英文各 60 条查询,总计 24K;回答统一由 Deepseek-R1 生成。

随后用动态准则与 critic model 对每个子领域分别排序,保留前 50%,得到 12K 高质量样本。作者分别微调 Llama-3.1-8B-Instruct 与 Qwen-2.5-7B-Instruct。两个 filtered 模型在 WritingBench 和 LongBench-Write 上都显著超过基础模型,并超过 Llama-3.3-70B-Instruct、Qwen-2.5-72B-Instruct 等更大模型。

4. 实验

100 个子领域上的模型得分热力图

图 5: 各模型在 WritingBench 100 个子领域的平均得分。红色较高,蓝色较低。

4.1 实验设置

生成协议。 所有模型在 WritingBench 上的最大序列长度设为 16,000 token;若平台上限更低,则使用平台上限。生成温度为 0.7,top-k 为 20,top-p 为 0.8。critic model 与 LLM judge 的评分温度均为 1.0,与 Arena-Hard-Auto 一致;top-p 为 0.95,不使用 top-k,最大输出长度为 2,048 token。

模型训练。 critic model 以 Qwen-2.5-7B-Instruct 为基座,使用 AdamW,学习率 \(7\times10^{-6}\);在 155K 条 SFT 数据上训练 3 个 epoch,使用 16 张 A100,batch size 64,梯度累积 4 步。写作模型分别以 Qwen-2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 为基座,在 32 张 A100 上训练 5 个 epoch,总 batch size 128,梯度累积 4 步。

表 3:不同准则生成方法与人类偏好的一致率。 Claude 指 Claude-3.7;Critic 指本文 critic model。

评估准则 Judge 一致率
全局静态 GPT-4o 69%
领域专属静态 GPT-4o 40%
查询依赖动态 GPT-4o 79%
全局静态 Claude 67%
领域专属静态 Claude 58%
查询依赖动态 Claude 87%
查询依赖动态 Critic 84%

表 4:写作增强模型在两个基准上的表现。 “filtered”使用筛选后的 12K 数据,“all”使用完整 24K;Eval2 为 LongBench-Write。

模型 WritingBench Eval2
Deepseek-R1 7.70 4.79
Qwen-2.5-7B-Instruct 5.64 4.39
Llama-3.1-8B-Instruct 4.42 3.12
Qwen-2.5-7B-all 7.36 4.69
Qwen-2.5-7B-filtered 7.44 4.70
Llama-3.1-8B-all 7.34 4.65
Llama-3.1-8B-filtered 7.39 4.65

4.2 模型比较

论文评估 17 个模型:GPT-4o(gpt-4o-2025-01-29)、o1-Preview、Claude-3.7、Claude-3.7-thinking、Gemini-1.5-Pro、Qwen-Max、Deepseek-R1、Deepseek-V3、Mistral-Large-Instruct、Qwen-2.5-72B-Instruct、Qwen-2.5-7B-Instruct、Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Suri、LongWriter,以及本文的 Qwen-2.5-7B-filtered 和 Llama-3.1-8B-filtered。对推理模型,评估回答时排除其推理内容。

每条查询使用五条实例专属准则,由 critic model 按 10 分制评分。主表中的 D1–D6 依次为学术与工程、金融与商业、政治与法律、文学与艺术、教育、广告与营销;R1–R3 依次为风格、格式、长度;每个 R 后的 C 是专项准则得分。总体分的标准差由 3 次采样计算。

表 5:WritingBench 主结果。

模型 总体 D1 D2 D3 D4 D5 D6 R1 C R2 C R3 C
Claude-3.7-thinking 7.91±0.111 7.9 7.9 7.9 7.8 7.8 8.0 8.0 8.1 7.9 8.7 8.0 8.4 8.0 8.1
Claude-3.7 7.85±0.110 7.9 7.8 7.8 7.8 7.7 7.9 8.0 8.1 7.9 8.6 7.9 8.3 8.0 8.1
Qwen-Max 7.16±0.041 7.2 7.1 7.1 6.9 7.0 7.3 7.4 7.5 7.2 8.3 7.3 7.8 7.2 7.5
o1-Preview 6.89±0.039 6.8 7.0 6.9 6.8 6.7 7.0 7.1 7.2 6.9 8.0 7.0 7.5 7.1 7.3
GPT-4o 6.81±0.028 6.9 6.7 6.8 6.6 6.7 6.8 7.0 7.1 6.9 8.0 7.0 7.5 6.8 6.8
Gemini-1.5-Pro 6.21±0.018 6.2 6.2 6.2 5.8 6.0 6.4 6.6 6.7 6.2 7.2 6.4 7.1 6.4 6.0
Deepseek-R1 7.70±0.053 8.0 7.5 7.6 7.4 7.6 7.8 7.8 8.1 7.7 8.4 7.9 8.3 7.7 7.5
Deepseek-V3 6.35±0.022 6.3 6.4 6.4 6.1 6.2 6.3 6.6 6.8 6.4 7.6 6.5 7.1 6.5 6.4
Mistral-Large-Instruct 6.00±0.076 5.9 6.1 6.2 5.9 5.9 5.7 6.4 6.4 6.1 7.3 6.1 6.5 6.0 6.0
Qwen-2.5-72B-Instruct 6.40±0.061 6.4 6.4 6.6 6.2 6.4 6.2 6.7 6.6 6.5 7.7 6.5 6.9 6.5 6.5
Qwen-2.5-7B-Instruct 5.64±0.083 5.5 5.8 5.9 5.6 5.6 5.1 6.1 5.9 5.7 7.0 5.7 6.1 5.6 5.6
Llama-3.3-70B-Instruct 5.05±0.011 4.5 5.5 5.1 4.9 4.8 4.8 5.3 5.6 5.0 5.0 5.1 5.9 5.1 5.0
Llama-3.1-8B-Instruct 4.42±0.004 3.7 5.0 4.1 4.4 4.0 4.1 4.7 5.0 4.4 4.4 4.5 5.3 4.4 4.3
Suri 3.20±0.042 2.5 3.8 3.6 3.5 3.0 2.5 3.2 3.6 3.2 3.7 3.1 3.2 3.0 3.0
LongWriter 6.27±0.081 6.2 6.4 6.4 6.4 6.3 6.0 6.5 6.0 6.3 7.4 6.3 6.7 6.3 6.8
Qwen-2.5-7B-filtered 7.44±0.058 7.7 7.2 7.4 7.2 7.5 7.3 7.7 7.7 7.5 8.4 7.6 8.1 7.4 7.2
Llama-3.1-8B-filtered 7.39±0.045 7.5 7.3 7.4 7.2 7.3 7.3 7.5 7.8 7.4 8.3 7.5 8.0 7.4 7.1

领域结果。 教育(D5)与广告营销(D6)普遍得分较高;学术工程(D1)与金融商业(D2)更难,因为它们要求更复杂的信息加工与整合。100 个子领域的细分结果显示,投标书、财报和白皮书等知识密集型任务持续困难,需要知识、长文本生成及上下文一致性。

文学艺术(D4)上的模型差异尤其明显。Claude-3.7-thinking、Deepseek-R1、o1-Preview 等推理模型优于非推理版本,说明 CoT 可能有助于叙事和创意内容。作者又在 12K SFT 数据上分别以带 CoT 和不带 CoT 的方式微调 Qwen-2.5-32B-Instruct,并在 WritingBench-D4 与 EQBench 上验证。

要求结果。 多数模型在风格上最好,其次是格式,长度最弱。高级模型的专项 C 分数通常高于对应 R 总体分,说明风格、格式或长度之外的内容要求——材料整合、写作深度等——反而更难。

长度约束尤其困难,包括章节级字数约束和超长输出。高级模型对不同输入长度大体稳定,但多数模型的输出天然停在约 3,000 token;Claude-3.7、Claude-3.7-thinking 与 Qwen-Max 的长输出能力较突出。

总体而言:(1)Claude-3.7-thinking 在领域和要求维度上领先;(2)创意任务中 CoT 模型明显更强;(3)Deepseek-R1、Llama-3.3-70B-Instruct 等存在跨语言不一致;(4)知识密集型子领域和长输出仍是共同短板。在线榜单使用相同计算方式,但为展示清楚缩放到 100 分制。

4.3 人类一致性

作者另构建 300 条、不属于 WritingBench 的查询,邀请 5 名有语言学背景的专业标注员做成对比较。每条查询随机选择 17 个被测模型中的两个回答,在同一页面展示“查询、回答 A、回答 B”,标注员选择 A、B 或平局;不提供评价准则,避免引导偏差。

若 critic model 给 A 更高分且人类也选 A,则记为一致。作者还比较全局静态准则与领域专家设计的静态准则,并让 GPT-4o、Claude-3.7 以同一量表评分。动态查询依赖准则取得更高的一致率;critic model 达到 84%。领域专属静态准则尽管经过定制,却因任务与材料过于多样而表现较差。

4.4 写作增强模型的数据筛选消融

作者比较两套数据:原始 24K,以及经查询依赖框架筛出的 12K。两种架构的模型在 WritingBench 和 LongBench-Write 上均显示:filtered 模型明显优于基础模型,也略优于使用全部 24K 数据训练的模型。这说明动态准则策略与 critic model 能可靠地筛选高质量写作样本,让小模型在广泛写作任务上接近或超过大模型。

5. 结论

WritingBench 用 1,000 条查询覆盖 6 个一级领域、100 个子领域,并针对风格、格式和长度要求提供分析维度。查询依赖评估框架与 critic model 取得较高人类一致性;其数据筛选能力又通过小模型超过 GPT-4o 的实验得到验证。公开的基准与工具旨在推动 LLM 写作能力和评估方法继续发展。

附录 A:补充实验

A.1 领域分类与要求维度的验证

为让分类体系反映现实写作场景,团队在严格数据安全协议下使用超过 20 万条匿名真实用户写作查询,并结合团队成员的产业经验。初始二级分类参考成熟产品团队的工作流,每个一级领域都设“其他”类别。每轮随机抽取 2,000 条查询,用附录提示让 GPT-4o 按现有标签多标签分类;人类再验证标签、减少重叠和“其他”比例。三轮后标签稳定。

团队还在生产团队提供的另一套标签体系上验证 GPT-4o 自动标注:该体系含 8 个一级领域、44 个子领域和 3,000 条已人工核验数据。若人工标签出现在模型标签列表中即算召回;一级领域召回率约 96%,子领域约 93%。

对生产查询的分析得到三个高频要求维度:风格约占 29.4%,格式约占 22.48%,长度约占 20.8%;其余大多与具体材料或难以抽象归类的要求有关。

A.2 创意内容中的 CoT 消融

作者在筛选后的数据上微调 Qwen-2.5-32B-Instruct,构造两个版本:(1)遵循 DeepSeek-R1 原始输出格式、使用 CoT 指令的数据;(2)只保留回答正文、不含 CoT 的消融版本。

源码命名差异: 正文实验分析把该基座简称为 Qwen-32b-Instruct,附录实验段和表格则明确写作 Qwen-2.5-32B-Instruct;译文采用信息更具体的附录名称。

表 A1:两个基准上的创意内容 CoT 消融。

模型 WritingBench-D4 EQBench
Deepseek-R1 7.70 84.99
Qwen-2.5-32B-Instruct 5.59 48.17
Qwen-2.5-32B-CoT 7.58 82.48
不含 CoT 7.54 79.43

带 CoT 的模型在两个基准上都优于不带 CoT 的版本,支持 CoT 对创意内容生成有帮助的结论。

A.3 人类一致性标注细节

标注通过钉钉文档中的标准化表格完成。查询用黄色突出,说明置于蓝色表头。为减轻位置偏差,每个实例随机排列回答顺序;标注员可放大单元格查看全文并跨查询、回答检索关键词。测试排除超过 5,000 token 的输入,以降低认知负荷;说明明确要求关注内容质量,而非文本长度或表面格式。5 名语言学标注员的 Fleiss/Cohen 一致性指标为 \(\kappa=0.69\),达到较高一致水平。

人类评价标注界面

图 6: 标注界面。

A.4 长度消融

作者按不同输入、输出长度评估 LLM;样本少于 5 条的区间不纳入,以保证统计有效性。多数 SOTA 模型对输入长度变化较稳定,反映其长上下文理解能力;但输出长度呈现明显限制,不少模型停在约 3,000 token。Suri、Qwen-2.5-7B-Instruct、Llama-3.1-8B-Instruct 等小模型在长输出下更易重复、性能下降。Claude-3.7、Claude-3.7-thinking、Qwen-Max 与 LongWriter 更能支持长回答。

不同输入与输出长度下的得分

图 7: WritingBench 上不同输入与输出长度区间的模型得分。

A.5 长度约束失败案例

当前模型常不能严格遵守长度要求。WritingBench 第 539 条查询要求为宠物美容沙龙写:10–15 词主标语、15–20 词副标语、8–12 词服务短句、10–15 词品牌承诺;措辞要温暖、友好、轻快又易记。Gemini-1.5-Pro 的回答是:

表 A2:长度要求失败案例。 查询来自 WritingBench 第 539 条,回答由 Gemini-1.5-Pro 生成。

类型 回答
主标语 Pamper Your Pet, Delight Your Heart.
副标语 Expert grooming and loving care, making your furry friend feel fabulous, inside and out.
服务短句 Gentle paws, happy pets, stress-free smiles.
品牌承诺 Quality grooming, compassionate care, every time.

多个条目没有达到指定词数,因此即使内容和语气看起来合理,仍是长度遵循失败。

A.6 准则生成比较

作者比较多个模型后选择 Claude-3.7。相同查询下,Claude-3.7 的准则在多样性、完整性与合理性上更强,描述也更能结合查询的具体要求;GPT-4o 更常重复相似准则,且未充分考虑材料信息。

Claude-3.7 与 GPT-4o 的准则生成比较

图 8: Claude-3.7 与 GPT-4o 对同一查询生成的评价准则对比。

附录 B:基准领域统计

B.1 六个一级领域

  1. 学术与工程: 覆盖结构化、规范化的学术写作流程,强调清晰、精确和严格标准,包括论文大纲、摘要、文献综述、实验报告、专利、测试报告等。写作重视逻辑论证、深入分析与经验证据整合。
  2. 金融与商业: 具有分析性和战略性,服务于决策与企业目标,包括合同、市场分析、投资报告、战略规划、产品规格、销售报告等;强调清晰简洁、金融判断与战略洞察。
  3. 政治与法律: 要求权威、正式的语气,包括政府公文、法律文本与政治传播;在清晰与正式之间平衡,严格遵守法律和程序标准。
  4. 文学与艺术: 包括小说、诗歌、剧本、艺术设计与书影评论;探索主题与情感深度,语言通常丰富、有感染力,强调个性化表达及人类共鸣。
  5. 教育: 包括教案、课程设计、反馈、作业、招生宣传、家长会讲稿等教学材料和教育沟通;强调清楚、易懂、有效教学与促进参与。
  6. 广告与营销: 包括社交媒体脚本、广告文案、品牌故事、多媒体活动材料;文风生动、有说服力,需要理解受众心理和趋势,以兼顾吸引力与战略效果。

B.2 一百个二级子领域

表 B1:学术与工程(17 个)。

子领域 定义
论文大纲 研究组成部分与逻辑流的层次化组织
致谢 对机构和个人支持的正式感谢
局限 系统识别方法约束与适用范围边界
答辩演示 答辩用幻灯片等演示支持材料
研究计划 包含验证路线图的研究蓝图
技术文档 实现规范与系统接口协议
实验 参数化验证框架及受控变量分析
引言 建立研究缺口与重要性的背景基础
结论 综合研究或项目的主要发现
测试报告 测试活动和性能的评估记录
贡献 区别于既有研究的新颖之处
实习报告 按时间记录实践工作经历
文献综述 通过学术文献分类做批判性缺口分析
答辩讲稿 研究答辩的口头陈述与问答准备
摘要 研究目标、方法、结果和意义的概述
工程报告 对任务、方法与结果的技术分析
专利 对可实施新颖权利要求的法律—技术说明

表 B2:金融与商业(20 个)。

子领域 定义
会议纪要 精炼记录讨论要点、决定与行动项
用户研究 收集用户需求与行为洞察,指导产品或服务设计
商务函件 与内外部利益相关者的正式商务沟通
人力资源管理 有效管理劳动力的战略与流程
招聘 吸引、筛选及入职合适候选人的策略
简报 在任务或会议前向利益相关者提供摘要信息
活动策划 协调活动执行所需的后勤与活动安排
市场调研 系统收集并分析市场和消费者信息
市场分析 评价市场趋势、规模、竞争者与动态
风险管理 识别、评估、排序风险并制定缓解策略
销售报告 特定时期的销售活动、业绩与收入摘要
路演材料 向投资者传达商业创意或提案的视觉演示
合同 规定商业交易条款的法律约束协议
招标文件 含项目规范与投标说明的正式邀标材料
投资分析 评价投资的潜在回报与风险
产品提案 说明新产品开发、功能与潜力的详细计划
战略规划 设定商业目标并制定行动策略
财务报告 反映财务表现和状态的综合报表
需求规格 记录项目功能与非功能需求
投标书 按既定价格满足客户需求的商品或服务正式报价

表 B3:政治与法律(20 个)。

子领域 定义
法律意见 对法律事项或问题的权威评估与指引
政府演讲 政府官员阐述政策或立场的正式讲话
裁判文书 法院签发的正式书面决定或命令
法律协议 规定各方条款与义务的有约束力合同
案例研究 用于教学或专业工作的法律案件深度分析
案例通报 对进行中或已结案件的摘要与更新
法律咨询 关于法律权利、责任或策略的专业建议
法规分析 分析影响合规与执法的规章制度
会议摘要 简述会议讨论、决定与结果
思想报告 对政治或思想趋势与观点的分析评论
政策解读 面向公众或组织的政策解释与澄清
公文 政府实体或官员签发的正式书面记录
法治宣传 向公众普及法律权利与责任的活动
答辩状 法律程序中被告方提交的正式书面论证
入党申请 加入政党的申请文本与程序材料
政策倡议 影响或推动特定政策变革与实施的工作
工作报告 特定时期的活动、成绩与挑战总结
事迹材料 突出重要成绩和贡献的记录
诉讼文书 诉讼过程中提交的法律文件
白皮书 就某问题提供信息或方案的权威报告

表 B4:文学与艺术(20 个)。

子领域 定义
角色设计 为故事或视觉媒体创作、发展详细角色
问候语 各类场合使用的友好或正式开场语
主持稿 活动或节目主持人的引导叙述与台词
小说大纲 规划小说情节、角色和场景的结构化方案
播客脚本 规划播客对话和节目环节的文本
衍生作品 基于或受既有作品启发的创作
读后感 对文学作品的个人感想与分析
视频脚本 规定视频对话和动作的脚本
书评 对书籍内容与影响的批评性评价和摘要
游戏设计 设计游戏机制、故事与界面
歌词创作 兼顾押韵和格律的歌曲文字创作
头脑风暴 创造性思考时产生的粗略想法和笔记
情节发展 规划故事线与叙事结构的过程
散文 不采用格律结构的普通书面或口头语言
影视剧本 含对白与场景指示的电影或电视蓝本
小说手稿 准备出版的完整小说文本
传记 对个人经历与成就的详细叙述
影视评论 对影视内容与效果的分析性评论
诗歌 使用节奏和隐喻语言的艺术创作
同人小说 爱好者用既有媒体角色创作的故事

表 B5:教育(12 个)。

子领域 定义
培训心得 对培训经历和所学内容的个人评价
课堂活动 用于吸引学生参与学习的练习或任务
家长会 教师与家长就学生进展进行正式交流
教案 教学目标与方法的结构化方案
教学材料 辅助向学生呈现信息的资源
作业评分 按具体标准评价并给学生作业打分
课程设计 设计教学内容、结构与交付方式
教育报告 对教育结果与表现的分析或总结
课程作业 课程中布置给学生的学术任务
评价评语 对学生表现与改进方向的反馈
教育咨询 关于教育策略与体系的专业指导
招生宣传 鼓励学生入读教育机构的策略与活动

表 B6:广告与营销(11 个)。

子领域 定义
销售信 旨在推动潜在购买者行动的说服性文字
产品描述 详细说明产品功能、优势与用途
社交媒体内容 为线上平台制作的有吸引力文字、图片或视频内容
多媒体脚本 整合多种媒体形式的营销脚本
推广文案 用于提升产品兴趣和销量的有说服力文本
推广配音稿 配合营销画面或广告的录音旁白文本
旅行指南 为旅行者提供见解与建议的信息内容
品牌故事 说明品牌历史、价值观和使命的叙事
个人博客 在线非正式分享的个人评论或故事
营销评论 对营销趋势与策略的分析性观点
标语 传达品牌身份的简短、醒目、易记短语

附录 C:提示词

以下为论文附录中的完整提示结构。为保持中文稿可读性,指令翻译为中文,变量名和 JSON 字段保留。

源码提示模板中的未消解问题:(1)查询分类 JSON 的行内注释把 style 示例写成 “academic format”,把 format 示例写成 “child-friendly tone”,与同一提示前文对 style/format 的定义正好对调;下文按字段语义翻译,不静默沿用错置示例。(2)domain 的源码示例包含 6c. Marketing Letter8d. Educational Consulting,但同一模板列出的顶层编号只到 7. Other,示例编号无法与该 taxonomy 对齐。(3)初始查询生成框的源码标题误写为 “Query Classification Prompt”,正文功能实际是生成初始查询。(4)查询细化模板中 material 字段的英文说明在 “if not needed, return” 处截断;下文“否则返回空值”是依据字段语义和前后文作出的可读化补全。

C.1 查询分类提示

系统提示:

你是一名查询分析专家。

每次迭代时,把当前二级领域标签放在“Domains”下。例如,“1. Academic & Engineering”代表一级领域,“1a. Thesis Outline”代表子领域。

用户提示:

请判断下列查询属于哪些领域,并识别其中是否存在风格、格式或长度要求。

格式要求示例:模仿上传文档的格式、遵循给定大纲、符合学术论文格式规范等。
风格要求示例:适合儿童阅读、语言严谨、语气幽默等。
长度要求示例:字数、时长或其他输出规模约束。

Query
{query}

Domains
1. Academic & Engineering
  1a. Thesis Outline
  1b. Literature Review
  ...
  1r. Others related to Academic & Engineering
2. Finance & Business
  2a. Market Research
  2b. Sales Report
  ...
  2l. Others related to Finance & Business
...
7. Other
  7a. Others

Output format
只返回下列 JSON,不要输出其他内容:
{
  "domain": ["xx.yyy", ...],
  "style": "存在时填写风格要求,否则为空字符串",
  "format": "存在时填写格式要求,否则为空字符串",
  "length": "存在时填写长度要求,否则为空字符串"
}

若数据无效或无法判断,“domain”返回空列表。

C.2 初始查询生成提示

可在提示中指定生成语言:

请在一级领域 {primary_domain} 的子领域 {subdomain} 下,以英文/中文生成 {NUM} 个不同的写作请求。
请求应尽量详细、具体,并反映真实用户的语气和需求。
只返回以下 JSON 数组,不要输出 JSON 之外的内容:
[
  "写作请求 1",
  "写作请求 2",
  ...
]

C.3 查询细化指引池

每次随机选 0–6 项:

  1. 加入生成特定长度的要求。
  2. 加入格式遵循要求,例如按照指定大纲写作或以特定格式输出。
  3. 加入风格要求,例如适合特定场合的演讲风格、适合特定受众,或模仿某种语气。
  4. 纳入用户个性化需要,例如考虑用户身份或结合个人经历。
  5. 加入更具体的内容要求,例如某一事件的细节或聚焦特定内容。
  6. 用一句话简洁表达。

C.4 查询细化提示

请根据给定指引,对一级领域 {domain1} 中子领域 {domain2} 的原始写作要求进行细化和增强。
尽可能加入细节,并说明是否需要额外写作材料。

Original Writing Requirements
{query}

Guidance for Modification
{guidance}

Output Requirements
严格返回下列 JSON,不要输出其他内容:
{
  "query": "修改后的写作要求",
  "material": "是否需要额外参考材料;如需要,给出材料建议;如不需要则返回空值"
}

C.5 准则生成提示

系统提示:

你是一名经验丰富的评价专家,擅长评价给定查询的回答。

用户提示:

请为下列查询的回答生成五条严格评价准则。
每条准则包含 name、criteria_description、1-2、3-4、5-6、7-8、9-10。
准则应支持精细评价并区分细微质量差异,能够识别相关性、连贯性、深度、具体性以及对查询上下文的遵循情况。
不要输出任何附加文字,只按指定 JSON 格式输出。

Query
{query}

Output format
[
  {
    "name": "first_criteria_name",
    "criteria_description": "第一条准则的说明,强调详细、严格的评价",
    "1-2": "低分:存在关键缺陷和重大问题,无法实现基本功能",
    "3-4": "低于平均:有明显不足,影响整体有效性,需要改进",
    "5-6": "平均:达到基本要求但并不突出;多数模型可能达到",
    "7-8": "高于平均:执行有力,仅需少量改进即可达到优秀",
    "9-10": "高分:各方面均得到最佳处理,效果和质量卓越且无缺陷"
  },
  ...
]

C.6 基于量表的评分提示

由于查询和回答可能很长,变量 “{criteria}” 在查询与回答前后各出现一次。

系统提示:

你是一名经验丰富的评价专家,擅长评价给定查询的回答。

用户提示:

请依据 Query 和 Criteria,并遵循以下 Scoring Rules 评价 Response。

Scoring Rules
1-2:存在关键缺陷和重大问题,无法实现基本功能。
3-4:有明显不足,影响整体有效性,需要改进。
5-6:达到基本要求但并不突出;多数模型可能达到。
7-8:执行有力,仅需少量改进即可达到优秀。
9-10:各方面均得到最佳处理,效果和质量卓越且无缺陷。

- 给出具体理由,指出回答中的优点或缺陷,并引用确切文本;理由应与准则一致,并说明离理想回答还缺什么。
- 必须非常严格,不要被格式或长度迷惑;要穿透表面现象彻底评价回答。
- 仔细判断回答是否只是看起来内容丰富,实际上完全是编造。
- 有时模型只给引言或概述,并未真正完成任务;这种情况应判为失败。
- 打 1–10 的整数分。

Output format
删除妨碍 JSON 解析的符号;reason 内不要使用双引号。只输出:
{
  "score": 1 到 10 的整数,
  "reason": "使用文本证据给出具体、详细的评分理由"
}

Criteria
{criteria}

Query
{query}

Response
{response}

请依据下面再次给出的准则评价:
{criteria}

Output format
删除妨碍 JSON 解析的符号;reason 内不要使用双引号。只输出:
{
  "score": 1 到 10 的整数,
  "reason": "使用文本证据给出具体、详细的评分理由"
}

附录 D:局限

本文有三项主要局限。

第一,写作模型与 critic model 主要使用常规 SFT 训练,没有系统探索更先进的优化方法。作者虽展示 CoT 在创意领域的部分效果,但与其在数学推理中的成熟应用相比,写作领域的潜力仍未充分研究。

第二,框架在复杂、多维长度要求上精度下降,包括时间顺序约束和章节级字数限制。未来需要把学习到的评价指标与结构化、基于规则的评价结合,更精确地控制输出规范。

第三,写作任务的成对偏好标注很难做到完全可靠。即使有严格流程,面对两个质量都尚可的回答时,人类仍会因叙事偏好和上下文理解产生主观偏差。共识流程可以降低波动,却理论上无法与多样的用户偏好绝对对齐。

附录 E:影响

E.1 综合 AI 写作评估生态

WritingBench 覆盖广泛领域和要求,可同时评估通用写作能力与特定领域专长。研究者既可分析模型整体通用性,也可聚焦故事创作、科学写作、商务沟通等子集。公开评估协议、准则生成工具与 critic model 有助于透明性和复现。

作者提醒:每条公开查询虽经过人工审查以移除有害内容,但经 API 生成的回答依赖底层模型,不能保证完全安全或准确,也不应直接用于商业用途。

E.2 促进领域专属研发

100 个子领域让法律、医疗文档、营销等行业能够在相关子集上比较模型并做定向优化。当某领域缺少专门评估数据时,WritingBench 的查询构建策略也可用于生成多样查询,支持开发高度专门化的写作工具。

E.3 推动强化学习与自适应评估

查询依赖框架可被接入强化学习流水线:实例专属准则能形成精确奖励,用于基于奖励的优化;按自适应准则比较预测结果,还可以构造成对偏好数据,以改善模型与人类偏好的对齐。论文在这里提出的是未来用途;本文实际训练的写作模型和 critic model 仍以 SFT 为主,并未实施写作 RL。

附录 F:NeurIPS 论文检查表(作者回答)

以下保留论文作者对检查表各项的实质回答;会议提供的通用解释性指南不重复翻译。

项目 回答 作者说明
主张是否准确反映贡献和范围 方法见第 3 节各子节,实验验证见第 4 节
是否讨论局限 见附录 D
理论假设与证明是否完整 作者称第 4 节与补充实验为结论提供了详细实验和分析;本文主要是经验研究
实验结果是否可复现 构建流程、提示、评估数据与代码、训练参数、模型及榜单均已提供或给出入口
数据和代码是否开放 GitHub 仓库提供数据、代码和 README
是否给出实验设置细节 评估设置、critic model 与写作模型的数据和参数见第 3、4 节
是否报告统计显著性信息 主结果表报告 3 次采样的标准差
是否给出计算资源 见实验设置中的 A100 数量等信息
是否遵守 NeurIPS 伦理规范 作者声明遵守 NeurIPS Code of Ethics
是否讨论更广泛影响 见附录 E
是否设置安全保障 基准只用于评估,公开提示均人工审查以移除有害信息
既有资产许可与归属是否合规 作者称所有使用资产均已正确引用
新资产是否有文档 GitHub 提供说明和使用条款
众包/人类受试信息是否充分 论文给出标注说明、截图和报酬
是否说明 IRB 或同等审批 作者称遵守当地伦理审批法律;标注员受雇于专业公司,已获知数据用途并同意
是否声明 LLM 使用 LLM 在基准构建和评分中的参与见第 3.1、3.2 节

检查表内部不一致: 作者对“每项理论结果是否给出完整假设和正确证明”回答“是”,但理由只指向实验章节和补充实验;正文没有定理、引理或证明。上表忠实保留作者选择,同时注明这一 checklist 回答与论文的经验研究性质并不吻合。

参考文献说明

论文的参考文献条目未作意译,以免改变题名、作者或出版信息。完整书目原样保存在 source/acl_latex.bib,正文中的模型、基准和方法名称可据此追溯。