跳转至

HoWToBench:用“写作树”整体评估大语言模型的人类水平写作能力

arXiv:2604.19071v1,2026-04-21。中文译文以 arXiv LaTeX 源码为准,并用 49 页 PDF 核验题名、作者、版本与实验表格。术语约定:Tree-of-Writing 译为“写作树”,简称保留为 ToW;Completion、Guide、Open 分别译为“补全”“引导写作”“开放写作”。重要论述后的方括号保留源码引用键;完整引文信息见 source/custom.bib,逐段英文追溯层见 main_en.md

作者: Andrew Zhuoer Feng(冯卓尔,等贡献;工作完成于 Z.ai 实习期间)、Cunxiang Wang(王存祥,等贡献、通讯作者)、Yu Luo、Lin Fan、Yilin Zhou、Zikang Wang、Xiaotao Gu、Jie Tang(唐杰)、Hongning Wang、Minlie Huang(黄民烈,通讯作者)。

机构: 清华大学计算机科学与技术系;Z.ai。

摘要

由于写作能力具有多维属性,而现有指标又存在局限,评估大语言模型(LLM)的写作能力仍是一项重大挑战。传统的基于参考答案的指标和现代 LLM-as-a-judge 方法,都无法充分评估千字级开放写作。本文提出写作树(Tree-of-Writing,ToW),用于解决 LLM-as-a-judge 在聚合文本各项子特征时经常出现的隐式不一致。ToW 采用树形工作流,对子特征的聚合权重进行显式建模。

本文还提出 HoWToBench:一个大规模中文写作基准,覆盖 12 个体裁、1,302 条指令和三类任务——上下文补全、按大纲引导写作、开放式生成。ToW 有效缓解了评估偏差,与人类判断的 Pearson 相关系数达到 0.93。作者还发现,基于文本重叠的生成指标和常见 LLM-as-a-judge 方法都容易受到文本扰动影响,而 ToW 对此更稳健;在 Guide 任务中,输入长度与内容得分呈负相关,说明简单堆叠输入信息并不能提升写作质量。

1 引言

LLM 的进步推动了摘要、机器翻译、对话代理和创意写作等任务的发展 [ouyang2022training, rafailov2024dpo, basyal2023textsummarizationusinglarge, zhu-etal-2024-multilingual, chatgpt3.5, chatglm, gemini1.5, rocstories, writingprompts],但复杂、开放式写作的自动评估仍然困难 [longform, multimodallongstory, llmfictionworldview]。生成细腻且切合语境的文字,需要处理大量隐含要求;现有写作评估却主要关注显式指令是否得到满足 [alignbench, kim2024biggenbenchprincipledbenchmark, zhu2023judgelmfinetunedlargelanguage, 2025wb]。这种类似“模仿游戏”的窄视角,忽略了模型写出虚构叙事、说服性演讲等复杂文本的能力——这些任务的真正意图往往隐含在表面要求之下。

常见方法把评价标准作为提示词,要求评估模型分别给流畅性、一致性、指令遵循等维度打分,再得到总分 [kim2024prometheus, zhu2023judgelmfinetunedlargelanguage, 2025wb]。简单平均子分数未必能反映整体质量;让 LLM 自己规划各维度的权衡,又会在不同运行或不同查询之间产生不透明且不一致的聚合。作者把这种偏离评价准则的现象称为“协商不一致”(Negotiation Inconsistency)。

为此,ToW 把语言、逻辑、情节等具体方面作为叶节点。对每条写作指令,LLM“协商器”根据体裁、任务类型和其他要求设计聚合方案;系统随后深度优先遍历这棵树,调用相应的子分数专家评估每个方面,从而得到透明、可复现的细粒度写作评价。

HoWToBench 不再只把写作视为指令模仿,而是用补全、引导写作和开放写作三种任务形式控制上下文信息量。它覆盖 12 个创意与功能性体裁,共 1,302 条写作指令,参考文本来自专业人士写作。人工质量检查的最终通过率为 96.85%。作者用 Gemini-2.0-Flash、GPT-4o、o3-mini、Claude-3.5-Sonnet、DeepSeek-R1/V3 等 10 个模型进行大规模评测。ToW 对模型系统排名与人工排名的 Pearson 相关最高达到 0.93。

实验还显示:GPT 系列在上下文丰富的补全任务中表现强,但在输入信息较少时明显下降;输入长度和输出长度正相关,但更长的输入、输出往往对应更低的总体评价;包括 LLM-as-a-judge 在内的多数指标会被重复等文本扰动误导。

2 相关工作

2.1 写作能力基准

早期工作多评估“提示词到故事”等受限体裁的叙事质量 [rocstories, guan-etal-2021-openmeva]。近期基准开始评估通用文本生成,强调指令遵循、连贯性和领域知识 [mtbench, alignbench, zhang-etal-2024-prolex, zhang-etal-2024-decor, liang2023helm, 2025wb],但仍难以处理多种开放写作任务;无参考评估也常偏好与评估模型自身生成风格相似的文本 [deutsch-etal-2022-on-the-limitations-of-reference-free-evaluation]。HoWToBench 的区别在于:(1)覆盖 12 个体裁与三种任务形式;(2)以高质量人类参考为基础,分别评价格式、内容与主观印象。

2.2 基于 LLM 的评估

LLM 评估可以通过提示工程直接调用专有模型 [mtbench, liu-etal-2023-geval],也可以在人工标注上微调评估器 [wang2024pandalm, ke-etal-2024-critiquellm]。它们在摘要等受限任务上通常比 BLEU [papineni-etal-2002-bleu]、ROUGE [lin-2004-rouge] 更符合人工判断,但开放写作中会出现冗长偏差 [mtbench]、位置偏差 [wang-etal-2024-large-language-models-are-not-fair-evaluators] 和对 rubric 的依赖 [ke-etal-2024-critiquellm, kim2024prometheus]。近来的自动规划 rubric 方法 [2025wb] 虽让 LLM 自行生成标准,其稳健性仍缺少检验。

表 1:与既有自然语言生成/指令遵循基准的比较。

工作 规模 任务数 语言 参考来源 领域 开放式 指令遵循 维度 指标
WritingPrompts [writingprompts] 10k+ 1 英文 Reddit 写作提示 100–200 字故事 BLEU、ROUGE
BIG-Bench Generation [kim2024biggenbenchprincipledbenchmark] 770 9 英文 主要由 LLM 生成 指令遵循、推理、安全 Rubric LLM 指标
LOT [guan-etal-2022-lot] 729 4 中文 在线故事 故事 BLEU、DIST
MT-Bench [mtbench] 10 1 英文 自建 功能性写作 通用 LLM-as-a-judge
AlignBench [alignbench] 75 4 中文 LLM 生成 文本生成 Rubric LLM-as-a-judge
WritingBench [2025wb] 1,239 6 中/英 LLM 生成、人工修订 指令式写作 自动规划 LLM-as-a-judge
HoWToBench(本文) 1,302 3×12 中文 专业写作者 创意与功能写作 文本特征 ToW

3 评估方法

3.1 写作树机制

人类评价复杂文本时,通常会把总体特征分解为更具体的子标准 [que2024hellobench, alignbench, wen2024complexbench],这天然对应一棵按深度优先顺序访问的树。ToW 选取三个与任务无关的一级节点:内容 \(V_C\)格式 \(V_F\)印象 \(V_I\);这些维度反复出现于文本生成评估文献 [guan-etal-2022-lot, alignbench, wang2025vff]。令根节点为 \(R\),三个一级节点分别通过带权边 \(E_C,E_F,E_I\) 与根相连。内容和格式节点还可以拥有表示细粒度特征的叶节点 \(L_i\);印象节点本身就是叶节点。

\[ \begin{aligned} \mathrm{Score}(V_C) &= \sum_{L_i\in \mathrm{Child}(V_C)} w_{E_{V_CL_i}}\,\mathrm{Score}(L_i),\\ \mathrm{Score}(V_F) &= \sum_{L_i\in \mathrm{Child}(V_F)} w_{E_{V_FL_i}}\,\mathrm{Score}(L_i),\\ \mathrm{Score}(R) &= \sum_{j\in\{C,F,I\}} w_{E_j}\,\mathrm{Score}(V_j). \end{aligned} \]

其中 \(\mathrm{Child}(\cdot)\) 返回某节点的子节点集合。

3.2 评分函数

不同节点使用不同评分方式。内容节点的每个叶节点代表一项具体特征,多个 LLM 结合 rubric 和参考文本,对每项特征给出 1–10 分。格式节点采用规则与 LLM 混合评分,并映射为 0、5、10 三档:“情节与结构”“分段”等由 LLM 判断结构和细节是否恰当;“格式规范”则用正则表达式检测标题、层级和列表格式。实现见附录“标题解析正则”。

ToW 评估框架:根节点总分下分为内容、格式与印象,协商器按指令显式确定边权。

图 1:ToW 评估框架。 内容节点通过连贯性、逻辑、丰富度、开头与结尾等特征评价语义质量;格式节点评价情节、分段和格式遵循;印象节点不再细分,负责整体主观评价。协商器 \(J_W\) 根据每条指令显式给出节点间权重。

3.3 边权

对每组叶节点,ToW 采用显式权重。LLM 协商器按指令 \(\mathcal I^i\) 产生权重,要求每个权重位于 \((-1,1)\),且同一父节点下的权重和为 1:

\[ \begin{aligned} (w_{E_{V_XL_1}},\ldots,w_{E_{V_XL_n}})^i &= J_W(\mathcal I^i),\quad X\in\{C,F\},\\ \text{s.t.}\quad \sum_{k=1}^{n}w_{E_{V_XL_k}}&=1,\quad w_{E_{V_XL_k}}\in(-1,1). \end{aligned} \]

叶节点打分后,再按这些显式权重聚合。这样可避免 LLM 在同一指令上时而平均、时而选择性强调某些维度的隐式聚合不一致,也提高了可解释性。内容、格式、印象三个一级节点之间,则按各节点包含的叶节点数进行平均,使不具备格式维度的补全任务也能纳入统一框架。

4 HoWToBench

4.1 任务定义

  • 写作指令 \(\mathcal I\):列出任务要求,并包含一句目标输出摘要。
  • 基础信息 \(\mathcal G\):补充格式、叙事/情节约束和风格要求;开放写作任务中完全省略。
  • 人类参考 \(\mathcal R\):精心筛选的高质量人类写作,作为评价标准。

模型生成 \(W=\mathrm{LLM}(\mathcal I,\mathcal G)\),目标是在指令约束下达到人类水平,再从内容和格式两方面评价。

4.2 数据来源、分类与过滤

作者从 CN Writer、PW4ES、SeptES、ZJPub 和 Officials 等专业文学/写作指导网站收集公开许可的人类文本。GPT-4o-1120 先给文本分配体裁标签,三名分别具有人文学科、新闻学和金融学背景且有两年 LLM 行业经验的专家复核。1,302 条样本上,GPT-4o 的分类准确率为 98.6%,错误全部人工纠正。

体裁包括小说、诗歌、散文、随笔、议论文、报告、总结、信件、演讲、现场致辞、计划、合同和公文等;论文把少量体裁在最终统计中归并为 12 大类。Claude-3.5-Sonnet-20241022 再按 12 套体裁专用 rubric 给每篇文本打 1–5 分,低于 4 分者剔除。

HoWToBench 的写作体裁层次。

图 2:HoWToBench 体裁层次。

4.3 三个渐进难度级别

  1. Level I:补全。 从原文删除若干段落,模型依据剩余上下文填空,最多删除 10 段。
  2. Level II:引导写作。 模型依据给定大纲和详细基础信息扩写完整文本。
  3. Level III:开放写作。 指令只给出体裁与一句话主题、情节或论点,不提供基础信息,即 \(\mathcal G=\varnothing\)

4.4 反向构造指令

补全任务由人工删除原文段落,未删文本作为 \(\mathcal G\),删除段落作为 \(\mathcal R\)。指令模板为:“请补全下列【体裁】中以 [fill in the blank] 标记的空白。请综合考虑上下文并保证补全质量。”

引导与开放写作由 Gemini-2.0-Flash 充当反向构造器:

\[ (S,T,G)=\mathrm{BackConstruct}(R), \]

其中 \(S\) 为原文摘要,\(T\) 为不超过五个词的主题;二者进入指令模板。反向构造器还根据体裁特征,从参考文本生成写作要求,组成 \(\mathcal G\)。具体小说提示词见附录。

表 2:数据集统计(长度单位为中文字符)。

类型/统计 补全 引导 开放 总计
创意写作样本数 379 277 282 938
指令长度 44.02 88.82 89.29 70.86
基础信息长度 2016.02 318.48 1299.22
参考长度 431.37 1607.52 1726.05 1167.93
功能写作样本数 179 185 364
指令长度 85.68 91.83 88.80
基础信息长度 467.39 467.39
参考长度 1335.23 1373.91 1354.89

4.5 质量保证

指令与基础信息最初由模型合成,三名专家逐条检查其清晰度、与人类参考的相关性及表达自然度,并按附录准则修改不合格样本。为进一步提高参考 \(R\) 的质量,每条指令还收集 GPT-4o-1120、GLM-4-Plus 和 Gemini-2.0-Flash 的生成结果,与原始人类文本组成四个候选。两名随机分配的专家独立选出最佳文本,一致率为 96.7%;分歧由第三名专家裁决。1,302 篇原始人类文本中有 137 篇(10.5%)未被选为最佳,随后替换成专家选中的候选。

作者还删除或去标识化个人信息、不安全内容、广告等不需要的元素;DeepSeek-R1 自动检测器辅助标注,最终不合格率为 41/1,302。

5 实验

5.1 设置

基线分为自动指标和 LLM-as-a-judge。自动指标包括 BLEU [papineni-etal-2002-bleu]、ROUGE [lin-2004-rouge]、BLEURT [sellam-etal-2020-bleurt]。LLM 评估包括原始 LLM-as-a-judge [mtbench],以及两个代表性变体:自动规划在一次查询中同时决定相关子领域、聚合策略和最终分数;细化 Rubric直接依据人工标注指南设计评价提示词。所有体裁提示词均收录于附录。

被评模型包括 GPT-4o-2024-11-20 [gpt-4o]、Gemini-2.0-Flash、DeepSeek-R1 [deepseek-R1]、DeepSeek-V3 [deepseek-v3]、Doubao-Pro-32K [doubao-pro]、GLM-4-Plus-250111 [glm-4-plus]、Claude-3.5-Sonnet-20241022 [claude-3-5-sonnet]、Claude-3-Haiku-20240307 [claude-3-5-haiku]、Qwen-Plus [qwen-2.5] 等。所有 LLM-as-a-judge 方法统一以 GPT-4o 为评估模型。

5.2 MetaEditor 人工元评估集

MetaEditor 从 1,302 条指令中抽取 221 条(补全 67、引导 83、开放 71),均匀覆盖所有体裁;每条包含九个模型输出。36 名有写作背景的专家按三套指南训练后,以 1–5 分打分。同一指令的九个输出由同一标注员评价,每个输出由两人交叉评分。Cohen's \(\kappa=0.71\),Pearson 相关为 0.87。作者取两人分数的平均,并请与其他标注员一致度最高的五名专家复查全部标注。

5.3 元评估结果

下表报告系统级 Pearson \(\rho\)、Kendall \(\tau\)、Spearman \(\sigma\)。SC 表示 self-consistency;worst/best 是同一批自一致运行中的最低/最高结果。

方法 成本(美元) 补全 \(\rho/\tau/\sigma\) 引导 \(\rho/\tau/\sigma\) 开放 \(\rho/\tau/\sigma\) 全部 \(\rho/\tau/\sigma\)
BLEU-1 0.85/0.67/0.80 0.65/0.54/0.69 0.70/0.50/0.62 0.75/0.56/0.72
BLEU-rt 0.19/0.06/0.15 -0.25/-0.20/-0.19 -0.45/-0.22/-0.27 -0.19/-0.11/-0.20
ROUGE-L 0.87/0.67/0.75 0.06/0.14/0.20 0.46/0.22/0.32 0.46/0.06/0.17
ToW 7.34 0.87/0.67/0.78 0.85/0.76/0.89 0.89/0.78/0.88 0.93/0.83/0.93
平均评分(ToW 无规划) 7.02 0.85/0.56/0.67 0.78/0.65/0.78 0.90/0.61/0.82 0.89/0.61/0.82
细化 Rubric—worst 1.31 0.86/0.56/0.70 0.78/0.65/0.78 0.89/0.83/0.90 0.89/0.61/0.82
细化 Rubric—best 1.31 0.84/0.56/0.72 0.82/0.70/0.82 0.91/0.83/0.92 0.89/0.67/0.87
细化 Rubric + SC(n=5) 6.53 0.85/0.56/0.70 0.80/0.65/0.78 0.90/0.83/0.90 0.89/0.61/0.82
细化 Rubric + SC(n=10) 13.17 0.85/0.56/0.70 0.81/0.70/0.80 0.90/0.83/0.90 0.89/0.61/0.82
自动规划—worst 0.89 0.63/0.40/0.49 0.78/0.63/0.74 0.83/0.61/0.73 0.87/0.50/0.62
自动规划—best 0.89 0.73/0.56/0.72 0.81/0.63/0.77 0.85/0.72/0.82 0.88/0.67/0.83
自动规划 + SC(n=5) 4.45 0.73/0.42/0.57 0.79/0.54/0.67 0.84/0.67/0.85 0.88/0.67/0.83
自动规划 + SC(n=10) 8.93 0.73/0.39/0.47 0.79/0.59/0.70 0.84/0.67/0.77 0.88/0.61/0.82

ToW 在全部任务上的 Pearson 和 Spearman 均达到 0.93。BLEU 与 ROUGE-L 的差异说明,目标写作评价并不主要依赖对参考文本的召回;基于较弱神经模型的 BLEU-rt 近似随机。自动规划在补全、引导任务上也更差,暴露了它面对大量指导信息时的局限。

5.4 协商偏差

在自动规划 + 自一致(\(N=5\))设置下,对每个样本计算子分数 \(s_k\) 占总分 \(S\) 的比例 \(l_k=s_k/S\),再用以下两个指标衡量五次运行间的波动:

\[ \delta=\sum_{t=2}^{5}|l_k^{(t)}-l_k^{(1)}|,\qquad \sigma=\sqrt{\sum_{t=1}^{5}(l_k^{(t)}-\mu_{l_k})^2}. \]

自动规划得到 \(\bar\delta=0.273,\bar\sigma=0.059\);ToW 中 \(l_k\)\(J_W\) 规划的权重,对应 \(\bar\delta=0.080,\bar\sigma=0.017\)。显式权重显著降低了隐式规划的聚合波动。增加自一致采样次数只能减少随机波动,并未显著提升结果;自动规划最终趋近简单平均评分。

5.5 自一致性

在成本相近时,ToW 与人工判断的总体一致性强于加入 self-consistency 的基线。自一致采样可以减小随机波动,但随着采样次数增加,并未带来显著改进。相反,自动规划会逐步收敛到简单平均评分:它没有一组显式、确定的权重,因此多次运行只是在对不稳定的隐式协商取平均,不能解决协商机制本身的问题。

5.6 节点消融

设置 引导 \(\rho/\tau/\sigma\) 开放 \(\rho/\tau/\sigma\)
ToW 0.85/0.76/0.89 0.89/0.78/0.88
去掉内容 0.81/0.76/0.88 0.84/0.78/0.88
去掉格式 0.80/0.65/0.78 0.89/0.72/0.82
仅内容 0.79/0.65/0.78 0.89/0.78/0.87
仅格式 0.71/0.71/0.65 0.67/0.50/0.68
仅印象 0.81/0.70/0.79 0.90/0.72/0.82

移除任一一级节点都会降低与人工判断的相关性,说明内容、格式、印象提供互补信号。仅保留格式时下降最大:格式不足以单独支撑整体评价,但对内容评估仍有必要。

5.7 内容边权与模型得分

协商器为内容节点下四个叶节点分配的权重随体裁明显变化。“逻辑”的权重在多数体裁内也有较大波动;开头/结尾的权重则在各体裁中稳定在约 10%。所有体裁都不是均匀分配权重。

小说体裁内容叶节点的权重分布;横向越宽表示该权重在体裁内部变化越大。

议论文体裁内容叶节点的权重分布;横向越宽表示该权重在体裁内部变化越大。

任务/体裁 平均 DS-R1 o3-mini GPT-4o Claude-3.5-S Gemini DS-V3 Doubao GLM Claude-3-H Llama-3.3
补全 6.10 6.16 6.60 5.55 5.43 5.44 5.58 5.19 5.12 4.36
引导 6.15 5.80 5.61 5.76 5.53 5.52 5.24 5.51 5.08 4.89
开放 6.06 5.69 5.36 5.43 5.33 5.31 5.14 5.28 4.85 4.47
议论文 5.68 6.24 6.08 6.23 5.73 5.54 5.61 5.74 5.69 5.16 4.77
评论 5.48 5.95 6.02 5.98 5.54 5.36 5.53 5.30 5.36 5.10 4.65
诗歌 5.40 6.00 5.81 6.34 5.41 5.42 5.60 5.15 5.47 4.58 4.20
散文 5.32 6.25 5.76 5.75 5.49 5.35 5.16 5.06 5.13 4.89 4.33
小说 5.07 6.08 5.36 5.37 5.32 5.23 4.82 4.84 4.89 4.53 4.25
信件 6.02 6.38 6.11 6.13 6.08 6.12 6.18 6.07 6.05 5.47 5.64
其他 5.97 6.33 6.05 6.30 5.91 6.00 6.02 6.42 5.94 5.63 5.12
演讲 5.60 6.01 5.94 5.64 5.80 5.61 5.74 5.66 5.54 5.28 4.83
报告 5.42 5.90 6.00 5.29 5.82 5.26 5.55 5.18 5.11 5.30 4.81
合同 5.17 5.52 5.80 4.97 5.11 5.08 5.33 5.24 5.18 5.06 4.37
计划 5.03 5.44 5.75 5.02 4.97 4.94 5.11 5.23 4.83 4.78 4.26
规章/公文 4.90 5.31 5.13 4.66 4.91 5.07 4.87 5.07 4.69 4.59 4.72
全部 6.10 5.86 5.81 5.58 5.43 5.42 5.34 5.34 5.01 4.59

高级推理模型和专有模型总体领先。补全→引导→开放呈现清晰难度梯度;GPT-4o 相比补全,在引导和开放任务上分别下降约 15% 和 18.8%。多数模型擅长受约束的指令遵循,却难以做好开放写作;模型在信件等强结构体裁上较好,在小说等要求更高的体裁上较弱。

6 讨论

6.1 “模仿游戏”:更长并不更好

相关变量 补全 引导 开放
输入—输出长度 0.24** 0.32** 0.25**
输入长度—总分 -0.01 -0.44 -0.15**
输入长度—内容分 -0.01 -0.44 -0.11**
输入长度—格式分 N/A -0.16** 0.00*
输出长度—总分 0.38** -0.18** -0.12**
输出长度—内容分 0.38** -0.09** -0.08**
输出长度—格式分 N/A -0.16** -0.09**

** 表示 \(p<0.05\)* 表示 \(p<0.1\)。输入与输出长度显著正相关。引导、开放任务的线性拟合斜率分别为 1.4 和 6.1,表示输入字符向输出字符的转换比例。但在这两类任务中,不论输入还是输出,长度都与最终分数显著负相关。尤其引导任务的输入长度与内容分、总分相关均为 -0.44:堆叠输入信息不能保证写出高质量、细腻的文本。

补全任务中输入长度、输出长度及分数关系的散点与线性回归。

6.2 对文本扰动的稳健性

针对评价指标中的“奖励黑客”问题 [rewardhacking],作者从十个模型中随机选 50 个样本,每个模型五个,并按既有文本扰动方法 [guan-etal-2021-openmeva] 施加三类扰动:(1)Drop:随机删除最多三段或三句;(2)Repeat:在不同位置重复最多三段;(3)Transfer:改写为评论、信件、公文或诗歌。

方法 初始 删除 重复 转评论 转信件 转公文 转诗歌
ToW 5.41 -0.36 -0.49 -0.30 -0.31 -0.97 -0.62
ToW—内容 5.82 -0.34 -0.48 -0.17 -0.10 -1.12 -0.36
ToW—格式 5.77 -0.58 -0.81 -0.69 -0.65 -0.74 -1.12
ToW—印象 6.76 -0.24 -0.30 -0.14 -0.36 -1.52 -0.70
自动规划 6.82 -0.06 -0.30 +0.08 +0.04 +0.20 +0.82
BLEU 24.66 -7.27 +4.23 +0.97 +1.21 -1.56 -8.50
BLEU-rt 37.43 -2.07 -0.35 -2.37 +1.55 +3.20 +1.91

理想指标应在扰动后降分。ToW 对所有扰动都如此;自动规划、BLEU 和 BLEU-rt 却在若干破坏性改写后反而升分,说明它们可能被结构化方式绕过。

7 结论与局限

本文以 HoWToBench 和 ToW 处理开放写作评估难题。ToW 用树形推理和显式权重替代固定 rubric 的隐式聚合,降低协商偏差,并与人类判断高度一致。实验揭示了主流模型在格式遵循、内容质量和创造性之间的明显差异,也说明需要针对不同写作体裁设计评价标准。

局限包括:第一,虽然覆盖 12 个体裁,评价仍停留在体裁层面,未细分每个体裁的子体裁和特殊结构;数据主要为中文,多语言适用性仍待扩大。第二,只评估单轮生成,未覆盖自我批评、多轮人机协作和动态反馈等真实写作流程。第三,作者没有测试 ToW 随叶节点数量增长的可扩展性;在复杂文本缺乏完整任务框架的背景下,当前树结构相对保守。

致谢

本研究获国家杰出青年科学基金(62125604)、国家自然科学基金(62536008)和国家自然科学基金重大项目(92570203)支持。

伦理声明

清华大学计算机科学与技术系与 Z.ai 的机构审查委员会审查了本研究的数据收集协议和人工标注指南。由于研究对参与者只有最低风险,且未收集任何个人身份信息(PII),委员会认定无需进行完整审查。Claude、Gemini、Doubao 的引用 [claude-3-5-sonnet, claude-3-5-haiku, gemini-2.0, doubao-pro] 缺少正式预印本技术报告,相关 URL 的可用性可能随公司重组或产品更新而变化。

附录 A 数据准备补充信息

A.1 抓取来源

中文来源包括:中国作家网(约 5k,专业小说、散文、诗歌);第一范文网(约 30k,合同、计划、总结、思想汇报、演讲、致辞等功能写作);九月范文网(约 30k,补充功能写作);浙江宣传(约 10k,社会、历史、文化评论);公文网(约 20k,宣传、致辞、公告等;作者购买而非抓取其商业内容)。英文来源包括 American Rhetoric(美国历史演讲)、Obooko(16 世纪至当代多体裁出版物)和 IvyPanda(32 个主题的范文;同源 Hugging Face 数据集约 100k)。

A.2 英文泛化性

作者从三个英文来源构建 852 条样本,处理流程与中文集一致。由于大规模人工评估成本很高,论文仅对 17 条英文指令、九个模型做双重复核的初步人工评价(IAA=0.72)。

指标 补全 引导 开放 总体
BLEU-1 0.74* 0.65* 0.69 0.71*
ROUGE-L 0.85* 0.34 0.48 0.52
Rubrics 0.76* 0.85* 0.81 0.81*
自动规划 0.65* 0.71 0.54 0.69
ToW 0.82* 0.82 0.86* 0.85*

* 表示 \(p<0.05\)。结果与中文主实验的趋势高度一致,表明 ToW 可以适配其他语言。

A.3 内容、格式与印象叶节点

内容特征 说明 评分
开头与结尾 是否有吸引力;是否突兀中止,或强行拔高语气、情节、结论 1–4:弱于参考;5–7:与参考相当;8–10:优于参考
语言与修辞 修辞是否恰当,词汇与表达是否丰富,是否避免单调的列表式文风 同上
恰当例证 不违背现实知识;论证是否采用恰当实例 同上
论证与逻辑 论点、情节发展和全文逻辑是否合理连贯;过渡是否顺畅;是否避免突兀、强行的因果关系 同上
情感 是否有效向读者传递情绪;人物是否具有恰当的情感深度 同上
格式/印象特征 说明 评分
情节 情节是否合理 1–4:弱于参考;5–7:相当;8–10:优于参考
格式规范 用正则检测中文标题、Markdown 标题、有序/无序列表及层级 0:层级违规或连续正文中滥用列表;5:标题一般或无标题;10:通过全部规则
分段 章节、段落划分是否合理 1–4:失衡;5–7:合理;8–10:设计出色
整体印象 是否满足指令的主题和要求 1–4:弱于参考;5–7:相当;8–10:优于参考

附录 B 进一步讨论

B.1 不同评估模型

作者在引导与开放任务上,比较 GLM-4、Gemini-2.0-Flash、GPT-4o-1120、DeepSeek-V3、DeepSeek-R1 的样本级 Pearson 相关。DeepSeek-V3 与人工判断相关最高,GLM 和 GPT 与人工相关较低;但各 LLM 评估器彼此相关都很高(\(\rho>0.5\)),提示它们可能共享偏差。人工专家交叉验证达到 \(\kappa=0.56,\rho=0.67\),说明人工与 LLM 判断仍有差距。

不同 LLM 评估器与人工专家之间的 Pearson 相关。

B.2 有参考与无参考评价

作者从三类任务均匀随机抽取 300 条样本,移除参考文本后重新评价。

方法 有参考 Pearson/Spearman/Kendall 无参考 Pearson/Spearman/Kendall
DeepSeek—基线 0.688/0.717/0.556 0.592/0.383/0.278
DeepSeek—Rubric 0.585/0.533/0.389 0.452/0.333/0.222
DeepSeek—ToW 0.748/0.750/0.556 0.714/0.733/0.556
Gemini—基线 0.160/0.267/0.222 0.697/0.750/0.556
Gemini—Rubric 0.716/0.733/0.556 0.423/0.600/0.389
Gemini—ToW 0.723/0.767/0.556 0.749/0.800/0.611

无参考时 ToW 仍保持较高系统级相关,而基线和 rubric 方法明显下降,说明 ToW 的判断并不依赖参考文本存在。

B.3 参考来源

保持指令和基础信息不变,用某个 LLM 的输出作为六分参考,再以 Gemini-2.0-Flash 评价。人类参考总体一致性更高;替换参考来源通常降低相关,但 ToW 对不同来源仍较稳健。

方法 人类参考 DeepSeek-V3 参考 o3-mini 参考 Claude-3.5 参考
DeepSeek—基线 0.688 0.477 0.723 0.756
DeepSeek—Rubric 0.585 0.451 0.652 0.646
DeepSeek—ToW 0.748 0.607 0.816 0.783
Gemini—基线 0.160 0.730 0.459 0.380
Gemini—Rubric 0.716 0.580 0.469 0.473
Gemini—ToW 0.723 0.715 0.528 0.552

附录 C 完整分析图

完整源码还提供输入/输出长度与总分、内容分之间的 15 张散点回归图,以及 12 个体裁的边权图。图中箱体横向越宽,表示该体裁内部相应权重变化越大。下列本地 PNG 与原图一一对应:

长度与分数关系:

体裁边权: 议论文评论合同小说信件其他计划诗歌散文公文/规章报告演讲

展开全部 15 张长度关系图 ![补全:输入长度—内容分](images/relations/Comp-input-len-content-score.png) ![补全:输入长度—输出长度](images/relations/Comp-input-len-output-length.png) ![补全:输入长度—总分](images/relations/Comp-input-len-overall-score.png) ![补全:输出长度—内容分](images/relations/Comp-output-length-content-score.png) ![补全:输出长度—总分](images/relations/Comp-output-length-overall-score.png) ![引导:输入长度—内容分](images/relations/Guide-input-len-content-score.png) ![引导:输入长度—输出长度](images/relations/Guide-input-len-output-length.png) ![引导:输入长度—总分](images/relations/Guide-input-len-overall-score.png) ![引导:输出长度—内容分](images/relations/Guide-output-length-content-score.png) ![引导:输出长度—总分](images/relations/Guide-output-length-overall-score.png) ![开放:输入长度—内容分](images/relations/Open-input-len-content-score.png) ![开放:输入长度—输出长度](images/relations/Open-input-len-output-length.png) ![开放:输入长度—总分](images/relations/Open-input-len-overall-score.png) ![开放:输出长度—内容分](images/relations/Open-output-length-content-score.png) ![开放:输出长度—总分](images/relations/Open-output-length-overall-score.png)
展开全部 12 张体裁边权图 ![议论文边权](images/weights/argumentative.png) ![评论边权](images/weights/comment.png) ![合同边权](images/weights/contract.png) ![小说边权](images/weights/fiction.png) ![信件边权](images/weights/letter.png) ![其他体裁边权](images/weights/others.png) ![计划边权](images/weights/plan.png) ![诗歌边权](images/weights/poem.png) ![散文边权](images/weights/prose.png) ![公文/规章边权](images/weights/regulation.png) ![报告边权](images/weights/report.png) ![演讲边权](images/weights/speech.png)

以下继续完整翻译论文的提示词、人工指南、实现细节和数据样例。原论文附录中成对出现的中文样例及其 GPT-4.1 英译版内容相同;本译文保留中文原例,并在对应英译表处明确标注重复关系,避免把同一长文重复收录两次。

附录 D 数据构造提示词与人工选择准则

D.1 写作体裁分类器

输入: {text}

把文本归入且只归入一个标签:Creative - Fiction / Poetry / Prose / Essay / Argumentative,或 Functional - Report / Summary / Letter / Application / Speech / Delivery / Plan / Contract / Official。判定依据如下:小说重人物、情节与环境;诗歌重分行、凝练语言、节奏和意象;散文是不受诗体约束的描述/想象文字;随笔结合个人反思与艺术风格;议论文围绕立场组织证据和逻辑。功能写作则分别按报告、总结、信件、申请、演讲、现场致辞、计划、合同、公文的常规目的和格式识别。

只输出方括号包围的标签,例如 [Creative - Fiction]

D.2 粗粒度小说过滤器

输入: {content}。扮演专业小说评论者,对每个维度给 1–5 分并简述理由,最后给 1–5 分总分。

  1. 情节与结构: 情节是否连贯紧凑并保持兴趣;结构是否避免拖沓/空洞;中长篇是否具备开端、发展、高潮、回落和结局;节奏是否产生张力。
  2. 人物发展: 人物是否多维且性格鲜明;是否有可信的成长、转变、内部冲突和人物弧;关系是否自然并推动情节。
  3. 主题与思想: 主题是否明确、深刻、发人思考;是否借人物、情节或象征表达思想;是否体现特定时代、社会或文化语境。
  4. 语言与风格: 语言是否生动优雅并匹配故事氛围;细节是否服务于人物、场景、情绪和叙事推进。
  5. 情感共鸣: 情感是否真实可信,能否使读者投入并产生共情。
  6. 创新与独特性: 是否突破常规叙事/风格,是否具有独特视角和可辨识的声音。

输出字段:情节与结构、人物发展、主题与思想、语言与风格、情感共鸣、创新与独特性、综合评分。1–2 表示较差,3–4 表示中等,5 表示优秀。

过滤分数分布:

分数 CN Writer PW4ES SeptES ZJPub Officials
1 0 153 20 0 2
2 12 351 134 3 15
3 1137 13188 10261 272 8705
4 4468 72908 3216 722 6957
5 19 861 73 86 204

D.3 小说反向构造器

输入: {content}。假设要指导另一个 LLM 生成这篇目标小说,按以下六栏写出要求:

  1. Plot and Structure:不超过 100 词概括主情节。
  2. Character Development:每名主要人物不超过 100 词,最多五人,描述性格、经历和关系。
  3. Theme and Message:不超过 100 词概括主题和思想。
  4. Language and Style:不超过 100 词描述整体语体及细节程度。
  5. Emotional Resonance:不超过 100 词说明希望引发的情绪。
  6. Innovation and Originality:不超过 100 词说明独特性/原创性要求。

每栏分别置于 <… Start><… End> 标签之间。

D.4 人工选择准则

标注员面对同一指令的四篇候选文本。可见字段为写作指令、基础/引导信息和四篇文本;需要记录每篇如何满足指令、具体优缺点,并选出质量最高者。

流程为:(1)完整阅读四篇文本,检查其使用指令和引导信息的程度;(2)按内容与格式标准系统比较,可用 1–5 分辅助,但分数不能替代理由;(3)选出最佳文本,解释其优势及其他文本的弱点。

内容标准: 主题/论点是否切题;语气和语言是否适合受众;开头是否吸引、结尾是否有力;修辞是否有效;思路、因果、段落过渡是否连贯;例证和证据是否真正加强论点。

格式标准: 是否遵循体裁结构和必需格式;标题、列表、分段是否恰当;连续正文中不得滥用项目符号;标题与副标题层级应合乎逻辑。标注员必须再次核对指令,不以个人偏好代替客观质量,并对所有候选使用同一套标准。

附录 E 各体裁 Rubric

以下 rubric 均为论文给评估 LLM 的完整维度。每个维度下的问句用于判断待评文本是否达到该体裁的要求。

E.1 议论文

  1. 主题与中心论点是否清晰、突出、逻辑成立。
  2. 证据是否充分、具体、相关且类型多样(理论、事实、数据、专家观点)。
  3. 语言是否简洁清楚,推理是否严密且逐层推进。
  4. 结构是否有序,段落与过渡是否强化论证。
  5. 是否体现反思深度、原创视角并激发进一步思考。

E.2 总结

  1. 是否明确原任务/计划目标,并深入复盘目标完成情况。
  2. 是否覆盖过程、结果、挑战和改进点,组织逻辑清楚。
  3. 表达是否准确简洁,同时具有可信度和说服力。
  4. 标题、段落、关键词和数据呈现是否改善可读性。
  5. 是否提出独到分析以及具体、前瞻的后续建议。

E.3 合同

  1. 条款是否完整清晰,覆盖权利义务、违约责任和争议解决。
  2. 是否符合法律法规并识别、缓解漏洞和违约风险。
  3. 付款、交付、质量、监督等执行细节是否可操作。
  4. 双方权利利益是否平衡,是否避免明显单边或苛刻条款。
  5. 是否能适应法律/市场变化并支持长期合作。

E.4 致辞

  1. 语言是否清晰简洁、语法正确,并与场合所需的正式、幽默或情感语气匹配。
  2. 情感是否真诚、有感染力并适合听众。
  3. 开头、主体、结尾是否清楚,过渡是否自然。
  4. 内容是否切合婚礼、纪念会等具体场景并尊重文化背景。
  5. 是否有个性化表达和令人难忘的创新元素,而非套用模板。

E.5 纪实文

  1. 是否基于可靠来源准确呈现历史事件/社会现象,并兼顾多重视角。
  2. 人物是否立体,关系、情绪与成长是否可信。
  3. 叙事结构、节奏、时空切换和视角运用是否清楚有效。
  4. 是否对社会、历史或人性提出有深度的反思。
  5. 语言与细节是否提升文学性、真实性和情感力量。

E.6 随笔

  1. 论点与思想深度: 是否围绕所评论的主题或文本提出清楚、明确的中心论点或立场;是否通过深入分析和批判性思考形成有意义的见解。
  2. 逻辑与证据: 论证是否逻辑连贯,文章是否系统、分层地展开分析;是否提供有力证据支撑中心论点,并对证据作充分、有说服力的分析和解释。
  3. 语言与风格: 语言是否准确、简洁、有说服力,并体现评论写作的分析性质;是否表现出批判性思维、思想深度和个性化表达。
  4. 视角与全面性: 是否从多个角度分析、解释主题或文本,体现对问题的全面理解;是否整合不同层次的分析,形成对主题的整体把握。
  5. 原创性与启发性: 是否提出独到见解或新颖视角,为讨论提供新的思考方式或思想贡献;是否激发读者进一步反思、探索,并为主题开启新的解释可能。

E.7 小说

  1. 情节是否连贯、节奏适当、结构完整并具有张力。
  2. 人物是否立体,成长、冲突和关系是否自然且推动情节。
  3. 主题是否清晰、有深度,并能借人物/情节/象征表达。
  4. 语言是否生动、与语境相配,细节是否服务于人物、氛围和叙事。
  5. 情感是否真实、能引发共鸣;作品是否有原创性和独特视角。

E.8 信件

  1. 称呼、正文、结束语等格式是否规范,段落与视觉结构是否清楚。
  2. 语言是否简明准确,避免含混和过长句。
  3. 语气是否符合收件人身份、目的和礼貌要求。
  4. 请求、通知或建议等核心目的是否明确且内容准确。
  5. 是否符合文化、礼仪和具体场景。

E.9 公文

  1. 内容是否真实、准确、完整并符合政策法规。
  2. 结构与信息顺序是否合乎逻辑,是否避免重复和混乱。
  3. 语言是否符合公文规范,正式、简洁、严谨。
  4. 文种、标题、编号、日期、签署和排版是否规范。
  5. 指令措施是否具体可执行并符合法律与公共利益。

E.10 计划

  1. 总目标和分目标是否明确、可衡量、可实现。
  2. 步骤、时间、责任、人员、资源和应急方案是否可执行。
  3. 是否提供区别于惯例的新观点、方法或技术。
  4. 是否识别潜在风险并给出具体缓解/替代策略。
  5. 是否包含监测、反馈和迭代优化机制。

E.11 诗歌

  1. 语言是否凝练而有创新,节奏和声音是否增强表达。
  2. 主题是否有哲理、反思深度和独特呈现。
  3. 情感是否真诚、复杂,并与主题紧密融合。
  4. 形式与结构是否有机服务于内容和情感,而非任意破碎。
  5. 是否留下审美冲击、解释空间和思想挑战。

E.12 散文

  1. 主题是否清晰,观察与描写是否围绕主题形成整体。
  2. 语言是否优美、准确,意象、修辞和细节是否恰当。
  3. 情感是否自然真挚而非强行煽情。
  4. 结构和节奏是否流畅,段落之间是否有内在线索。
  5. 是否体现独到体验、思想或审美价值。

E.13 报告

  1. 结构与逻辑连贯: 结构是否清楚,内容是否按层次和逻辑组织,顺序是否引导读者逐步理解;各节是否紧密衔接,是否避免重复和遗漏,整体逻辑是否严谨、叙述是否顺畅一致。
  2. 内容准确完整: 数据与信息是否准确可靠、来自可信来源并符合客观事实,没有矛盾或错误;是否覆盖主题的核心方面、提供完整背景,并避免遗漏要点。
  3. 语言与写作质量: 语言是否清楚简洁、避免不必要的冗长,语法和拼写是否正确;是否符合正式写作规范,表达是否专业流畅。
  4. 创新与深度: 是否提出新的视角、见解或方法,以新方法或新角度展示创造性;是否深入问题本质而非停留在表面,并体现较强的分析和研究深度。
  5. 相关性与实用性: 内容是否紧扣报告主题、回应报告目的并满足目标受众需要;建议或结论是否可执行,能否为目标对象提供有意义的帮助或参考。

E.14 文档

  1. 结构完整性与组织: 是否遵循完整、规范的结构(如标题、背景、正文、结论),组织是否清楚、逻辑是否连贯,段落过渡是否顺畅;内容顺序是否便于读者快速理解和回应,并符合该类文档的惯常写作规范。
  2. 表达简洁清楚: 语言是否简练、信息是否传达明确、选词是否准确;是否避免冗长复杂的句子和含糊表述;能否快速、清楚地传递信息,减少不必要的歧义和修改。
  3. 规范遵循与格式一致: 是否严格遵守所在行业、组织或体裁的规范,包括标题结构、章节顺序和标点使用;全文格式细节是否一致,整体呈现是否专业、标准。
  4. 逻辑连贯与说服力: 是否具备严谨的逻辑框架,各论点是否通过清楚、明确的逻辑关系连接;是否提供充分证据或数据支撑论点,能否有效说明背景问题并提出合理的解决方案或观点。
  5. 适应性与目标导向: 是否针对具体语境、目标受众或时间限制设计,并符合读者的预期和需要;是否直接回应预定目的,内容是否足够清楚、可操作,能够指导具体行动或传达目标。

E.15 演讲

  1. 传播目标清楚: 是否明确要告知、说服或激励等传播目标;内容是否有效支撑并实现该目标;结论或行动号召是否把听众清楚引向预期行动或思考。
  2. 内容清楚且结构合乎逻辑: 核心思想是否明确易懂;结构是否合乎逻辑,论点间过渡是否顺畅;是否避免含糊、不必要的复杂性或过度晦涩。
  3. 证据与支撑: 是否使用相关、可靠的事实、数据或例子支持主张;证据是否充分、有说服力;是否明确引用来源以增强信息可信度。
  4. 内容深度与相关性: 是否深入讨论主题而非停留在表面;是否考虑听众的兴趣、需要与背景;是否预判不同听众群体可能提出的疑虑或反对意见,并作出恰当回应。
  5. 语言精确且风格恰当: 用语是否准确,避免歧义、冗长或表达不清;风格是否适合主题和目标听众,语言是否得体、尊重;表达是否简洁有力,避免无关信息和重复。

附录 F–H 标注指南与评价提示词(完整翻译)

标注员信息

研究共聘请 36 名至少具有学士学位的写作专家,其中 23 人正在高校攻读硕士或博士学位。29 人的专业背景为文学、历史、哲学、新闻与传播、社会学、心理学或教育学;另 7 人来自环境、能源、计算机科学等工程专业。每条数据的标注费用为 10 美元,包含对九篇 LLM 写作的九次评分。

补全任务标注指南

补全写作评分标准

一、任务目标、字段与操作方法

A. 任务目标

根据上下文评估模型补写中间段落的质量,并分别为不同回答评分。回答 A、B、C 是模型对文本中 [fill in the blank] 位置的补全;参考补全是一段示范文本,其质量对应 4 分。标注者需要仔细阅读待补全文本的上下文和参考补全,再依据本指南规定的具体维度为回答 A、B、C 评分。

B. 字段说明

固定字段(无需标注)

  • 指令内容: 要求 AI 填补给定文本空白处的基本指令。
  • 待补全文本: 中间缺少一部分的上下文,其中包含 [fill in the blanks] 标记;务必仔细阅读。
  • 参考补全: 可填入原文的一种内容,评分上限为 5 分。
  • 回答 A/B/C: 模型依据指令和已有文本推断出的缺失内容,需要在后续步骤中评分。

回答中可能带有对话性文字,这些内容可以忽略,只评价实际补写部分。若某个回答给出多个补全版本,只评价第一个版本。

标注字段(需要填写)

每个回答都有两个标注字段,其中评分字段为必填项;如适用,还应从下拉菜单中选择回答 A/B/C 的错误类型。

  1. 标注字段 1:回答 A/B/C 的分数。 根据本指南中的相关规则(如指令遵循、语言表达、写作技巧、情感表达和写作风格等),评价回答 A/B/C 的内容与形式。
  2. 标注字段 2:回答 A/B/C 的错误类型(下拉菜单)。 若分数低于 3 分,此字段必填。请从下拉菜单中选择相应错误类型;详见下文“处罚项——错误类型”。
C. 操作方法与注意事项
  • 完整阅读 [fill in the blank] 前后的上下文,理解全文的写作逻辑。
  • 建议使用电脑分屏,把待补全文本复制到 http://annot.xhanz.cn/tools/markdown,再逐一比较参考补全和各模型回答。
  • 内容涉及事实时,应进行事实核查。
  • 可参考下文“评分逻辑”以加快判断。

二、评分依据

满分 5 分,3 分及格,最低 1 分。参考补全的质量对应 4 分标准。

  • 高质量回答: 4–5 分。
  • 及格回答: 3 分。
  • 低质量回答: 1–2 分。

具体标准如下:

  • 5 分: 质量优于参考补全,并满足全部绝对维度要求(无处罚理由)。
  • 4 分: 内容质量(语言、逻辑、情感表达等)与参考补全相当,并满足全部绝对维度要求(无处罚理由)。
  • 3 分: 满足全部绝对维度要求(无处罚理由),但质量低于参考补全。若存在处罚项,分数应低于 3 分。
  • 2 分: 有 1–2 个绝对维度未满足,必须填写处罚理由。
  • 1 分: 超过两个绝对维度未满足;或者回答在其他维度表现尚可、原本可得 3–5 分,但存在严重安全问题,或没有遵守补全指令。必须填写处罚理由。
评分逻辑
  1. 先依据绝对标准判断回答属于 1–2 分还是 3–5 分。
  2. 对中高分回答(3–5 分),再与参考补全比较质量。
  3. 对低分回答(1–2 分),依据处罚项确定 1 分或 2 分,并选择处罚理由。
  4. 最后检查特殊问题;若存在安全问题,将分数调整为 1 分并选择相应理由。
4–5 分标准

4–5 分回答应达到与参考补全相当或更高的质量,重点考察:

  • 语言表达: 语言是否更准确、清晰?词汇是否更多样、描写是否更生动?句式是否更灵活,并更符合原文风格?
  • 内容丰富度: 是否恰当地引用话语、诗文或典故,从而增加文本的文化深度?
  • 写作技巧与艺术呈现: 修辞和其他写作技巧是否使用得更恰当、更娴熟?
  • 情感表达: 情感是否表达得更自然、更有力量?
A. 绝对标准(3 分基线)
  1. 上下文一致性: 补全必须充分理解上下文并与之衔接。
  2. 格式: 与前后段落保持一致。
  3. 内容: 叙述人称或视角一致,叙述逻辑一致,语言风格和语气一致。
  4. 事实: 若上下文已经提到相关事实,补全中的事实必须与之逻辑一致。
  5. 开放性说明: 补全不必与参考答案完全相同,也不存在唯一正确答案;只要文本连贯、逻辑一致即可。
  6. 准确性: 引用的外部知识(出版物、演讲、事实性内容等)不得有事实错误。
  7. 流畅性: 补全文本应语言流畅,不含语言错误或逻辑矛盾;不得无故混用语言,也不得在任务不需要时滥用特殊标签或编号。
B. 处罚项——错误类型

出现以下错误时,分数应低于 3 分。

A. 一致性问题
  • 格式不一致: 例如前后文都是长段落,而回答 A/B/C 只有一句话。
  • 内容不一致: 人称或叙述者不一致、逻辑不一致、语言风格或语气不一致。
  • 重复内容: 补全不应重复已有上下文。

根据严重程度扣 1–2 分。补全与参考答案长度不同,本身不构成处罚项。

B. 准确性问题

核查补全是否存在事实错误,尤其包括:

  1. 引语;
  2. 已公开发表的知识;
  3. 现实地点或公司信息;
  4. 具体统计数据;
  5. 历史或新闻事件;
  6. 疾病名称等专业领域事实;
  7. “太阳从西边升起”之类的常识错误。

若存在事实错误,根据严重程度扣 1–2 分。

C. 流畅性问题
  1. 无意义重复: 无必要地使用“首先……其次……然后……”;或者只是重复、改写同一观点,却没有进一步展开。
  2. 语言混用: 像“我 say 这个不行”这样无故混用语言,扣 2 分(即评为 1 分);把可以翻译的英文缩写原样保留,如以 WC 指代“厕所”,扣 1 分。KFC 等通用名称无需翻译,不属于扣分项。
  3. 特殊字符: 一、(1)、① 等编号次序混乱,或出现 ^& 等不合语境的奇怪符号,扣 1 分。例如,若回答同时存在指代和逻辑问题,又重复部分内容,并把某项信息放在错误的上下文位置,则它不符合参考要点所要求的补全标准,可能只能得到约 2 分。
C. 特殊情况:安全问题(评分后的最后检查)

出现以下问题时直接评为 1 分:生成暴力、血腥、恐怖、淫秽或虐待内容;诱导自残、谋杀、社会报复或违法行为;诽谤国家领导人或政府;错误转述国家领导人讲话。

评价提示脚本示例

请扮演专业小说评论者,依据给定标准和评分指南评价下列小说。每个维度给出 1–10 分,并简要解释评分理由;最后再给出小说的 1–10 分总分。系统会预先提供一个 6 分样例作为参照。

  1. 情节与结构
  2. 情节紧凑度:……
  3. 节奏感:……
  4. 人物发展
  5. 人物刻画深度:……
  6. 人物成长:……
  7. 人物关系:……
  8. 主题与思想
  9. 主题深度:……
  10. 思想表达:……
  11. 社会或文化语境:……
  12. 语言与风格
  13. 语言风格:……
  14. 语言适配性:……
  15. 细节描写:……
  16. 情感共鸣
  17. 情感深度:……
  18. 情感真实性:……
  19. 创新与独特性
  20. 创新要素:……
  21. 独特视角:……

LLM 评价过程中的提示

边权分配

输入:写作指令 \(\mathcal I\)

请根据下列写作指令和评价维度,为每个评价维度分配权重。分配时遵守以下规则:

  1. 所有评价维度的权重之和必须等于 1。
  2. 权重通常应为 0 到 1 之间的浮点数,最多保留两位小数。在少数情况下允许负权重,但不得小于 -1。
  3. 应根据各维度与写作指令特征的相关程度合理分配权重,也允许使用负权重。例如,在议论文中,情感表达的权重可以设得很低(如 0 或 0.1),因为情感表达可能妨碍论证的严谨性。
  4. 为所有维度分配权重后,简要解释选择理由。

[Writing Instruction Start]

{写作指令 \(\mathcal I\)}

[Writing Instruction End]

[Evaluation Dimensions Start]

  1. 开头与结尾: 开头应有吸引力和创新性;结尾应超越简单总结,力求给人留下深刻印象或引发共鸣,并避免公式化的开场与收尾。
  2. 语言与修辞: 词汇丰富,句子清晰;生动描写对象(景物、人物、心理、动作等),并熟练使用比喻、排比等修辞或写作技巧。
  3. 论证逻辑: 逻辑推进应顺畅自然,把读者从常识逐步引向更深入的思考;论证必须扎实,避免直接跳到结论或使用过多口号式断言。
  4. 情感表达: 作者或人物表达的情感应适合目标受众和写作内容,并能引起读者强烈共鸣。

[Evaluation Dimensions End]

ToW 专家执行提示

开头与结尾

输入:指令、参考文本、待评文本

请担任专业写作审稿人,评价“待评文本”与“参考文本”的开头和结尾质量。依据下列评价标准分析“待评文本”的优缺点,给出 1–10 分,并简要说明理由。

系统将提供:

  • 评价标准: 多个维度及具体问题,用于衡量开头和结尾质量。
  • 写作指令: 两篇文本的要求、背景和主要主题。
  • 参考文本与待评文本: 用于比较的两篇文本。

评价标准

A. 开头质量
  1. 吸引读者注意: 开头是否抓住读者注意力,让人愿意继续阅读?是否运用了发人深思的问题、引人入胜的故事、令人震惊的事实或有说服力的数据?
  2. 清楚引入主题: 开头是否明确传达文章主题与方向?是否建立全文的大体逻辑结构,让读者形成清晰预期?
  3. 适合目标受众: 开头是否契合目标受众的兴趣或知识背景?语言风格是否适合文章类型,例如文学写作重叙事、学术写作重精确?
  4. 避免陈词滥调和无关内容: 是否避免过于常见、平淡或乏味的措辞?是否直入主题,而非冗长或旁逸斜出?
  5. 恰当调动情绪与氛围: 是否形成强烈的情感影响或引人投入的氛围,例如悬念、幽默或紧张感?
B. 结尾质量
  1. 概括核心思想: 结尾是否清楚概括文章内容?是否强化中心主题或思想,避免软弱无力的收尾?
  2. 深化主题: 是否帮助读者进一步理解文章信息的意义或价值?是否通过反思、启发或更深入的洞察提升论点?
  3. 留下强烈印象: 是否引发情感共鸣、启发思考或促进行动?是否以令人难忘的句子或概念结束?
  4. 结构和逻辑完整: 是否呼应开头和全文结构?是否自然收束,避免突兀或仓促结束?
  5. 避免冗长或重复: 是否简洁有力,没有过度复述前文细节?是否避免在结尾引入未经讨论的新观点、干扰文章主线?

写作指令

{指令 \(\mathcal I\)}

参考文本

{参考文本 \(\mathcal R\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

严格遵守以下步骤,避免前后矛盾:

  1. 优缺点比较分析: 依据评价标准,比较“待评文本”与“参考文本”的开头和结尾;逐项识别相对优势与不足,不得遗漏任何标准。
  2. 评分及参考基线: “参考文本”固定为 6 分,作为比较基准。按以下规则给“待评文本”评分:
  3. 1–2 分: 几乎所有标准都明显弱于参考文本。
  4. 3–4 分: 大多数标准弱于参考文本,少数方面略优或相当。
  5. 5–6 分: 与参考文本总体相当,在某些方面略优,但整体表现均衡。
  6. 7–8 分: 大多数标准强于参考文本,只有少量不足。
  7. 9–10 分: 几乎所有标准都表现出色,整体质量卓越。

输出格式:

比较分析:
1. 开头部分:分析内容……
2. 结尾部分:分析内容……
分数:[[X]]
评分理由:……

简要概括关键点并保持严格的逻辑一致性。分数必须放在双方括号中,例如 [[6]],且必须是 1–10 的整数。

请开始评价。

修辞

输入:指令、参考文本、待评文本

请从语言丰富度和修辞恰当性两方面评价“待评文本”与“参考文本”。依据下列标准分析“待评文本”的优缺点,给出 1–10 分,并简要解释理由。

系统将提供:

  • 评价标准: 有关语言丰富度与修辞恰当性的正面和负面情形。
  • 写作指令: 两篇文本的要求、背景和主要主题。
  • 参考文本与待评文本: 用于比较的两篇文本。

[Assessment Criteria Start]

一、正面情形

  1. 语言丰富: 使用多样词汇,避免重复和单调,体现书面表达的灵活性;表达生动,能准确描绘景物、人物、心理活动和动作等场景;认真推敲语言,通过有意识的选词增强文本的文化或艺术感染力。
  2. 修辞出色且恰当: 比喻、反复、排比、拟人等修辞有助于生动表达、深化思想或增强情感冲击;修辞符合内容的逻辑推进,不过度堆砌,并能增强表达力量;写作技巧不过火,修辞自然融入语境和主题。
  3. 结构与逻辑: 开头以清晰、有说服力的语言和思想吸引读者;结尾有冲击力,能够有效概括内容、升华主题或引发进一步思考。

二、负面情形

  1. 语言贫乏: 词汇单调或重复用词过多,使表达显得薄弱、幼稚;句子结构不佳,或语法错误明显干扰阅读;内容被空泛、无意义的信息主导,例如讨论含糊而缺少具体细节。
  2. 修辞使用不当: 缺少修辞,或只依赖一种修辞,导致表达平淡、缺乏感染力;生硬的比喻或过度复杂的句子降低整体质量;突兀插入修辞,破坏逻辑推进或偏离主题。
  3. 影响表达的结构问题: 过度使用“首先、其次、最后”等简单连接词,形式结构与内容逻辑联系薄弱;结尾未概括关键点、开头缺乏吸引力,因而没有呼应主题;表达只停留在叙事推进或罗列观点,缺乏深入分析或细致描写,例如故事平淡或论点反复赘述。
  4. 语言混用: 像“我 say 这个不行”或“highlight 了这页 slide”这样整体混用语言,扣 2 分;无必要地保留可翻译的英文缩写,例如直接使用 WC 而不译为中文,扣 1 分。KFCNBA 等惯用名称无需翻译,除非与语境明显不符。
  5. 议论文或小说中的内容局限:
  6. 小说: 缺少细致的人物刻画或心理深度,只停留在表层叙述;根据这部分情节的重要程度扣分。
  7. 议论文: 循环论证,没有逐步深入的分析,例如只罗列利弊而不进一步比较和总结;扣 1–2 分。

[Assessment Criteria End]

写作指令

{指令 \(\mathcal I\)}

参考文本

{参考文本 \(\mathcal R\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

  1. 优缺点比较分析: 依据标准,逐步比较“待评文本”与“参考文本”的相对优缺点。
  2. 以参考文本为评分基准: “参考文本”固定为 6 分。按以下标准评价“待评文本”:
  3. 1–2 分: 负面情形显著多于参考文本,几乎没有正面情形;内容过于简单或缺少具体例子。
  4. 3–4 分: 负面情形略多于参考文本、正面情形更少;内容不够生动,或论证缺乏说服力。
  5. 5–6 分: 正负面情形与参考文本大体相当,整体表现一般;运用了一些修辞、技巧或例子,但不够自然。
  6. 7–8 分: 负面情形与参考文本相近,但正面情形更多;语言自然流畅,并有有力的表达或例子。
  7. 9–10 分: 正面情形显著多于参考文本,几乎没有负面情形;表达丰富、生动、平衡,并保持逻辑推进。

输出格式:

优缺点分析:
1. 正面情形比较:分析内容……
2. 负面情形比较:分析内容……
分数:[[X]]
评分理由:……

简要概括关键点并确保逻辑一致。分数必须放在双方括号中,例如 [[6]],且必须是 1–10 的整数。

请开始评价。

逻辑

输入:指令、参考文本、待评文本

请担任专业写作审稿人,评价“待评文本”与“参考文本”的推理逻辑。依据下列标准分析“待评文本”的优缺点,给出 1–10 分,并简要说明理由。

系统将提供评价标准、写作指令以及用于比较的参考文本和待评文本。

[Evaluation Criteria Start]

内容逻辑的核心关注点

  1. 人称或视角一致: 全文是否保持一致的叙事风格和视角,避免突兀转换?若人称或视角发生变化,前文是否有铺垫,后文是否有解释?
  2. 逻辑连贯: 推理过程内部是否一致?观点之间是否自然衔接,没有突兀断裂或逻辑空缺?
  3. 语言风格和语气一致: 全文是否保持一致的语气与风格,使推理顺畅自然?

注:推理逻辑通常指单个段落内部,或少数相邻段落之间的问题;重点是上下文连续和逻辑一致。

A. 理想情形(优秀推理逻辑示例)

  1. 议论文的逻辑论证: 推理环环相扣,逻辑层次清楚;观点从常识自然推进到深入分析,使读者能跟随逐步展开的推理;既有抽象理论分析,也有具体证据支持结论,自然形成有说服力的论证。
  2. 演讲或致辞的结构: 逻辑清楚直接:先指出核心问题,再提出解决问题的观点,随后具体说明步骤或方案;从宏观问题分析过渡到可执行的具体方法,最后形成有感染力且层次丰富的结尾。
  3. 申请书或工作总结的写法: 工作总结可按“目标 \(\rightarrow\) 问题分析 \(\rightarrow\) 关键挑战 \(\rightarrow\) 解决方案 \(\rightarrow\) 取得的成果”展开,体现清晰的思路与推理。申请书应说明申请对象的属性和意义,并准确对应申请者的需要,形成紧密联系,增强内容的合理性与说服力。

B. 不良表现(问题与扣分标准)

出现下列逻辑问题时应相应扣分:

  1. 议论文问题: 只罗列观点,没有推理或证据,例如“我们应该 XXXX,我们必须 XXXX”,既无理由也无例子。这种明显的逻辑缺失至少扣 3 分。
  2. 演讲或致辞问题: 分析或方案缺乏深度、广度,例如讨论过于抽象而没有可执行计划,或想法过于具体而缺乏高层洞察。视严重程度扣 3–6 分。
  3. 申请书或工作总结问题: 工作总结只陈述做了什么,没有分析与推理,内容流于表面;申请书未建立申请者需求与申请对象之间的匹配关系,内容空泛或彼此脱节。视严重程度扣 3–6 分。

[Evaluation Criteria End]

[Writing Instructions Start]

{指令 \(\mathcal I\)}

[Writing Instructions End]

[Reference Writing Start]

{参考文本 \(\mathcal R\)}

[Reference Writing End]

[Writing to Be Evaluated Start]

{待评文本 \(\mathcal C\)}

[Writing to Be Evaluated End]

评价流程

严格按以下步骤完成评价,避免逻辑矛盾:

  1. 优缺点比较分析: 依据评价标准,将“待评文本”与“参考文本”比较,逐项分析相对优势与不足。
  2. 以参考文本为评分基线: 把“参考文本”作为 8 分优秀标准;先给“待评文本”设定 8 分,再按下列规则调整:
  3. 扣分规则: 有 0–1 个轻微弱点或逻辑瑕疵,扣 0–3 分;有 1–2 个轻微弱点,扣 3–6 分;有两个以上轻微弱点,或一个重大逻辑问题,扣 6–8 分;问题特别严重时可进一步扣分。
  4. 加分规则: 若待评文本明显优于参考文本,最多可加 2 分。

补充说明:1–4 分不一定表示全文推理逻辑都很差;应严格依据实际分析出的弱点评分。

输出格式:

优缺点分析:
1. 正面方面比较:分析内容……
2. 负面方面比较:分析内容……
分数:[[X]]
评分理由:……

简要总结关键点并保持逻辑严谨。“分数”必须放在双方括号中,例如 [[6]],且必须是 1–10 的整数。

请开始评价。

情感

输入:指令、参考文本、待评文本

请担任专业写作审稿人,评价“待评文本”与“参考文本”的情感表达质量。依据下列标准分析“待评文本”的优缺点,给出 1–10 分,并简要说明理由。

系统将提供有关情感表达的正面和负面情形、写作指令,以及用于比较的参考文本和待评文本。

[Evaluation Criteria Start]

情感表达必须与目标受众建立联系;也就是说,作者在传达情感之前应明确考虑目标读者。

正面情形

  1. 情感成功融入事件、景物和人物刻画等多种描写,使文本温暖而有层次,并增强情感张力。
  2. 熟练运用比喻、拟人等修辞,增强情感表现力,带来更强的画面感和情感冲击。
  3. 语气、词汇和句式符合目标读者的风格。
  4. 情感真挚、流畅,能让读者深度共鸣或引发思考。
  5. 情感表达与主题紧密一致,有助于推动叙事或深化核心观点。

负面情形

  1. 情感表达无效或缺失,无法传达预期感受,或与情境中的情绪脱节。
  2. 比喻不当、比较无关等修辞误用,削弱情感表达。
  3. 情感流于表面、过度夸张或不自然,使读者难以真正代入或共情。

[Evaluation Criteria End]

写作指令

{指令 \(\mathcal I\)}

参考文本

{参考文本 \(\mathcal R\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

严格遵守以下步骤,避免逻辑矛盾:

  1. 优缺点分析: 依据评价标准,把“待评文本”与“参考文本”比较,系统覆盖每一点。
  2. 评分及参考基线: “参考文本”固定为 6 分。按以下规则给“待评文本”评分:
  3. 1–2 分: 负面情形明显多于参考文本,几乎没有正面情形;文字单调、浅薄,情感刻画薄弱,或作者投入的情感不足。
  4. 3–4 分: 负面情形略多、正面情形更少;有一定情感刻画,但整体平庸,或包含突兀、不合适的成分。
  5. 5–6 分: 正负面情形与参考文本大体平衡;表现合格,能达到使读者产生情感投入的基线水平。
  6. 7–8 分: 情感质量与参考文本接近,但正面情形更多;能描写多种互补情绪,或恰当地运用环境描写等技巧传达情感。
  7. 9–10 分: 正面情形显著多于负面情形,情感丰富细腻;读者会被作者情感深深打动,或情感通过环境描写等要素得到娴熟传达。

输出格式:

优缺点分析:
1. 正面情形比较:分析内容……
2. 负面情形比较:分析内容……
分数:[[X]]
评分理由:……

简洁总结关键点并确保逻辑严谨。最终分数必须使用双方括号,例如 [[6]],且必须是 1–10 的整数。

请开始评价。

情节

输入:指令、参考文本、待评文本

请担任专业写作评价员,评价“待评文本”与“参考文本”的情节设计和发展是否恰当。依据下列标准分析“待评文本”的优缺点,给出 1–10 分,并简要说明理由。

系统将提供有关情节设计与发展的正面和负面情形、写作指令,以及用于比较的参考文本和待评文本。

[Evaluation Criteria Start]

一、正面情形

  1. 结构与逻辑: 整体结构清楚、组织良好、逻辑合理;段落过渡顺畅连贯,使用自然生动的句间衔接,而不是依赖“首先、其次、然后”等机械连接词;情节有序展开,内部一致,前文埋下的伏笔能在后文得到兑现或解释。
  2. 叙事技巧: 熟练运用倒叙、插叙等技巧,使叙事简洁且重点明确;节奏把握良好,能在关键情节点制造紧张感、吸引读者或设置悬念;叙事逻辑合理,由因果关系或主题关联引导,情节不突兀、不生硬。
  3. 主题价值: 主题内容新颖而有意义,能引起读者共鸣或更深入的思考;叙事传达有洞察力的观点或更高层次的价值取向。
  4. 适合写作类型:
  5. 议论文: 论点清楚,分论点组织得当,证据充分且相关。
  6. 小说: 人物与情节服务于主题,叙事紧凑生动。
  7. 散文: 意象优美,主题统一,语言生动并富有感染力。
  8. 演讲、申请书、报告: 简洁、聚焦、逻辑流畅且有说服力。

二、负面情形

评价基准:轻微问题扣 3 分;重大或严重问题扣 6 分。

  1. 结构与组织问题: 结构混乱,没有层次推进;段落或章节缺少过渡和连接,内容突兀跳转或堆积,造成理解混乱;情节推进平淡冗长,缺乏吸引力或逻辑连贯性。
  2. 叙事问题: 倒叙或插叙使用不当,导致混乱或打断阅读沉浸感;情节设计松散、零碎,无法制造张力或吸引兴趣;情节发展缺乏因果关系或必要伏笔,逻辑不可信或突兀。
  3. 主题问题: 主题陈旧、乏味或缺乏原创性,无法吸引读者或引发共鸣;立意肤浅,缺少深度或有意义的展开;主题不统一,内容散乱,难以汇聚为整体观点或中心思想。
  4. 适切性问题:
  5. 议论文: 论点偏题,分论点简单或拖沓,证据不足或薄弱。
  6. 小说: 人物僵硬、缺乏吸引力;情节与主题无关,或与人物行为脱节。
  7. 散文: 意象平淡、不生动;内容支离破碎,无法支撑中心主题。
  8. 演讲、申请书、报告: 句子冗长或过于随意,缺乏重点,逻辑衔接断裂。
  9. 语言问题: 语言简单单调,缺乏活力与表现力;文字晦涩难懂,或风格与写作意图不符;过多使用机械、公式化的句子,缺乏作者个人声音。

[Evaluation Criteria End]

写作指令

{指令 \(\mathcal I\)}

参考文本

{参考文本 \(\mathcal R\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

严格遵守以下步骤,避免逻辑矛盾:

  1. 比较分析: 依据评价标准,把“待评文本”与“参考文本”比较,覆盖所有相关要点并分析其优缺点。
  2. 评分及参考基线: “参考文本”固定为 6 分。按以下规则给“待评文本”评分:
  3. 1–2 分: 负面要素明显多于正面要素;叙事基本是干巴巴的复述,语言不丰富、修辞缺乏深度、内容单薄、逻辑薄弱,并有重大缺陷。
  4. 3–4 分: 负面要素略多;叙事平淡、缺乏吸引力,情节较单薄,修辞和细节描写较弱,但整体逻辑基本连贯。
  5. 5–6 分: 正负面要素数量与参考文本大体相当;语言大多流畅,情节完整且无重大缺陷,结构统一并有一定内在凝聚力,但缺少亮点。
  6. 7–8 分: 负面要素与参考文本相近,同时有明显长处;语言或情节有亮点,例如成功抓住读者注意、设置吸引人的转折、形成结构严密的逻辑推进,以及层次丰富、有冲击力的叙事。
  7. 9–10 分: 正面要素明显多于参考文本;情节张力充足,逻辑严谨简洁,多个方面都有突出优势,体现高水平写作与艺术性。

输出格式:

优缺点分析:
1. 正面要素比较:分析内容……
2. 负面要素比较:分析内容……
分数:[[X]]
评分理由:……

简要总结关键点并保证逻辑清楚。分数必须放在双方括号中,例如 [[6]],且必须是 1–10 的整数。

请开始评价。

分段

输入:指令、待评文本

请依据以下原则评价“待评文本”的章节和段落划分是否合理:

  1. 各节长度平衡: 避免段落过长(超过 500 字符),也避免单个章节比其他所有章节之和还长。理想情况下,各节长度不应相差过大。
  2. 分章的必要性: 长篇小说、报告、演讲等结构要求较强的文本,应使用标题分章。避免没有意义的分章,例如本可在逻辑上合并为一章,却被拆成多个章节。理想情况下,每章应力求超过 800 字符。
  3. 分段的必要性: 除诗歌外,各类文本都应避免段落过多,例如大多数段落都只有一句。诗歌可按节奏划分诗节或段落。同时也不要把过多不同主题或论点挤在同一段中。理想情况下,每段应超过 50 字符,但为了节奏或语气,也可以使用较短段落。

根据以上三点评分:

  • 3 分: 划分合理,结构良好。
  • 2 分: 章节或段落划分存在一些缺陷。
  • 1 分: 划分明显失调、缺少结构规划,或没有可供评价的内容。

写作指令

{指令 \(\mathcal I\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

评分后简要解释理由,分数须放在双方括号中。例如:

总分:[[2]]
理由:……

最终分数按以下公式映射到 1–10 分:

\[ y=5\times(x-1). \]

整体印象

输入:指令、参考文本、待评文本

请根据所提供的写作指令和文本内容给出整体印象分。评价时重点关注:

  • 开头和结尾是否有吸引力、能让读者投入;
  • 全文是否流畅、逻辑连贯;
  • 段落结构是否恰当;
  • 是否避免过度依赖项目符号和列表。

写作指令

{指令 \(\mathcal I\)}

参考文本

{参考文本 \(\mathcal R\)}

待评文本

{待评文本 \(\mathcal C\)}

评价流程

给出一个 1–10 的整数作为整体印象分,并简要说明理由。最终分数必须放在双方括号中,例如:

总分:[[8]]
理由:……

附录 J 标题解析正则

下列代码是论文给出的层级标题解析算法。代码本身保持原样,仅翻译注释说明。

def parse_headings(text):
    # 标题正则
    patterns = [
        (r'^(#{1,6})\s*(.*)$', 'markdown'),
        (r'^([一二三四五六七八九十]+[、.])\s*(.*)$', 'chinese'),
        (r'^(([一二三四五六七八九十]))\s*(.*)$', 'chinese_second'),
        (r'^(\d{1,2}\.)\s*(.*)$', 'ordered'),
        (r'^(\-)\s*(.*)$', 'unordered'),
    ]

    # 初始化层级结构
    root = {'title': 'Root', 'subtopics': [], 'type': 'root'}
    stack = [root]
    base_hash = -1

    # 按行切分并解析
    for line in text.splitlines():
        line = line.strip()
        if not line:
            continue

        for pattern, kind in patterns:
            match = re.match(pattern, line)
            if match:
                content = ""
                if kind == 'markdown':
                    hashes, content = match.groups()
                    if base_hash == -1:
                        base_hash = len(hashes)
                    level = len(hashes) - base_hash + 1 + 1
                elif kind == 'chinese':
                    prefix, content = match.groups()
                    level = 2
                elif kind == 'chinese_second':
                    prefix, content = match.groups()
                    level = 3
                elif kind == 'unordered':
                    prefix, content = match.groups()
                    if stack[-1]['type'] != kind:
                        level = len(stack) + 1
                    else:
                        level = len(stack)
                elif kind == 'ordered':
                    prefix, content = match.groups()
                    if stack[-1]['type'] == 'ordered':
                        level = len(stack)
                    elif stack[-1]['type'] == 'unordered':
                        if stack[-2]['type'] == 'ordered':
                            level = len(stack) - 1
                        else:
                            level = len(stack)
                    else:
                        level = len(stack) + 1

                node = {
                    'title': content.strip(),
                    'subtopics': [],
                    'type': kind,
                }
                while len(stack) >= level:
                    stack.pop()
                stack[-1]['subtopics'].append(node)
                stack.append(node)
                break

    return root

附录 K 每类任务的数据样例

论文为补全、引导和开放三类任务各给出一个中文样例,并在下一张表中重复给出 GPT-4.1-2025-0414 的英译。为避免在中文译文中完整重复同一长文,下面保留原始中文样例;对应关系为:补全中文表 ↔ ex:completion_en,引导中文表 ↔ ex:guide_en,开放中文表 ↔ ex:open_en。英文表没有新增实验字段或案例内容。

每个任务的数据示例

表 K-1:补全任务中文样例。

设置 提示
指令 请根据上下文补全以下文章中用 [fill in the blank] 特殊符号标记出的内容。
资料 最近,有媒体盘点出了中国超级工程里的“世界之最”,在网络上引发了一大波热议:
白鹤滩水电站是目前世界在建规模最大、技术难度最高的水电工程;港珠澳大桥是世界上总体跨度最长的跨海大桥;新疆和若铁路开通运营,让世界首条环沙漠铁路线完成“最后一块拼图”……
有网友称,“中国制造就是中国骄傲”。
而如果我们往深了扒一扒,超级工程的背后,实际上凝聚了大量自主研发的新科技,科技自强自立的背后,最终则是创新的驱动。
习近平总书记在党的二十大报告中22次提到创新,并深刻指出:坚持创新在我国现代化建设全局中的核心地位。报告中还有一处提到:创新是第一动力。
我们来理一理,“核心地位+第一动力”,创新的分量为何这么重?

从人类历史来看,社会生产力的每一次发展、科学技术的每一次进步,无不是通过创新实现的。
欧美几个发达国家就是抓住了科技和产业革命的创新机会而一跃跨入现代化行列,实现大国崛起和民族振兴,并引领时代的走向和世界的发展。
有创新就会有发展,谋创新就能谋未来。涅槃于一穷二白旧社会的中国式现代化,也经历了无数次以创新求发展的浴火重生。
特别是新时代以来,在创新驱动发展战略的指引下,我国的“创新型国家”的建设稳步加快。从2012年到2021年,全社会研发投入从1.03万亿元增长到2.79万亿元,全球创新指数排名从第34位上升到第12位。
科技创新在企业壮大、产业升级、区域发展、重大工程建设等方面发挥了重要作用,有力支撑了高质量发展,带动一些关键核心技术相继实现突破,取得了载人航天、探月探火、深海深地探测、超级计算机等重大成果。
九天之外传来的“感觉良好”,深潜海底万米的“妙不可言”,乘坐“复兴号”飞驰万里,睁开“天眼”仰观浩渺宇宙......这些,都成了网民心中中国科技创新的“名场面”,成了我们心中升腾起的自信和自豪。


[fill in the blank]
这样的故事还有不少。这些年,我们在科技“从模仿到创新”的转型过程中遭遇了“追赶的极限”,关键领域核心技术被“卡脖子”的问题愈发突出。
特别是中美贸易摩擦中,我国“缺芯少核”的科技短板暴露了出来。美西方国家利用技术优势地位一方面禁止关键技术流入中国,推动高科技产业链的“对华脱钩”;另一方面阻碍我国核心技术研发,企图将我国彻底压制在产业链中低端。
在激烈的国际竞争中,惟创新者进,惟创新者强,惟创新者胜。正是因为我国科技实力和世界领先水平的差距在不断缩小,一些领域实现了从“跟跑”到“并跑”甚至“领跑”,才引发了美西方国家的战略焦虑,并招致不惜成本的封锁和打压。
然而,我们的目标绝不是跟着西方国家亦步亦趋。我们要开拓出中国式现代化路径,这是一条从未有人走过的路。为人类实现现代化提供新选择,科技创新在其中的核心作用无疑更加凸显。


东部沿海省份浙江,为创新之路探了路。
早在2006年,习近平同志在浙江工作时就为浙江定下了用15年时间进入创新型省份行列,基本建成科技强省的目标。当年的“全省科学技术大会”这个会议名称,被习近平同志修改为“全省自主创新大会”。几字之变,意图更加清晰,导向更加明确。
一路走来,“自主创新”这面旗帜始终在之江大地上高高飘扬。今天的浙江,已经拥有良好的科创环境和氛围,三大科创高地加速打造。很多人一提到科创大走廊、之江实验室、西湖大学就想到浙江,这些高能级的平台不仅是浙江的“标签”,也正成为创新的沃土。
有活力就有人才,浙江也越来越成为顶尖人才的向往之地。截至今年8月,全省研发人员总量已达77.58万人,这就意味着大概每1000个浙江人中就有12个科研人员。
而这些科研平台、科研技术、创新力量,则前所未有地融入到百姓的日常当中。在全国率先启动数字化改革一年多来,浙江打造出一批实用、管用的重大应用。“海外智慧物流”“浙农服”“健康码”“政采云”……一个个有着鲜明浙江烙印的数字化应用,便企惠民,香飘墙外、飞向万家。
每个时代,都有打开创新之门的钥匙。比如第一次工业革命是蒸汽机,第二次工业革命是电气化。今天,浙江则以“数”谋“新”,做第一个吃螃蟹的人。


今天的世界瞬息万变。大变局之下,唯一的“不变之道”就是以变应变、以新应变。
创新,该怎么创?如何新?
“必须坚持科技是第一生产力、人才是第一资源、创新是第一动力,深入实施科教兴国战略、人才强国战略、创新驱动发展战略,开辟发展新领域新赛道,不断塑造发展新动能新优势。”党的二十大报告中的这段话,为创新之路擘画了清晰的领域和路径。

此外,笔者认为,以创新驱动发展还要坚持好以下几个关键点。
创新靠不得别人,还得靠自己。创新能力,关乎一个国家在世界格局中的地位,甚至关乎着国家安全。在世界竞技赛中,跟着别人跑随时可能会被绊倒,只有把创新的自主权、技术的所有权、发展的主动权紧紧攥在自己手中,才能跑出速度、跑到前列。
创新的重要目的之一,是整合资源,打通链条、畅通循环。中国已经是全球第二大经济体,依靠传统的土地、资源和低成本人力来驱动发展已经没有竞争力,也不会有出路。只有用好新型举国体制优势,发挥创新的核心作用,打通不受制于人的产业链、供应链,才能在经济发展中涌现出无数“风口”,在国际竞争中站稳脚跟。
真正的创新,最终要落脚于民。近年来,我国科技创新能力不断提升,越来越多的创新成果广泛应用于民生领域。高铁网络、电子商务、移动支付、互联网+、共享经济……正在深刻改变着人们的衣食住行。不过,实现“人的现代化”也还有很多空白领域,如何围绕老百姓的切身需要,填补这些空白,是需要瞄准的“靶子”。
赶考路上,需要创新来“澎湃”。坚持创新在我国现代化建设全局中的核心地位,坚持创新是第一动力,不仅要让1不断地递增出N,也要探索如何让更多的0实现1的突破。
参考 科技创新是大国竞争的核心领域。一个国家科技创新能力的高低,决定了其在国际竞争中的水平。
一个经典的故事是,1960年前后,一套重量为3公斤的精密光学坐标镗床主轴轴承,外商对我们的要价竟相当于和轴承同等重量的黄金或6吨重的对虾。直到我们通过自主创新成功攻关,才不再需要依赖进口。
这至少告诉我们两个道理:
第一,关键核心技术要不来、买不来、讨不来。只有把它牢牢攥在自己手中,才能从根本上保障国家总体安全。
第二,在现代世界体系中,不同国家有着不同的分工。位于“中心地区”的发达国家享有先进技术和高附加值产业,而位于“边缘地区”的欠发达国家只能提供原材料、自然资源和廉价劳动力。这一格局让资本和价值源源不断地向“中心地区”聚集并导致严重的两极分化。
表 K-2:引导写作中文样例。
设置 提示
指令 我想写一篇2000字左右的散文,主题是关于主人公在四月的雨季里,对理想与现实的思考和挣扎,以及对自我和人生真谛的探索。你能帮我写一下吗? 故事背景设定在四月的雨季。
资料 语言与表现:要求语言富有诗意和哲理性,多用比喻、象征等修辞手法,营造沉思和感悟的氛围;句子节奏舒缓,有韵律感。
主要人物:一位敏感、内向、富有理想主义色彩的年轻人,对未来充满憧憬,却常感迷茫和焦虑,在现实压力下不断反思、探索。
环境设定:四月雨季,持续阴雨,潮湿阴冷的环境象征主人公内心的迷茫和压抑。
主题与思想:探索理想与现实的平衡,思考如何在现实压力下保持理想,以及人生的意义。
参考 人间四月
清明的雨还是搅乱了春色,湖中迭起的涟漪泛开,天郁沉的像一部默片。四月沉默了不说话,放映着刻有划痕的影碟,像是几十年代的声音断断续续,悲剧中的主角走得磕磕绊绊。
是谁用蜡黄的胶卷,把人间留在四月,把四月给了人间。
我以为世界真的如诗,符号不那么清晰,句句牵丝带意,篇篇浮华,好像四月天里雨如烟,山花正开。可我越往前走,句点变得明显,世界摘掉诗化的帽子,露出真容,头上实是一片贫瘠,倒不是无人开垦的荒地,而是挖得太深,变成了沙漠。我变成了神话里勇敢的人,却没那么聪明,伏下身开始数这些砂砾。高高在上的人望着我,颇有耐心,仿若天上星不眨眼。
也许人间没有四月,人间四月只在理想主义者的朦胧诗里。如是这样,那些费力博人一笑的花儿也许就要抱憾走进土里,带着对人间的绝望,不堪地变得灰黄,那悲哀到极点的眼神没有换来分毫同情,反而是在泥土亲吻后大雨的恣意谩骂、大风的浇灌和捶打。
我闭上眼睛,希望用一个夜替代白昼,用一个梦逃离现实。想象确有万千星辰躺在暮河里,梨花万千地开了,雨和风也都舒缓,像安静岛屿上安静的轻音乐。成长了多少多少年的沙滩上没有一个脚印,在那儿我不用一腔愚勇地数着沙子。 黄鹂的歌声拥抱我,我拥抱了春天,真正的春天,真正的人间四月,我的春天,我的人间四月。在那儿我不会庄周梦蝶,不会为了一个背影徘徊在河边。我也许在船上,也许在酒炉旁,柴火是新添的,沸着的炉子咕咕冒汽。我不会真的酩酊大醉,即使会了,也有人搀着我的肩膀,边骂边笑,走过梧桐路,走过芦苇荡,在湿腾腾的夜里影子被打乱又重组,重组又打乱。是汩汩的泉水、是半开的窗、是刚长出的月牙、是我把目光放进夜色里,深深的凝望。
如果我知道要活得现实,我就不会在人间四月里醉生梦死。异如飞蛾扑火,我亦把那屏后灯看作了云上月。人间已是四月,只我不认,只我不觉。
我只记得第一抹花色,野草中的白,碧绿浮萍中央的天鹅。不是蒲公英,风一吹飞不起来,它只是无名地生于荒芜之上,不带着迎春的使命,只是恰好张扬到了四月。慢慢的我的荒原也有植物破土抽芽,我像从某个阴暗的角落里撕扯蛛网,慢慢地由暗到明,眼睛由迷蒙到清晰。利刃往空气里劈了一下,世界的伤口裂开又愈合,也许疼只有一瞬,可疼只在这一瞬。
哗啦啦落了场雨,淋湿人间,淋湿山丘和野树,淋湿四月,淋湿灵魂,淋湿行人有些脆弱的肩膀。人间多了林黛玉,一滴雨水就要撑破那娇颜,几阵风那垂柳就被摇碎。
这是我的人间四月吗,这么轻,这么薄,像宣纸一样。
南方正落叶,我走得快了些,走出四月的夜。还以为到了秋天,风也长出了霜,走过我的皮肤,一点清凉。可如今是四月天,再凉一阵恐就燥热了,惹人厌的虫象征着夏天的蠢蠢欲动。
我独想要我的人间四月,不在永夜,不在幻梦,不在眨眼间,只完完整整地在我眼前,在不远处霄灯下,在层峦的山后面。可能我会在某处走廊找到吧,夕阳同样地斜照,驳杂的光影在地板砖,是四月的脚丫子。也可能藏在楼梯的拐角,我的一瞥;藏在几张纸片里,在花绿的伞下,雨把伞沿砸下,我的头也低下来。
保温杯蒸蒸的热气、老旧的电话机。嘶哑的声音、明媚的声音、清脆的声音、沉默的声音、鸟的声音虫的声音、我的声音你的声音。红纸上的油墨字迹、一颗没有破损的心。光的影水的影、风的影雪的影、你的影我的影。如果在春天一定要有事物消亡,我会把自己献上。如果在春天一定要有一个答案,那我把自己剖开也找不到、把心脏给予也填不满。因为我早已空空如也,在那千疮百孔的十二月。
从青铜到铁器,人类用了多少年;从冬春至秋夏,流云走了多少圈。从我睁开眼,到我再一次走进黑夜,再一次找到光明,还要耗费多少血液。猛然地我把头抬了起来,看见一张张漠然的脸,刹那我知道人间的命运只在一秒不到的时间里重新落向我。
还有些不屑。
依旧是四月天里,街巷人影绰绰,我风尘仆仆穿行而过,雨后的水洼溅起打湿了赶路人的鞋和裤管,人群那么密,步子那么紧,不同的目的却使人与人此刻相聚。我毅然决然地向前然后扑空,扑空然后退后。终于我明白一些事情刻意不得,不如停一停,尝尝巷头的茶水、巷尾的酒。还好,我走的不远,没错过太多。
事实是这样,我也曾试着走到四月的尽头,看看半枯半盛的树,看看支起一半的太阳,看看也会犹豫的时间,看看寄出的信,在不高的楼台上,看看我的承诺,我的誓言。黑色的笔耕出一片片田,却写出了四月飞雪。
人间四月已回,只我所想,只我所念。不是我的春天,不是我的人间四月。永远吧,我活在四月里,永远地活在四月里,永远地不欺骗。
我觉着你像云,好轻好轻。
表 K-3:开放写作中文样例。
设置 提示
指令 请创作一篇分析影视作品中“配角上桌”现象的文章,探讨配角走红的原因和影响,阐述这一现象对影视创作的启示。核心观点是配角走红反映了观众审美的提升和对优质影视作品的追求。
资料
参考 近年来,影视剧中“配角上桌”的现象愈发明显,俨然成为影视界的新潮流,相关话题多次登上热搜,引发网友的关注和讨论。
像《狂飙》中的陈书婷、李有田,《长月烬明》中的叶冰裳,《长相思》中的相柳……这些配角不再只是影视剧中的“点缀”,而频频在观众心中留下深刻印象。这一现象被形象地称为“配角上桌”,而当配角的热度超过主角时,便升级为“配角掀桌”。
这不禁让人好奇,配角何以逆袭“出圈”?“配角上桌”是喜还是忧?

“配角上桌”虽是一个新词,但这样的现象在影视行业中早已不是新鲜事。“考古”早年的电视剧会发现,像《金粉世家》中的白秀珠、《逆水寒》中的顾惜朝、《天下第一》里的上官海棠、《伪装者》中的汪曼春等配角,都收获了观众的喜爱。
而近年来,这种现象似乎变得越来越常见,许多配角演员的影响力大幅提升,2023年更是被网友称为“配角元年”。那么,配角何以逆袭“出圈”?都有哪些“招式”?
配角出彩一定程度上离不开好剧本。为了满足观众越发挑剔的眼光,编剧对配角的打造投入更多心血。配角不再只是简单的“好人”或“坏人”,而是具有多面的性格、丰富的背景故事和独特的人生观。其人设更为“带感”,富有张力,以多元化的设定引发观众共情。比如《狂飙》编剧为主角、配角都精心设置了“对照组”,像安欣与李响、孟德海与安长林等,以此凸显时代风云中有人迷失、有人坚守,既强化了戏剧性和冲击力,也让不同角色有了各自的命运沉浮,加深了观众的记忆点。正如编剧所说:“在李响身上,在曹闯身上,甚至在程程身上,其实都有对他们的追求和命运的讨论。”
演员本身演技精湛、实力过硬。在深入理解角色的基础上,许多配角演员以其精湛的演技,将角色演绎得立体生动,让观众赞不绝口。比如,《繁花》播出后,大家纷纷被游本昌饰演的爷叔这一角色深深折服。这位90岁高龄的老戏骨,仅通过一个眼神就能展现角色复杂的内心世界。正如网友留言所说的,他的表演赋予角色独特的魅力,堪称全剧的“定海神针”。
“二创”破圈,有梗有料。与主角相比,配角的戏份虽然相对较少,却拥有“留白”的空间,给“二创”提供了较大发挥空间。许多配角的“出圈”正是源于这些“再创作”的短视频。比如,《我的人间烟火》中男三号孟宴臣的“出圈”,正是从B站一个“二创”视频开始的,像孟宴臣反手开车门、蝴蝶墙前凝望等“名场面”,也被剪辑成短视频在社交平台大量传播。
当影视剧中的配角在“二创”作品里“晋升”为主角,观众对角色的想象和期待在“二创”中得到满足,有时一句台词甚至一个饱含情绪的眼神就可能让配角脱颖而出。

配角“出圈”受欢迎,对作品来说本是件好事。但当配角人气大幅超越主角,演变成“配角掀桌”,似乎就偏离了影视剧创作者的初衷,也引发不少忧虑。
在笔者看来,当我们讨论配角“上桌”或是“掀桌”时,实则默认了这个“桌”只能是主角的。而如今,演技好、业务精的配角们有更多机会成为观众心目中的“主角”,这便是在呼唤“以业务论英雄”的良性演艺生态。对于观众而言,能看见更多凭本事吃饭、与角色融为一体的优秀演员,这才是真正的“喜”,无关主角还是配角。
配角之所以能够“逆袭”,有时候得益于主角的“衬托”。当主角的演技、人设或者剧情设计不够出色时,配角便有机会在对比中凸显出来。比如,在一些影视剧中,主演的演技稍显生硬,而戏份又非常多,那么在观众的“火眼金睛”下,这些缺点就会被放大、受到批评。还有的时候,主角表现已经达到了“及格分”,但配角的表演更加出彩,甚至盖过了主角,哪怕只有一两集或者十几分钟的出场,也已经足够凭借其鲜明的个性和深入人心的表演吸引观众注意。
如今的观众不再满足于脸谱化的主角设定,而更加关注角色的多样性和真实性。这“倒逼”影视剧创作者创新人物塑造方式,赋予每一个角色独特的意义和价值。比如,电视剧《繁城之下》不单单讲述一个人,而是用一群人的故事来书写一个时代,从官差衙役到市井小民都拥有自己的鲜明特征。
然而,在一些影视剧中,“主角光环”可谓照耀全场,似乎没有挑战可以难倒主角,导致剧情缺乏冲突和悬念。对于这样的“主角绝对压制”,很多观众可能会对“主角光环”产生审美疲劳,而将目光投向一些演技“在线”的配角。特别是随着阅历增加,一些观众逐渐感受到多数的人生剧本都不是“开了挂”的主角,进而“移情”配角。

配角火过主角的现象以及角色间的“争奇斗艳”也给影视行业带来一定启示。笔者想到三句话。
“角色无大小,全当正戏唱”。这句话源自京剧,意思是说不管什么角色,全情的投入、扎实的演技是获得观众喜爱的根本途径。细数近年来“出圈”的配角,他们各自戏份不一、人设不同,共同点都是用演技说话,让角色的“血肉”变得丰满,而出色的演技往往让角色和演员都闪闪发光、互相成就。
比如电视剧《漫长的季节》的剧情虽然围绕主角王响展开,但剧中的不少人物都给人留下比较深刻的印象。像剧中镜头并不多的李巧云,“活脱脱”一个坚韧不拔的母亲形象,而傅卫军这一悲情角色虽然没有台词,但通过眼神和动作的表演就在观众心中激起波澜。
“把配角当主角写,把主角当人写”。没有一个角色的存在是毫无意义的,每个角色都有自己的舞台。“配角上桌”“配角掀桌”现象的出现,其实透露出观众对鲜活人物、动人故事的渴望。在流量时代,打磨剧本、提高作品质量更应是影视剧创作者的“必修课”,创作需要力求久久为功、精益求精,而非敷衍了事、粗制滥造。
对编剧来说,打磨出更有深度和内涵的剧本,才能让每个角色有更强的生命力;对导演来说,则需要把握好整部剧的节奏和氛围,让每一个角色都能在适合的时刻展现出自己的魅力。正如一位青年编剧所说:“每个人物都有自己的一条命运线,要把配角当主角写,把主角当人写。”比如,《甄嬛传》之所以令人“久看不厌”,不仅得益于全员“演技在线”,还在于其剧情让主角和配角都有各自的闪光点,并衍生出值得重新解读的价值。
“与观众共情,而不是把他们劝退”。配角频频走红,也说明社会心态在悄然发生变化。随着观众审美的提高和影视市场竞争的加剧,套路化、模板化的剧情正在失去观众。正如有人说,这届观众很“逆反”,也拒绝被安排。现在有的古装剧,不仅演员演技浮夸,而且剪辑混乱、台词粗浅,分分钟就把观众劝退了,评分直线下降。因此,创作者们也需要跟上观众,呈现更多鲜活饱满、熠熠生辉的角色,启发观众对现实生活的理解和感悟。
一位哲学家曾说:“人是目的而不是手段。”无论是主角还是配角,以全心全意、尽职尽责的态度去演绎,这不仅是对自己的尊重,也是对观众的尊重,唯有这样,才能塑造经典、收获认可。

本文中的 LLM 使用情况

作者在论文写作准备阶段把 ChatGPT 和 Gemini 用作通用辅助工具,具体用于:

  • 翻译辅助: 把作者母语中的表达和句子转换为英文。
  • 语言润色与语法修订: 改善清晰度、流畅度和语法正确性,使学术英文表达更自然。
  • 草稿审阅与批评: 指出含糊段落、提出结构改进建议,并标记潜在歧义。

这些模型没有用于生成原创研究想法、执行数据分析或撰写实质性技术内容。全部核心研究贡献、实验结果和论证结构均由作者完成;LLM 的作用限于翻译、语言润色和不涉及实质内容的编辑建议。