跳转至

OUTLINEFORGE:面向科学写作、具有显式状态的层次化强化学习

原题:OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
arXiv:2601.09858,v1,2026-01-14
作者:Yilin Bao、Ziyao He、Zayden Yang
机构:UC San Diego、Ohio State University、Sheltered.AI
翻译依据:arXiv v1 PDF 与 LaTeX source。本文把作者的“RL/value-guided”表述按原文翻译;原文没有明确给出 PPO/GRPO 等具体 optimizer 时,译文也不作补充推断。

摘要

科学论文生成需要文档级规划和事实 grounding,但当前大语言模型尽管局部语言流畅,仍经常在全局结构、输入覆盖和引用一致性方面失败。本文提出一种强化学习框架,把科学论文大纲构建视为层次化文档结构上的长时程规划问题。该方法通过结构化 action 对不断演化的大纲进行编辑,使系统能够渐进构建完整科学手稿。

为实现并稳定学习,作者提出两阶段优化过程:(1)从局部计划反向重建大纲,以强制全局结构一致;(2)进行前向 value-guided reinforcement learning,其 reward 显式建模科学正确性、篇章连贯性和引用忠实度。论文还提出科学论文生成 benchmark,评价文档规划、输入利用、参考文献忠实性、大纲组织和内容事实准确性。结果显示,该方法相对于强 neural 与 LLM baseline 有稳定提升,尤其改善长距离结构连贯性和引用可靠性。

1. 引言

科学论文生成位于长文本生成、文档级规划和可验证科学推理的交叉点。与短文本任务相比,它不仅要求语言流畅,还要求维持连贯的全局结构、覆盖相关输入,并忠实且一致地使用引用。

过去两年,LLM 已从被动文本生成器迅速转向更加 agentic 的系统,能够进行结构化推理、使用工具、长时程规划和自主问题求解。模型架构、后训练和交互框架的进步,使 LLM 不只具有语言流畅性,也逐渐具备程序性能力、可验证推理和迭代决策能力。因此,越来越多工作不再把 LLM 视为静态预测器,而是视为可能参与复杂科学和工程流程的通用认知引擎。

与此同时,AI 已深入科研流程。AI4Research 等综述记录了 AI 作为文献综述者、实验规划者、假设评价者甚至自主研究合作者的应用。另一条研究线关注 agentic reasoning:LLM 如何拆解任务、调用外部工具、反复修改输出并利用反馈改善推理轨迹。ReAct、Tree-of-Thoughts、Chain-of-Thought、Voyager,以及科学领域专用 LLM 都显示出两种趋势的汇合:scientific LLM 正变得更 agentic,而 agentic LLM 框架也越来越多地用于科研。

但在科学写作、实验设计和多步论证等长时程任务中,系统性提升 agentic scientific reasoning 的机制仍不成熟。现有方法通常依赖 SFT 或 heuristic feedback,而不是 grounded optimization principle;该领域也缺少能同时评价生成文本质量、结构和正确性的标准 benchmark。

论文声称有三项贡献:

  1. 提出用于科学论文生成的 RL 与 value-based training 范式,在显式 value function 下学习构造连贯、可验证、多章节的研究手稿,并进行针对科学写作的结构化 credit assignment。
  2. 构建科学论文生成 benchmark,覆盖真实的多章节写作、引用一致性、论证结构和事实有效性。
  3. 实验显示,所提出的 value-guided generation framework 相对于强监督 baseline 改善全局叙事连贯性、科学正确性和跨章节一致性。

2. 相关工作

2.1 AI 科研与 agentic reasoning

AI 已用于文献综述、实验规划、假设评估和自主科学探索。ReAct、Tree-of-Thoughts、Chain-of-Thought 与 Voyager 展示了如何结合结构化推理和 action execution。SurveyForge、SciSage 等多 agent 科学写作系统进一步说明,大纲规划、memory-driven generation 和 agent 分工有助于完成复杂写作任务。本文把这一方向扩展到作者所谓的、用于长时程科学写作的 principled value-based optimization。

2.2 Scientific LLM 与自动科学写作

Galactica、SciGPT、SciBERT 等模型使用领域语料或专门科学推理数据训练,以支持科学检索、知识 grounding 和引用推理。AutoSurvey、SurveyX、SGSimEval 面向综述生成或多维评价;SurveyForge、SciSage 等更先进系统使用 outline heuristic、memory 或 multi-agent coordination 改善结构和内容质量。作者认为,既有方法虽能带来局部提升,却缺少统一的全局手稿质量优化原则,因此提出显式 value function 引导的多章节生成。

2.3 引用准确性、评价 benchmark 与科学文本结构

ScholarCoPilot 使用 citation-aware trigger 和 retrieval supervision 改善学术写作,CiteGuard 则用 retrieval-augmented validation 检查生成引用是否支持对应 claim。SGSimEval 等 benchmark 从大纲质量、内容忠实度和引用行为等维度评价科学文本;科学篇章结构标注工作还提供了分析科学 discourse 的 schema 与 taxonomy。这些研究说明,科学写作质量包含结构、事实 grounding 和引用忠实等多个维度。本文的 benchmark 与训练目标试图同时覆盖这些方面。

2.4 长文本生成中的 RL 与 value modeling

RL 已用于控制 LLM 的高层行为,尤其适用于长时程连贯性、偏好对齐和结构化决策。InstructGPT 形式化了现代 RLHF pipeline,PPO 常被用作 policy-gradient 骨干;RLAIF、DPO 等工作进一步扩展了 value modeling、preference learning 和 policy optimization 在长文本生成中的使用范围。

3. 方法

论文把传统 token-level sequence generation 改写成结构化中间状态空间上的多步演化过程,以显式描述科学论文生成背后的中间推理结构。

3.1 科学写作形式化

科学论文生成被定义为结构化、长时程的 conditional generation。给定异构输入,模型需要生成连贯、结构良好的科学文章;文章不仅要有高条件似然,还要满足学术写作隐含的结构、语义和事实约束。

输入空间

输入定义为:

\[ X=(T,C,R), \]

其中:

  • \(T\in\mathcal T\):主题或高层写作意图;
  • \(C=\{c_1,c_2,\ldots,c_m\}\in\mathcal C\):背景材料、文档或其他上下文证据;
  • \(R=\{r_1,r_2,\ldots,r_k\}\in\mathcal R\):可供引用的外部参考文献集合。

形式化不限定 \(C\)\(R\) 的来源;它们可以来自 retrieval module、预定义阅读列表或 memory-like component。

输出空间

科学文章表示为文本单元序列:

\[ Y=(y_1,y_2,\ldots,y_L), \]

每个 \(y_i\in\mathcal U\) 可以是 token、短语或领域专用标记语言(如 Markdown 或 LaTeX)中的元素。完整输出空间为:

\[ \mathcal Y=\left\{Y=(y_1,\ldots,y_L)\ \middle|\ L\in\mathbb N,\ y_i\in\mathcal U,\ \mathrm{ValidArticle}(Y)\right\}, \]

其中 \(\mathrm{ValidArticle}(Y)\) 表示 \(Y\) 满足科学文章的结构和语义约束。参数为 \(\theta\) 的 autoregressive model 定义:

\[ \pi_\theta(Y\mid X)=\prod_{i=1}^L\pi_\theta(y_i\mid y_{<i},X), \qquad \pi_\theta(y_i\mid y_{<i},X)\in\Delta(\mathcal U). \]

基本条件生成目标

最一般的论文生成目标是最大化条件似然:

\[ Y^*=\arg\max_{Y\in\mathcal Y}\pi_\theta(Y\mid X). \]

若没有其他约束,这就退化为标准 maximum-likelihood training 与 decoding。

信息覆盖和结构约束

科学文章不仅要流畅连贯,还要忠实使用输入材料。令 \(I(\cdot)\) 为语义信息映射,例如抽取事实、核心 claim 或重要概念,则上下文覆盖率定义为:

\[ \operatorname{Coverage}(Y,C)= \frac{|I(Y)\cap I(C)|}{|I(C)|}. \]

这一指标鼓励文章纳入输入中的关键内容,而不是忽略核心证据或产生无依据陈述。复合目标写为:

\[ Y^*=\arg\max_{Y\in\mathcal Y} \left[ \pi_\theta(Y\mid X)+\sum_I\lambda_I\operatorname{Coverage}(Y,C) \right], \]

\(\lambda_I\) 平衡模型似然和 coverage criterion。

引用一致性

\(\operatorname{Citation}(Y)\subseteq\mathcal R\) 表示输出实际引用的文献集合,简单引用一致性指标为:

\[ \operatorname{CitationScore}(Y)= \mathbb 1[\operatorname{Citation}(Y)\subseteq\mathcal R]. \]

它要求所有引用都属于给定参考集合。更细粒度版本还可检查引用与局部语境是否相关,或 \(R\) 中的重要文献是否被遗漏。

约束优化视角

\(\mathcal S_{\text{struct}}\)\(\mathcal S_{\text{fact}}\)\(\mathcal S_{\text{cite}}\) 分别表示结构、事实和引用的 feasible set,则可写为:

目标是:

\[ \max_{Y\in\mathcal Y}\ \pi_\theta(Y\mid X), \]

并满足以下约束:

\[ \operatorname{Coverage}(Y,C)\ge\delta_{\text{cov}}, \]
\[ Y\in\mathcal S_{\text{struct}},\qquad Y\in\mathcal S_{\text{fact}},\qquad Y\in\mathcal S_{\text{cite}}. \]

\(\delta_{\text{cov}}\) 控制期望 coverage。实际系统通常以 auxiliary loss、decoding heuristic 或 post-hoc editing 近似实施这些约束。

3.2 强化学习

RL 把长篇科学写作建模为 sequential decision-making,而不是直接最大化条件似然。任务 reward 应表达 coverage、结构、连贯性、事实性和引用正确性等目标。论文考虑 episodic MDP:

\[ \mathcal M=(\mathcal S,\mathcal A,P,r,\gamma), \]

其中 \(\mathcal S\) 是状态空间,\(\mathcal A\) 是 action space,\(P\) 是 transition kernel,\(r\) 是 reward function,\(\gamma\in(0,1]\) 是折扣因子。步骤 \(t\) 时,模型在 \(s_t\) 下产生对应下一文本单元的动作 \(a_t\),转移到 \(s_{t+1}\) 并得到标量奖励 \(r_t\)

写作策略 \(\pi_\theta(a_t\mid s_t)\) 的目标是最大化期望 return:

\[ J(\theta)=\mathbb E_{\pi_\theta}\left[\sum_{t=1}^L\gamma^{t-1}r_t\right]. \]

reward 可以编码语义覆盖或引用正确性等高层属性,也能通过 reward shaping 纳入不可微约束。但科学写作的 horizon 极长、reward 稀疏、结构约束复杂,直接 RL 面临困难,因此作者引入层次化 abstraction 和 intermediate reasoning state,让模型在多个时间尺度上规划并缓解 credit assignment。

3.3 总体 schema

论文把大纲表示为可编辑的层次结构,并把生成建模为 outline state \(s_{\text{outline}}\in\mathcal S\) 上的离散状态转移。每次转移由显式编辑动作 \(a_{\text{diff}}\in\mathcal A\) 实现;借用版本控制术语,作者把这些编辑称为 diff

在这一视角下,论文不再一次性采样 token sequence,而是从粗略或空大纲开始,通过局部 diff 不断逼近高质量大纲,再由大纲引出最终文档。中间状态空间 \(\mathcal S\) 可理解为所有合法大纲结构的集合。

作者从真实科学论文中采样大纲编辑轨迹,构成:

\[ (s_{\text{outline}},a_{\text{diff}})\sim\mathcal T(\mathcal D_{\text{Paper}}), \]

其中 \(\mathcal D_{\text{Paper}}\) 是从 arXiv API 获取的原始论文语料,\(\mathcal T\) 是把文档修改历史转成 outline state–diff pair 的 transcription module。策略 \(\pi_\theta(a_{\text{diff},t}\mid s_{\text{outline},t})\) 学习复现这些 human preference;为简洁起见,原文后续把它记作 \(\pi_\theta(a_t\mid s_t)\)

diff 分为两类:节点重排、删除或结构迁移等可以确定性执行;语义细化或内容扩展则必须由 LLM 生成。对后者,系统根据编辑意图构造 query:

\[ q_t=f(a_t), \]
\[ s_{t+1}\sim\operatorname{LLM}(\cdot\mid s_t,q_t). \]

其中 \(f\) 把 action 映射为 model query。执行模式指示函数

\[ \kappa:\mathcal A\rightarrow\{\mathrm{direct},\mathrm{llm}\} \]

区分结构性直接编辑和 LLM 生成编辑。源码把统一 transition operator 写成以下分支关系:

执行模式 转移表达式
\(\kappa(a)=\mathrm{direct}\) \(\delta(\operatorname{Exec}(s,a))\)
\(\kappa(a)=\mathrm{llm}\) \(\operatorname{LLM}(\cdot\mid s,f(a))\)

其中 \(\operatorname{Exec}(s,a)\) 是确定性的结构编辑函数,\(\delta(\cdot)\) 表示退化的确定性分布。源码原式把 \(P(\cdot\mid s,a)\) 与表中相应分支写成 \(P(\cdot\mid s,a)\leq[\text{相应分支}]\),而不是通常定义分段 transition operator 时使用的等号;译文保留并明确指出这一源码写法,不擅自把它修正为等式。

在这一形式化下,大纲演化满足 \(s_{t+1}\sim P(\cdot\mid s_t,a_t)\),并可再次写成 \(\mathcal M=\langle\mathcal S,\mathcal A,P,r,\gamma\rangle\) 的 MDP。完整生成轨迹为 \(\tau=(s_0,a_0,s_1,a_1,\ldots,s_T)\),初始状态 \(s_0\) 是空大纲:

\[ a_t\sim\pi_\theta(\cdot\mid s_t),\qquad s_{t+1}\sim P(\cdot\mid s_t,a_t). \]

人类编辑数据可解释为未知 optimal policy \(\pi^*\) 诱导的轨迹,即 \(\tau\sim p_{\pi^*}(\tau)\)。原文随后写道,参数化 policy \(\pi_\theta\) 是通过 maximum likelihood estimation 或 preference-alignment objective 逼近这一分布的。这使模型复现结构化大纲空间中的人类编辑决策,并显式暴露中间推理步骤和结构演化轨迹。

源码可复现性说明: 摘要和引言宣称采用“两阶段优化”“前向 value-guided RL”“显式 value function”和结构化 credit assignment,但方法与实验没有给出对应的 value function、科学正确性/篇章连贯性/引用忠实度 reward 公式、RL optimizer、rollout 更新或两阶段训练配置。正文唯一明确写出的学习方式是这里的 MLE 或 preference-alignment objective。因此,不能仅凭标题和摘要把实验解释为已经复现了 PPO/GRPO 式强化学习。

3.4 Benchmark 构造

作者系统解析 arXiv 论文,采样 1,500 篇文章,覆盖 6 个大领域和 11 个细分领域。实验使用固定子集,但 pipeline 可以扩展到任意规模 arXiv 集合持续生成训练数据。

方法借鉴代码任务中的 Abstract Syntax Tree(AST):从 arXiv HTML 恢复由章节、小节和段落组成的层次化文档 schema,再由 augmentation model 提议可能的修改操作。具体做法是随机选一个段落,删除或修改部分内容;破坏后的段落作为 problem instance,目标 solution 则是推理出能恢复或改善段落的连贯修改计划。每条样本包含修改前后状态及对应 prompt。这相当于把文档生成 pipeline 反向运行,把文档演化规划转成 reasoning task,让局部编辑逐步累积为全局结构改善。

不同领域的段落长度分布

不同领域的引用密度分布

图 1: 原文图注为“各类别的段落长度与引用密度分布”。图后正文进一步指出:引用分布高度偏斜而非均匀,这说明“每一步固定检索相同数量文献”的 RAG 方法与真实写作需求不符;文档演化不同阶段需要的引用数量差异很大。论文展示大类均值,而不展示趋势相似、不会实质改变结论的细分领域统计。

不同去信息率下的 state-action complexity

图 2: 原文图注为“不同去信息化率下的 state-action complexity”。图后正文把完整文章逐步分解为空大纲所需的预期步数用作估计文档演化 planning horizon;横轴表示保留文档结构、但对高质量文章仍很关键的 update operation 比例。经验结果表明,多数领域的完整文章可在 200–300 步内生成,因此实验采用这两个 step budget。

4. 实验

论文以综述生成为代表性长时程科学写作任务,与 SurveyForge、SciSage 和 AutoSurvey 比较。除非另有说明,推理 budget 为 200 或 300 步。

作者使用 pipeline 生成的训练数据微调 Gemma2-2B、Qwen3-1.8B 和 Phi-3.8B;另外以 zero/few-shot 方式测试 GPT-4o-mini、Claude-3.5-Haiku 和 Llama-3.1-Instruct-70B,以观察模型规模和 task-specific fine-tuning 的作用。

模型 200 步 Precision 200 步 Recall 200 步 F1 300 步 Precision 300 步 Recall 300 步 F1
Ours (GPT-4o-mini) 0.612±0.089 0.264±0.105 0.352±0.083 0.668±0.103 0.312±0.151 0.397±0.164
SurveyForge 0.346±0.028 0.261±0.113 0.285±0.083
AutoSurvey 0.295±0.028 0.181±0.080 0.213±0.062
Ours (Claude-3.5-Haiku) 0.533±0.094 0.173±0.071 0.249±0.082 0.524±0.069 0.186±0.129 0.246±0.119
SurveyForge 0.267±0.027 0.265±0.162 0.243±0.082
AutoSurvey 0.228±0.027 0.172±0.073 0.187±0.050
Ours (Phi-3.8B, fine-tuned) 0.678±0.081 0.317±0.116 0.422±0.117 0.717±0.126 0.311±0.225 0.381±0.206
SurveyForge 0.359±0.028 0.345±0.274 0.313±0.129
AutoSurvey 0.296±0.029 0.306±0.198 0.274±0.101
Ours (Llama-3.1-Instruct-70B) 0.446±0.064 0.161±0.078 0.223±0.076 0.512±0.130 0.196±0.224 0.210±0.153
Ours (Gemma2-2B, fine-tuned) 0.399±0.108 0.166±0.134 0.201±0.112 0.406±0.109 0.251±0.282 0.247±0.175
Ours (Qwen3-1.8B, fine-tuned) 0.244±0.084 0.095±0.071 0.120±0.070 0.298±0.126 0.074±0.052 0.111±0.070

表 1: 不同 step budget 下的结果。原文 caption 字面写的是“不同 prompt ratio 和 inference step 下的表现”,但表格没有 prompt-ratio 列;caption 还称指标按百分数报告,表中实际却是 0–1 小数。译文保留表格原值,并不把小数擅自乘以 100。

作者认为 prior knowledge 对综述生成至关重要。小于 2B 的模型微调增益有限,可能因内在世界知识不足而难以利用结构化演化信号;容量达到中等规模后,基于本文数据的 fine-tuning 更稳定地改善性能,部分情况下超过未适配任务的大模型。

SurveyForge 和 AutoSurvey 一次性生成大纲,没有 step-based formulation,因此对比范式并不完全一致;原文仍认为这一比较体现了把科学写作建模为序列决策过程、而非一次性生成的优势。本文虽声称方法可用于一般科学写作,但实验只覆盖综述生成,其他任务留待未来工作。其 state-action 形式允许在生成过程中注入任意修改 prompt,作为扩展到非综述写作的机制。

逐步 precision 逐步 recall 逐步 F1 文档结构完整度 引用相关性 信息覆盖

图 3: 原文图注仅为“3×2 图的总图注”,没有逐个命名六幅子图。紧随图后的正文解释是:前三图表明 reference retrieval 在前 50–150 步很快饱和,之后引用数量和相关性改善很小,说明文档结构基本稳定;后三图由 GPT-4o 评价结构完整度、引用相关性和信息密度。即使引用指标进入平台期,高层质量仍在后续步骤继续改善,表明后期主要执行 refinement 而非结构扩张。由于评价成本高,这些指标每 50 步计算一次。

5. 局限

  1. 长篇科学写作评价本身很困难。部分分析依赖 LLM judge 评价结构完整度、引用相关性和信息密度,可能带入 judge 自身先验,无法完全代表人类专家判断。
  2. 实验主要研究综述生成,没有覆盖原创研究论文、方法论文和跨学科写作等完整学术场景。
  3. 状态和 action space 来自人工设计的文档结构与编辑 schema;虽然可解释、可控,但面对写作规范差异很大的领域时可能缺乏灵活性。
  4. 长时程迭代编辑仍可能累积错误,尤其当早期结构决策不理想时。全局 revision、rollback 和层次规划仍需继续研究。

6. 结论

本文提出基于 state-action 的框架,把长时程科学写作建模为迭代规划和推理过程。通过反向构造文档编辑,方法把文档演化转换为可处理的 reasoning task,并生成可扩展的结构化监督数据。arXiv 统计还显示引用分布高度偏斜等容易被既有方法忽略的科学写作结构特征。

综述生成实验表明,该方法超过若干 baseline,并使较小的 fine-tuned model 在部分设置中超过通用大模型。框架支持灵活编辑目标,理论上也能扩展到综述之外的科学写作。作者希望这项工作能推动自演化系统,以及面向复杂生成任务的结构化推理研究。