与结构对齐:利用结构信息对齐大语言模型¶
暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。
与结构对齐:利用结构信息对齐大语言模型¶
原题:Align to Structure: Aligning Large Language Models with Structural Information
arXiv:2504.03622,v2,2026-02-03
作者:Zae Myung Kim、Anand Ramachandran、Farideh Tavazoee、Joo-Kyung Kim、Oleg Rokhlenko、Dongyeop Kang
机构:明尼苏达大学双城分校、Amazon
作者注:Zae Myung Kim 的工作完成于 Amazon 实习期间。
翻译依据:arXiv v2 PDF 与 LaTeX source。文中引用键与模型、指标和方法名尽量保留原文形式,便于回查。
摘要¶
对大语言模型(LLM)而言,生成长而连贯的文本依然困难,因为它们在篇章生成中缺少层次化规划和结构化组织能力。本文提出 Structural Alignment(结构对齐):一种让 LLM 与类人篇章结构对齐、从而改善长文本生成的新方法。该方法把有语言学依据的篇章框架引入强化学习,引导模型生成连贯且组织良好的输出。
作者在 Proximal Policy Optimization(PPO)框架中采用稠密奖励方案,依据生成文本相对于人类写作所表现出的篇章区分性,为 token 分配细粒度奖励。论文评估了两个互补的奖励模型:第一个对表层文本特征评分,以提供显式结构并改善可读性;第二个通过层次化 discourse motif(篇章模体)分析全局篇章模式,强化更深层的连贯性与修辞复杂度。该方法在作文生成和长文档摘要等任务上超过标准模型以及经过 RLHF 增强的模型。
1. 引言¶
大语言模型的快速进展引发了大量关于如何让模型与期望行为和输出对齐的研究。RLHF 等对齐技术已经有效改善了生成文本的“有帮助性”和“无害性”,但大多数工作关心的是人类偏好什么内容,而不是人类如何组织雄辩而连贯的篇章。
人类作者会自然采用问题—解决、因果或描述等成熟文本结构,以维持局部连贯性和逻辑流。Rhetorical Structure Theory(RST,修辞结构理论)等理论框架进一步说明,论点、解释和叙事如何相互连接以保证全局一致性。把这些结构原则加入 LLM 训练,有望让模型生成更接近人类写作习惯、更连贯的篇章。

图 1: 结构对齐把传统 LLM 对齐扩展到定义明确的文本结构与篇章结构,引导模型生成更连贯、更接近人类的文本。
为此,本文提出结构对齐这一新目标:对齐对象不再只是人类价值观,还包括由语言学理论驱动的文档结构。作者探索了两条路线:
- 表层文本结构对齐:在 Reinforcement Learning from AI Feedback(RLAIF)范式下,让外部 LLM 在 PPO 框架中指导或评价生成结果。
- 图层级篇章结构对齐:用 RST 解析文档,构造层次化篇章树,再提取能够区分人类文本和 LLM 文本的 discourse motif。基于这些 motif 的作者身份分类器输出软二分类标签,并把它作为 PPO 奖励。
结构对齐对长文本生成尤其重要,因为这类任务必须维持逻辑推进和主题一致性。现有对齐工作虽然优化用户偏好,却往往忽略完整、逻辑一致文章所需要的“修辞脚手架”。结构对齐则要求内容遵循公认的篇章关系组织,从而在较长文本中维持连续性与深度。对于多段作文或创造性叙事,突兀转题、生成不足和表面化衔接都会显著影响整体阅读体验。
为了提高长文本 RL 训练的稳定性,作者还提出一种 PPO 稠密奖励:依据词语在真人文本和 LLM 文本中的相对区分性,把奖励分配到具体 token。论文贡献包括:
- 提出新的对齐框架,把有语言学依据的结构系统地纳入对齐过程,使 LLM 生成结构更好、逻辑更一致的文本。
- 提出基于语言结构的稠密奖励方案,提高 RLHF 在 1,000 token 以上长文本生成中的训练稳定性。
- 定量与定性结果均显示,结构对齐后的 LLM 会产生更接近人类写作的篇章结构,作文的清晰度、连贯性和整体质量也随之改善。
2. 相关工作¶
2.1 大语言模型对齐¶
近年来出现了多种对齐框架,包括 RLHF、RLAIF,以及 DPO、GRPO 等优化技术。受使用 LLM judge 作为奖励模型的 RLAIF 启发,本文直接使用现成 LLM 充当奖励模型,无需额外微调。尽管这些技术的底层机制不同,其主要目标很相似:让模型输出符合用户偏好、社会规范和伦理约束,使人类认为输出恰当且可接受。
本文提出的是另一种对齐目标:让 LLM 生成结构良好、接近人类篇章组织的文本。Structural Alignment 定义的是一种对齐任务,而不是绑定某一种训练算法,因此原则上可由多种学习范式实现。
2.2 长文本生成的挑战¶
内存高效架构和长上下文技术改善了 LLM 处理长输入的能力,但高质量长输出仍然困难,原因包括大规模人工标注长文本数据稀缺、长文本评价高度主观,以及基于 RL 的对齐本身复杂。
为缓解数据缺口,本文利用有语言学依据的篇章结构和 LLM 评价。其出发点是:验证长文本是否正确,通常比从头生成正确长文本更容易。既有研究曾用稠密 reward shaping 缓解 RL 训练不稳定;本文沿用这一思路,预先从大规模语料中计算类人篇章模式,并据此为生成文本分配 discourse-aware 稠密奖励。
2.3 文本中的结构组织¶
问题—解决、因果、比较—对照和描述等文本结构,是形成连贯、易读篇章的基础。它们控制信息流,突出观点之间的关系,并保证逻辑推进。RST 和 Segmented Discourse Representation Theory(SDRT)等层次化框架则通过显式定义篇章片段的角色及连接方式,提供更深一层的结构。

图 2: 结构对齐总体流程。论文研究两类奖励建模:(1)表层文本结构评分;(2)通过作者身份分类器评价类人篇章结构。蓝色组件在 RL 训练中冻结,橙色组件参与训练。
本文采用 RST 定义层次化篇章树。Elementary Discourse Unit(EDU,基本篇章单元)表示基本短语,高层节点逐步合并这些单元;每条连接边带有 elaboration、contrast 等篇章标签。这些带标签的节点还能区分文本的核心内容(nuclei)和辅助细节(satellites),呈现文章整体修辞组织。此类高层结构传达说话者意图、语用线索和修辞策略。与这些结构对齐,有助于 LLM 维持主题连续性、管理上下文切换,并生成更一致、更符合语境也更接近人类的文本。
3. 结构对齐¶
结构对齐旨在让 LLM 生成逻辑更连贯、更接近人类写作的文本。作者强调,他们提出的是新的对齐任务,不是新的算法;DPO 或 GRPO 等方法也可以接入这一框架。本文的具体实现采用 PPO 下的 RLAIF,并探索两种路线:
- 用 evaluator LLM 对表层文本结构评分;
- 用基于层次化 discourse motif 的作者身份分类器评价类人篇章结构。
此外,作者用稠密 discourse motif 做 reward shaping,以提高训练稳定性。
3.1 RLAIF 预备知识¶
RLAIF 用 AI 系统产生评价信号训练 policy model,从而扩展了基于人类反馈的范式。在 PPO 框架中,参数为 \(\theta\) 的策略 \(\pi_\theta(a_t\mid s_t)\) 根据状态 \(s_t\)(例如写作提示)产生动作 \(a_t\)(例如生成文本),AI 反馈则被转换成标量奖励 \(r_t\)。
PPO 在最大化期望奖励的同时,限制新策略与旧策略之间的偏移。其 clipped surrogate objective 为:
其中
是新旧策略的概率比,\(\epsilon\) 限制策略更新幅度。优势函数估计某个动作相对于平均水平的收益,可写为:
这里 \(V_{\theta_{\text{old}}}\) 是旧策略的 value function,\(\gamma\) 是折扣因子。策略参数按下式更新:
其中 \(\alpha\) 是学习率。通过反复更新,策略逐步提高由 AI evaluator 判断的输出质量,同时由 clipping 保持训练稳定。
3.2 用 RLAIF 实现结构对齐¶
直接把 RLAIF 用于长文本生成有特殊困难,核心是难以规模化测量连贯性和组织性。长输出包含复杂主题推进与稳定修辞流,很难把质量压缩成单一、易计算的 reward。即使能力很强的现成 LLM,在面对多段或多页文本时也可能无法可靠地给出一次性连贯性评分。
因此,本文采用两种不同但互补的评分方式:
- Text Structure Evaluator:LLM 根据表层文本结构给出 1–5 分。它虽是不完美的代理指标,但能捕捉逻辑过渡和主题平衡等关键信号。
- Authorship Classifier:把长文本切分后用 RST 提取有理论依据的 discourse motif,再做真人/机器文本二分类。
3.2.1 表层文本评分¶
第一种奖励模型使用强大的现成 LLM,从语用学和篇章分析角度给出三项表层结构分数:
- 逻辑流与结构(Logical Flow and Structure):观点是否按逻辑推进,整体组织是否连贯,文章是否容易跟随。
- 层次组织(Hierarchical Organization):内容能否从一般概念过渡到具体细节,各部分是否层层支撑中心论点。
- 平衡与强调(Balance and Emphasis):关键思想是否得到适当突出,不同观点的覆盖是否平衡,是否符合相关性与信息充分性的语用原则。
每项取 0(最差)到 5(最好)的整数,三项平均值作为最终 reward。
3.2.2 图层级篇章评分¶
第二种方法建立在 Kim 等人的层次化篇章分析之上。该方法先用 RST 把文本解析成篇章树,再把树转换为递归超图,并提取重复出现的结构模式,即 discourse motif。这些 motif 的分布被送入分类器,即使面对分布外文本或释义攻击,也能区分机器生成文本和人类文本。

图 3: 从生成文本提取 discourse motif 向量的流程。本文在原方法上增加切分步骤,以处理超过 RST parser 输入长度的文本,再聚合多个片段的 motif 向量。
为了适配更长上下文,作者在段落边界切分文本,每个 chunk 约含 400–512 token;这是当前 RST parser 带来的技术限制。各 chunk 互不重叠,以免某些 motif 被重复计数。每个片段经过篇章解析后得到 motif 分布,再汇总成捕捉全局篇章模式的特征。
汇总后的 motif 分布与 Longformer 的 [CLS] embedding 拼接,由作者身份分类器输出二分类分数。分类器使用既有数据集以及本文整理的人类作文训练,学习人类文本中更丰富、更多样的结构模式与机器文本中相对均匀、顺序预测式模式之间的差别。它的真人/机器软二分类输出就是结构对齐的 reward。
3.2.3 用 discourse motif 塑造稠密奖励¶
标准 PPO-RLHF 通常只在 episode 结束时、也就是模型输出的最后一个 token 上分配 episodic reward。稀疏奖励无法直接反馈序列中各个动作(token 选择)的质量。随着 RL episode 变长,延迟 credit assignment、探索复杂度和误差累积都会使训练更不稳定,reward 方差也会增大。
本文利用语言尤其是篇章树本身具有的细粒度结构进行 reward shaping。

图 4: 除了 episode 级标量奖励,对构成“人类特有”篇章 motif 的 token 额外分配 \(1/(2\cdot\text{num\_tokens})\) 奖励。
具体来说,作者在全语料上计算 Motif Frequency–Inverse Document Frequency(MF-IDF),选出得分至少高于一个标准差阈值、且相比 LLM 文本更能代表人类写作的 motif。motif 在 EDU 而不是完整句子上计算;每个 EDU 平均包含约 20 个 subword token。对构成这些 motif 的 token,额外加入
的奖励。
PPO 的整体目标函数不变,实现上只是把 token-level reward 加到序列 reward tensor 的相应位置。这样,梯度更新能够反映局部 token 对篇章结构的贡献,改善长序列中的 credit assignment,并比仅使用序列末端奖励更快、更稳定地更新策略。
3.3 奖励的长度惩罚归一化¶
考虑到 LLM 经常无法遵守 prompt 指定的输出长度,作者只在回答短于目标长度时,按长度缺口惩罚原始分数。归一化分数为:
其中 \(S_{\text o}\) 是原始分数,\(L_{\text r}\) 是实际回答长度,\(L_{\text d}\) 是目标长度,\(\alpha\) 是长度惩罚系数。
4. 实验¶
论文在 PPO-RLAIF 框架内比较两种奖励建模方法:(1)表层文本结构分数;(2)图层级篇章结构分数。作者为此整理作文 prompt 数据集,验证 LLM Text Structure Evaluator 的质量,再把结构对齐模型与使用通用现成奖励模型训练的标准 RLHF baseline 比较。
实验使用 Qwen2-72B-Instruct-AWQ 作为 Text Structure Evaluator,Qwen2-1.5B-Instruct 作为待对齐的初始 policy model。选择 1.5B 模型是因为它既有一定能力,又能在有限资源下做数据并行 PPO。层次化篇章分析采用 DMRST parser,Discourse Motif Extractor 和 Authorship Classifier 则沿用 Kim 等人的实现。
4.1 作文 prompt 数据集¶
论文聚焦正式作文,因为这类文本有相对明确的修辞惯例,适合评价结构对齐。PPO 训练数据整合并清洗了多个作文 prompt 来源,包括英语能力考试、说服性写作语料,以及 Reddit 的 Change My View(CMV)社区。
对 CMV 样本,作者使用 Qwen2-72B-Instruct 生成两种作文指令:要求支持原帖观点,或要求反对原帖观点。由于 CMV 本身的性质,部分主题可能具有争议。除使用预定义 test split 的 CMV 外,其余来源随机抽取 30% 作为测试集。最终数据含 26,013 条训练样本和 4,096 条测试样本。
4.2 验证 Text Structure Evaluator¶
作者使用 Hewlett Foundation Automated Essay Scoring 数据集,检查 LLM 奖励模型的篇章评分与专家人工评分之间的相关性。该数据集包含高中生作文及专家分数。图层级评分沿用已有验证方法,因此此处只验证表层结构 evaluator。
表层奖励模型各维度与人工评分的 Pearson 相关系数为:
| 维度 | Pearson 相关系数 |
|---|---|
| 连贯性(coherence) | 0.47 |
| 组织性(organization) | 0.44 |
| 平衡性(balance) | 0.39 |
| 目的性(purpose) | 0.37 |
| 多样性(variability) | 0.39 |
这些维度呈中等程度正相关。在线性回归下,0–4 分量表上的均方误差为 0.79,相当于平均偏差约 0.88 分。作者据此认为相关性足以支持把该 LLM 篇章评分器作为 reward model,并继续 PPO 训练。
4.3 结构对齐模型¶
论文用生成作文质量和长文档摘要与人类摘要的相似度衡量结构对齐效果。模型记号如下:
- Base:Qwen2-1.5B-Instruct。
- \(\text{SA}_{\text S}\):使用表层文本结构 reward 对齐的 Base。
- \(\text{SA}_{\text G}\):使用图层级篇章结构 reward 对齐的 Base。
- \(\text{RLHF}_{\text{OA}}\):使用 OpenAssistant 现成通用奖励模型对齐的 Base。
实验 1:生成作文质量¶
训练时要求模型生成 400–2,000 token 的序列,并在每个 epoch 内结合长度惩罚逐步提高目标长度。作者还做了两阶段对齐:在 \(\text{SA}_{\text S}\) 上继续使用图结构 reward,得到 \(\text{SA}_{\text{S}\rightarrow\text{G}}\);反向顺序得到 \(\text{SA}_{\text{G}\rightarrow\text{S}}\)。
评价时从 test set 随机抽取 1,000 个写作 prompt,各模型生成约 700-token 作文。由于没有 gold essay,无法做基于参考答案的评价;长作文人工评价也昂贵且一致性有限,因此作者采用 GPT-4o-2024-08-06 作为 judge,并随机打乱候选顺序以降低位置偏差。

图 5: 六种模型的 pairwise 评价结果。Base 是未对齐模型;\(\text{SA}_{\text S}\) 与 \(\text{SA}_{\text G}\) 分别使用表层和图层级结构 reward;\(\text{RLHF}_{\text{OA}}\) 使用 OpenAssistant reward model;另外两个模型依次应用两种结构 reward。
结果显示,结构对齐模型稳定超过对应 baseline,其中图层级对齐的提升最大。两阶段对齐还能略微提高表现,但相对于额外计算成本,增益较小。由于两种结构分数相关性很低,作者认为它们具有互补性。生成样本显示,训练后的 policy 更常使用显式篇章连接词,也更经常用章节标题组织文章。
实验 2:长文档摘要¶
下游任务采用 GovReport:约 19,500 篇美国政府报告,每篇配有专家撰写的 abstractive summary。报告平均约 9,400 词,摘要平均 553 词,均明显长于 PubMed 和 arXiv 等常用摘要数据集。作者从美国 Government Accountability Office(GAO)报告中随机选取 5,000 篇,确保输入不超过 14K token。prompt 根据 gold summary 的章节标题提示模型重点回答两点:报告为何开展以及报告发现了什么。
| 模型 | ROUGE-1 | ROUGE-2 | ROUGE-L |
|---|---|---|---|
| Base | 53.21 | 20.13 | 50.39 |
| Base + \(\text{RLHF}_{\text{OA}}\) | 53.25 | 20.25 | 50.47 |
| Base + \(\text{SA}_{\text S}\) | 55.45 | 21.43 | 52.30 |
| Base + \(\text{SA}_{\text G}\) | 55.86 | 21.72 | 52.81 |
表 1: GovReport 长文档摘要结果。ROUGE-1/2 分别衡量 unigram/bigram 重叠,ROUGE-L 用最长公共子序列衡量句子层级结构相似性。结构对齐显著改善长文档摘要,图层级对齐在三个指标上都最好;通用 OpenAssistant RLHF reward 几乎没有改善 Base。
4.4 分析¶
引入结构 reward 后,模型的篇章组织和类人文本结构都有明显改善。
表层结构对齐的效果¶
定性观察显示,表层对齐带来三种变化:
- 更频繁地使用 therefore、however、in contrast、moreover 等篇章连接词;
- 逻辑推进和论证流更好;
- 更常加入 Introduction、Claim 1、Claim 2、Conclusion 等章节标题。
motif 分布也间接呈现相同趋势:表层结构对齐后,代表层次关系的 Joint 和 Hyperedges 等 motif 明显增加。
图层级结构对齐的效果¶
图层级对齐不依赖局部连接词,而是直接优化全局篇章组织。训练 batch 中,人类特有 discourse motif 的比例会稳定上升,并在大约 50 个 batch step 后进入平台期,说明篇章结构优化逐渐达到阈值。相反,不使用结构 reward 的标准 PPO/RLHF 中,这些 motif 的比例缓慢下降,表明通用奖励模型不会有效强化类人篇章组织。

图 6: 不同 batch update 下人类特有 motif 的频率。蓝线为本文方法,整体上升;红色虚线为标准 PPO,呈波动下降。

图 7: 表层结构对齐前(红)和对齐后(绿)的 motif 分布差异。Joint、Hyperedges (Hyp.) 等层次关系明显增加。
表层分数与图层级分数的相关性¶
结构对齐模型往往在各自优化的评价标准上得到更高分,但表层分数和图层级分数几乎没有相关性。标准 RLHF 模型的表层分数方差很大,同时大部分输出被图分类器判定为机器生成,即 graph logit 为负。
因此:
- 表层对齐通过显式结构技巧提升可读性和清晰度;
- 图层级对齐通过强化全局篇章结构,形成更深的连贯性和修辞复杂度;
- 两者互补,两阶段训练能提高总体质量。
5. 结论¶
本文提出一种 RL 方法,使用两个 reward model 让 LLM 与类人篇章结构对齐:一个评价表层流畅和显式结构,另一个评价全局篇章结构。训练后的长文本更清晰、更连贯,并超过通用 RLHF baseline。未来工作包括扩展到更大的模型和更多样的数据集,以及引入其他语言学框架来改进 reward signal。
附录 A:实验细节¶
A.1 RL pipeline 配置¶
Text Structure Evaluator 是 72B 模型,因此高效 serving 很重要。作者使用 SGLang 加载 Qwen2-72B-Instruct-AWQ;AWQ 指 Activation-aware Weight Quantization。量化模型可装入单张 NVIDIA A100 80GB。实验启动 8 个 evaluator 实例,每个占用一张 A100,并通过 HTTP 请求通信;SGLang 负责批处理并行查询。
policy 训练使用 TRL 的 PPO 实现,但作者为在线 reward 机制做了大量修改,使训练期间可以实时查询远端 Text Structure Evaluator;作者表示将公开这份支持远程评价与 discourse alignment 的修改代码。PPO-RL 在另一台配有 8 张 A100 80GB 的服务器上运行,关键超参数为:
| 参数 | 数值 |
|---|---|
| 每设备 train batch size | 2 |
| gradient accumulation steps | 4 |
| local rollout forward batch size | 12 |
| KL coefficient | 0.03 |
| 最大输出长度 | 2K token |
即使显存很大,2K-token rollout 的内存开销仍使作者无法进一步增大 batch。
A.2 图层级篇章评分¶
作者基本遵循 Kim 等人的方法,使用其整理的区分性 discourse motif 列表构造 Motif Extractor,并训练 Longformer 作者身份分类器。不同之处是:除原研究使用的数据外,作者又加入 Qwen2-1.5B-Instruct 生成的 5,000 篇作文作为负样本。
A.3 训练曲线¶

图 A1: 不同曲线代表相同 baseline 在不同目标输出长度下的独立训练;纵轴是多个 episode 的平均 RM reward。policy 大约在 7,000 个 episode 后学会优化其生成结果。

图 A2: 对齐前后 size-3 discourse motif 的完整分布差异。
附录 B:Text Structure Evaluator 的 prompt¶
你将扮演英语教师,评价学生根据给定指令写出的作文或故事。评分时考虑以下篇章维度:
- Logical Flow and Structure(flow):评价观点的逻辑推进和文本整体组织,确保文本易于跟随且结构良好。
- Hierarchical Organization(organization):检查观点是否按从一般到具体的层次组织,每一部分是否支撑中心论点或叙事。
- Balance and Emphasis(balance):确保重要思想得到适当强调,不同观点或章节的覆盖保持平衡。
每项给出 0(最差)到 5(最好)的整数分。评分时应仔细考虑文本中哪些具体部分与各维度有关。下列情形应降低评分:文本结构很差,不符合英语作文或故事规范;含有大量特殊 token、程序代码等无意义内容;含有大量非英语内容;没有完整回答写作指令,因而尚未完成。
输出必须符合以下 JSON 格式:
输出 JSON 后写 <EOE>。
附录 C:LLM discourse annotator 的 prompt¶
引导:你将扮演英语教师,分析特定 target_type 如何被写出来,并在全文中承担篇章功能。
目标 target_type:target
它出现在以下场景中:scene
摘要:首先用不超过 70 词的一句话概括 target_type,结束后追加 <EOE>。
目的:target_type 的篇章目的是什么?用不超过 50 词的简洁句子回答,不要复述 target_type;结束后追加 <EOE>。
标签:根据上述目的,从 Temporal、Causation、Conditional、Purpose、Concession、
Contrast、Similarity、Conjunction、Disjunction 中选择最适用的篇章关系;结束后追加 <EOE>。
标签定义如下:
- Temporal:事件或命题按时间排序,一个在另一个之后发生。
- Causation:一个命题导致另一个命题的因果关系。
- Conditional:一个命题以另一个命题得到满足为条件。
- Purpose:一个命题解释另一个命题背后的意图或目标。
- Concession:一个命题提出相反观点或情形,但另一个命题依然成立。
- Contrast:突出两个命题之间的差异。
- Similarity:两个命题突出相似的特征或情形。
- Conjunction:简单添加信息,两个或多个命题在逻辑上连接。
- Disjunction:命题之间存在互斥的备选项。
输出最后还应给出 Selected label:(所选标签)。
附录 D:不同目标长度的生成样本¶
写作 prompt¶
写一篇作文,反驳“世上没有普遍的是非,只有不同视角”这一主张。可以讨论客观道德真理是否存在,以及理性在辨别是非中的作用;请提供证据与例子支撑论点。
目标长度 350 token¶
“不存在普遍是非”是一种误导性信念,它忽略了理性和客观道德真理对人类行为及社会发展的深刻影响。历史与当代证据一再显示,客观道德真理会引导社会走向进步与和谐。
例如,联合国于 1948 年通过的《世界人权宣言》提出一组跨越文化、经济和政治差异的基本权利。这份文件如同希望的灯塔,引导各国公平对待人并尊重人的尊严。世界各地的大量例子说明,遵循这些原则能够显著改善人权、经济发展和社会凝聚力。
理性辨别是非的作用也可见于科学方法;科学方法使医学、工程和环境保护等领域发生革命。经验证据和逻辑推理带来了突破性发现,改善了人类健康和生活质量。
不过,承认客观道德真理存在,并不意味着它们在现实判断中完全不受文化、历史和个人视角影响。19 世纪西方对奴隶制的广泛接受,很大程度上来自当时的文化与经济因素,而不是客观道德真理。
总之,即使人们会持有不同视角,客观道德真理依然引导社会走向进步和人的繁荣。历史及当代事例展示了理性与集体行动在促进伦理行为和社会和谐方面的改变力量。
目标长度 1K token¶
“不存在普遍的是非”是一种常见主张,通常来自认为道德判断具有主观性、因人而异的人。这一立场常被称为相对主义,数百年来一直是争论主题。一些人认为存在普遍适用的客观道德真理,另一些人则主张道德只是个人意见,并因文化而异。
相对主义最著名的支持者之一是哲学家 John Stuart Mill;原生成样本称,他认为道德判断建立在个人偏好之上,不存在判断是非的客观标准。Mill 认为,道德属于个人选择,人们应可以根据自己的信念和价值,自行判断何为对错。
然而,这种道德观因缺乏清晰性、无法为伦理决策提供一致框架而受到批评。许多人认为,道德不只是个人偏好,而是建立在全体人类共有的客观道德真理之上。
禁止谋杀、盗窃和说谎等普遍道德原则就是一例。这些原则被认为普遍适用。例如,禁止谋杀被视为普遍原则,因为它涉及人性的基本方面,并得到不同文化与社会的承认。正义也是一项客观道德原则;它建立在人人应受平等对待、公平和平等是正义社会必要组成部分的信念上。
尽管存在客观道德真理,一些人仍主张道德属于个人意见,没有客观的是非标准。这种道德相对主义认为判断来自个人偏好和文化差异。对它的主要批评是:它不能提供一致的伦理决策框架;不同文化可能拥有不同标准,从而导致判断缺乏一致性。
另一项批评是,道德相对主义会削弱道德教育和培养道德推理能力的重要性。如果没有对客观道德真理的清楚理解,个人可能难以作出伦理决策,更容易犯错或伤害他人。
总之,“不存在普遍的是非”是一种常见主张,通常由认为道德判断具有主观性、因人而异的人提出。(原论文展示的该生成样本到此结束。)
致谢¶
作者感谢 Amazon 的研究人员和实习生团队在每周研究讨论中提供反馈,也感谢 Minnesota NLP 成员在组会中的意见。Zae Myung Kim 获 3M Science and Technology Fellowship 与明尼苏达大学 Doctoral Dissertation Fellowship 支持。