跳转至

MM-RLHF:多模态 LLM 对齐的下一步

暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。

跳转:原文 EN · 译文 ZH · 原文 PDF


MM-RLHF:多模态 LLM 对齐的下一步

中文结构化译文草稿,基于同目录 main_en.mdpaper.pdf
作者与组织:原文作者较多;代表组织以论文首页为准,后续精修时继续补齐完整作者单位。
本地材料:paper.pdfmain_en.mdfigures_png/source/

摘要翻译

尽管 Multimodal Large Language Models, MLLMs 已经取得显著进展,大多数 SOTA 模型并没有经过系统的人类偏好对齐。现有多模态对齐研究通常只在局部问题上取得进展,例如降低 hallucination,而“人类偏好对齐是否能系统性提升 MLLM 的整体能力”仍缺少充分探索。

为此,论文提出 MM-RLHF,一个包含 120k 细粒度人工标注偏好比较对的数据集。与已有资源相比,它在规模、多样性、标注粒度和质量上都有提升。基于该数据集,作者进一步提出用于提升 reward model 质量和对齐算法效率的一组方法:Critique-Based Reward Model 先生成 critique 再给出分数,使 reward 信号更可解释;Dynamic Reward Scaling 根据 reward margin 调整每个样本的 loss 权重,使高质量比较对发挥更大作用。

实验覆盖 10 个维度和 27 个 benchmark。结果显示,用 MM-RLHF 和对应对齐算法微调 LLaVA-OV-7B,可以带来 19.5% 的对话能力提升和 60% 的安全性提升。

论文定位

这篇论文关注的是 MLLM 的 post-training / alignment,而不是单一视觉任务能力提升。它的核心判断是:多模态对齐不应只解决 hallucination 或安全某一个窄问题,而应通过高质量偏好数据、可解释 reward model 和更稳的 DPO 训练,同时改善感知、推理、对话和可信性。

数据构造

MM-RLHF 数据覆盖三类任务:

  • image understanding
  • video understanding
  • MLLM safety

数据构造流程包括:

  1. 从多来源收集约 1000 万条多模态 instruction 样本。
  2. 用 CLIP 等图像表征做聚类和重采样,从大规模原始池中抽取约 30k 代表性 query。
  3. 使用 GPT-4o、Claude 3.5 Sonnet、Qwen2-VL-72B、LLaVA-OV-72B 等模型生成候选回答。
  4. 进行细粒度人工标注,标注内容包括评分、排序和解释,最终形成超过 120k 个高质量 ranked comparison pairs。

论文强调,多模态数据不能只做文本去重,因为相似文字问题配上不同图片会得到完全不同任务。因此它主要使用图像/视频表征聚类来保持视觉多样性。

方法

Critique-Based Reward Model

传统 reward model 通常只输出 scalar score,可解释性弱。直接把 MLLM 当 reward model 又对 instruction following 要求很高。论文提出 Critique-Based Reward Model:先把人类简短标注扩展成模型友好的 detailed critique,再训练 reward model 先生成 critique、再根据 critique 打分。

这样做有两个作用:

  • reward 分数更可解释,便于理解模型为什么偏好某个回答。
  • critique 本身提供更细粒度监督,使 reward model 不只是学 pairwise rank。

论文报告的 MM-RLHF-Reward-7B 在多个 reward model benchmark 上达到开源 SOTA,并超过若干 72B 级公开模型。

Dynamic Reward Scaling

在 DPO 训练中,传统做法对所有 chosen/rejected pair 使用固定权重。论文认为不同偏好对的信息量不同:如果 reward model 对 chosen 和 rejected 的分数差距很大,说明这个 pair 的偏好更清晰,应该给予更高训练权重。

设 reward margin 为:

\[ \delta = r(y_w) - r(y_l) \]

其中 \(y_w\) 是 preferred response,\(y_l\) 是 rejected response。Dynamic Reward Scaling 根据 \(\delta\) 调整 DPO 的 \(\beta\) 或等价训练权重,并用有界函数避免过大更新导致不稳定。

实验结论

论文在 10 类任务和 20 多个 benchmark 上评估,包括 chart/document understanding、OCR、hallucination、math reasoning、general knowledge、conversation、high-resolution real-world utility、video understanding、multi-image、MLLM safety。

主要结论:

  • MM-RLHF 对多个 baseline 都能带来跨维度提升。
  • 对话能力和安全性提升最显著:对话 benchmark 平均提升超过 10%,unsafe behavior 至少降低 50%。
  • hallucination、数学推理、多图理解、视频理解也有改善。
  • 高分辨率 benchmark 提升有限,原因可能是数据集中超高分辨率样本较少,且过滤策略没有显式优化分辨率。
  • Critique-Based Reward Model 和 Dynamic Reward Scaling 都是有效组件。

局限

这篇论文的主要局限在于:完整作者/组织和数据发布细节需要进一步核验;当前中文稿为结构化译文草稿,尚未逐表逐图翻译所有附录。后续精读时应重点补齐 reward model benchmark、MM-DPO 主表和安全 benchmark 的具体数字。