跳转至

Black-Box On-Policy Distillation of Large Language Models

暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。

跳转:原文 EN · 译文 ZH · 原文 PDF


Black-Box On-Policy Distillation of Large Language Models

中文结构化译文草稿,基于同目录 main_en.md
作者与组织:Tianzhu Ye、Li Dong、Zewen Chi、Xun Wu、Shaohan Huang、Furu Wei;Microsoft Research。
简称:GAD, Generative Adversarial Distillation。
本地材料:paper.pdfmain_en.mdsource/

摘要翻译

Black-box distillation 指学生 LLM 只能从专有教师模型的文本输出中学习,无法访问教师模型的 logits 或参数。本文提出 GAD: Generative Adversarial Distillation,用于实现 on-policy 且 black-box 的 LLM distillation。

GAD 把学生 LLM 看作 generator,并训练一个 discriminator 区分学生回答和教师回答,由此形成一个 minimax game。discriminator 充当 on-policy reward model,随学生模型共同演化,为学生提供稳定且自适应的反馈。实验显示,GAD 稳定超过常用的 sequence-level knowledge distillation, SeqKD。特别地,用 GAD 训练的 Qwen2.5-14B-Instruct 在 LMSYS-Chat 自动评测上接近 GPT-5-Chat 教师模型。

论文定位

这篇论文解决的是 closed teacher / API teacher 场景下的知识蒸馏问题。传统 SeqKD 只是让学生模仿教师生成的文本,属于 off-policy imitation;GAD 则让学生从自己生成的回答中学习,由 discriminator 判断它和教师回答的差距,因此更接近 on-policy distillation。

方法

Black-box distillation 的困难

white-box distillation 可以访问教师模型概率分布或 hidden states,因此可以用 KL divergence 等目标对齐学生和教师。但在 GPT-5 这类专有 API 模型上,学生只能看到教师输出文本,不能得到 token-level probability。此时常见方法是 SeqKD:收集教师回答,然后对学生做 SFT。

SeqKD 的问题是学生一直被 teacher-forced 到教师文本上,缺少对自身生成分布的反馈,也容易过拟合教师局部措辞。

GAD 的核心

GAD 包含两个模型:

  • generator \(G\):学生 LLM,输入 prompt 后生成回答。
  • discriminator \(D\):判断一个 prompt-response pair 更像教师还是学生。

训练目标采用 Bradley-Terry 风格的 pairwise loss:

\[ \max_G \min_D \mathcal{V}(G,D) = \mathbb{E}_{(x,y_t)}[-\log \sigma(D(y_t)-D(G(x)))] \]

其中 \(y_t\) 是教师回答,\(G(x)\) 是学生当前生成回答。discriminator 被训练为给教师回答更高分;generator 被训练为让自己的回答获得更高 discriminator score。

与 RLHF 的关系

论文把 GAD 映射到 RL 框架:

RL 概念 GAD 中的对应项
Policy model Generator / Student LLM
Reward model Discriminator
Reward \(D(G(x))\)

关键区别是:常规 RLHF 的 reward model 训练好后冻结,容易被 policy hack;GAD 的 discriminator 会随学生当前分布持续更新,因此是 on-policy reward model。

训练细节

论文发现 warmup 很关键:

  1. generator 先用教师回答做一轮 cross-entropy warmup。
  2. discriminator 同时用 Bradley-Terry loss warmup。
  3. 之后进入 GAD adversarial training。

如果没有 generator warmup,学生和教师差距过大,discriminator 太容易区分,反馈不够有效。如果没有 discriminator warmup,discriminator 初期无法提供高质量 reward。

实验结论

教师模型是 GPT-5-Chat,学生模型来自 Qwen2.5 和 Llama3 系列。训练数据使用 LMSYS-Chat-1M 的子集,并在 LMSYS-Chat、Dolly、SelfInst、Vicuna 等数据上评估。

主要结论:

  • GAD 在相同训练预算下超过 instruct baseline 和 SeqKD。
  • Qwen2.5-3B-Instruct + GAD 可以达到 Qwen2.5-7B-Instruct + SeqKD 的水平。
  • Qwen2.5-14B-Instruct + GAD 接近 GPT-5 teacher。
  • human evaluation 中,GAD 相比 instruct 和 SeqKD 多数情况下 win rate 超过 50%,loss rate 低于 30%。
  • SeqKD 更容易学习教师的局部 n-gram 模式,而 GAD 更能学习整体风格与行为分布。
  • 冻结的 off-policy discriminator 容易在约 300 steps 后出现 reward hacking,生成过长且偏离教师风格的回答;on-policy GAD 在数千步内更稳定。

局限与关系

GAD 的价值在于把 black-box distillation 从“模仿教师文本”推进到“学生在自身分布上通过对抗 reward 学习”。它与 Thinking Machines 的 on-policy distillation 方向相关,但它不要求 white-box teacher logits,因此更适合 API-only teacher。

需要注意的是,GAD 的效果依赖 discriminator 和 generator 的平衡;论文消融显示,过大 discriminator 不一定更好,等规模 generator-discriminator 组合反而表现最好。