Black-Box On-Policy Distillation of Large Language Models¶
暂无精读笔记。以下展示中文译文(点「译文」进入独立译文页)。
Black-Box On-Policy Distillation of Large Language Models¶
中文结构化译文草稿,基于同目录
main_en.md。
作者与组织:Tianzhu Ye、Li Dong、Zewen Chi、Xun Wu、Shaohan Huang、Furu Wei;Microsoft Research。
简称:GAD, Generative Adversarial Distillation。
本地材料:paper.pdf、main_en.md、source/。
摘要翻译¶
Black-box distillation 指学生 LLM 只能从专有教师模型的文本输出中学习,无法访问教师模型的 logits 或参数。本文提出 GAD: Generative Adversarial Distillation,用于实现 on-policy 且 black-box 的 LLM distillation。
GAD 把学生 LLM 看作 generator,并训练一个 discriminator 区分学生回答和教师回答,由此形成一个 minimax game。discriminator 充当 on-policy reward model,随学生模型共同演化,为学生提供稳定且自适应的反馈。实验显示,GAD 稳定超过常用的 sequence-level knowledge distillation, SeqKD。特别地,用 GAD 训练的 Qwen2.5-14B-Instruct 在 LMSYS-Chat 自动评测上接近 GPT-5-Chat 教师模型。
论文定位¶
这篇论文解决的是 closed teacher / API teacher 场景下的知识蒸馏问题。传统 SeqKD 只是让学生模仿教师生成的文本,属于 off-policy imitation;GAD 则让学生从自己生成的回答中学习,由 discriminator 判断它和教师回答的差距,因此更接近 on-policy distillation。
方法¶
Black-box distillation 的困难¶
white-box distillation 可以访问教师模型概率分布或 hidden states,因此可以用 KL divergence 等目标对齐学生和教师。但在 GPT-5 这类专有 API 模型上,学生只能看到教师输出文本,不能得到 token-level probability。此时常见方法是 SeqKD:收集教师回答,然后对学生做 SFT。
SeqKD 的问题是学生一直被 teacher-forced 到教师文本上,缺少对自身生成分布的反馈,也容易过拟合教师局部措辞。
GAD 的核心¶
GAD 包含两个模型:
- generator \(G\):学生 LLM,输入 prompt 后生成回答。
- discriminator \(D\):判断一个 prompt-response pair 更像教师还是学生。
训练目标采用 Bradley-Terry 风格的 pairwise loss:
其中 \(y_t\) 是教师回答,\(G(x)\) 是学生当前生成回答。discriminator 被训练为给教师回答更高分;generator 被训练为让自己的回答获得更高 discriminator score。
与 RLHF 的关系¶
论文把 GAD 映射到 RL 框架:
| RL 概念 | GAD 中的对应项 |
|---|---|
| Policy model | Generator / Student LLM |
| Reward model | Discriminator |
| Reward | \(D(G(x))\) |
关键区别是:常规 RLHF 的 reward model 训练好后冻结,容易被 policy hack;GAD 的 discriminator 会随学生当前分布持续更新,因此是 on-policy reward model。
训练细节¶
论文发现 warmup 很关键:
- generator 先用教师回答做一轮 cross-entropy warmup。
- discriminator 同时用 Bradley-Terry loss warmup。
- 之后进入 GAD adversarial training。
如果没有 generator warmup,学生和教师差距过大,discriminator 太容易区分,反馈不够有效。如果没有 discriminator warmup,discriminator 初期无法提供高质量 reward。
实验结论¶
教师模型是 GPT-5-Chat,学生模型来自 Qwen2.5 和 Llama3 系列。训练数据使用 LMSYS-Chat-1M 的子集,并在 LMSYS-Chat、Dolly、SelfInst、Vicuna 等数据上评估。
主要结论:
- GAD 在相同训练预算下超过 instruct baseline 和 SeqKD。
- Qwen2.5-3B-Instruct + GAD 可以达到 Qwen2.5-7B-Instruct + SeqKD 的水平。
- Qwen2.5-14B-Instruct + GAD 接近 GPT-5 teacher。
- human evaluation 中,GAD 相比 instruct 和 SeqKD 多数情况下 win rate 超过 50%,loss rate 低于 30%。
- SeqKD 更容易学习教师的局部 n-gram 模式,而 GAD 更能学习整体风格与行为分布。
- 冻结的 off-policy discriminator 容易在约 300 steps 后出现 reward hacking,生成过长且偏离教师风格的回答;on-policy GAD 在数千步内更稳定。
局限与关系¶
GAD 的价值在于把 black-box distillation 从“模仿教师文本”推进到“学生在自身分布上通过对抗 reward 学习”。它与 Thinking Machines 的 on-policy distillation 方向相关,但它不要求 white-box teacher logits,因此更适合 API-only teacher。
需要注意的是,GAD 的效果依赖 discriminator 和 generator 的平衡;论文消融显示,过大 discriminator 不一定更好,等规模 generator-discriminator 组合反而表现最好。