跳转至

Reward Modeling Data

范围

本文档整理偏好奖励模型的数据构造经验,重点关注非模型结构层面的 recipe:数据来源、pair 构造、过滤、污染检查、偏好维度和训练格式。

已收录论文

年份 论文 核心问题 对数据构造的启发
2024 Skywork-Reward 小规模高质量公开偏好数据能否训练强 reward model 80K 精筛 pair 可超过 700K 混合数据;Magpie/OffsetBias/WildGuardMix 的组合展示了通用、偏差、安全和合成数据的取舍

标准 pairwise 格式

判别式 reward model 的训练样本通常是:

{
  "prompt": "用户问题或多轮对话上下文",
  "chosen": "更好的回答",
  "rejected": "更差的回答"
}

训练时分别构造两条模型输入:

prompt + chosen
prompt + rejected

模型输出两个 scalar reward,用 pairwise loss 约束:

score(prompt, chosen) > score(prompt, rejected)

chosen/rejected 标签不应作为自然语言 judge prompt 的一部分输入模型。judge prompt 适合生成式裁判模型;对 Skywork-Reward 这种 discriminative RM,推荐使用目标 backbone 的 chat template 正常格式化对话,然后在最后 hidden state 上接 scalar reward head。

Backbone 训练方式

Skywork-Reward 的论文描述更接近 end-to-end reward model training:使用 instruct backbone,替换或添加 scalar reward head,然后 backbone 和 reward head 一起用 pairwise loss 训练。论文没有描述 freeze backbone,只训练 head。

常见实现选项:

方式 适用场景 代价
全参数训练 backbone + reward head 追求最佳 RM 性能,接近 Skywork recipe 显存和训练成本高
LoRA/QLoRA 训练 backbone adapter + reward head 算力受限但希望模型偏好表示可调整 性能依赖 rank、数据和实现
freeze backbone 只训练 reward head 快速 baseline 或特征线性探测 表达能力弱,通常不适合追求强 RM

当前经验

  • 同一个 prompt 内比较,避免跨 prompt 分数混入题目难度、领域、长度或风格偏差。
  • 数据质量优先于数量。Skywork 的 80K 精筛数据超过 Preference 700K baseline。
  • hard negatives 比显然错误样本更有价值,例如表面完整但事实错误、冗长但无信息、过度拒答、包含安全风险的 comply。
  • 对抗偏差数据有必要加入,例如 OffsetBias 处理长度偏好等 spurious signals。
  • 安全数据需要控制比例和难度。过多 adversarial refusal/compliance pair 可能提升安全分,但损害通用偏好能力。
  • 合成偏好数据要记录生成模型和标注器。Magpie + ArmoRM 的流程显示,生成模型分布和 judge 偏差都会影响最终 RM。
  • 污染检查应纳入数据发布流程;但污染样本移除后的性能变化需要结合偏好标准解释,不能简单等同于泄漏收益。