Reward Modeling Data¶
范围¶
本文档整理偏好奖励模型的数据构造经验,重点关注非模型结构层面的 recipe:数据来源、pair 构造、过滤、污染检查、偏好维度和训练格式。
已收录论文¶
| 年份 | 论文 | 核心问题 | 对数据构造的启发 |
|---|---|---|---|
| 2024 | Skywork-Reward | 小规模高质量公开偏好数据能否训练强 reward model | 80K 精筛 pair 可超过 700K 混合数据;Magpie/OffsetBias/WildGuardMix 的组合展示了通用、偏差、安全和合成数据的取舍 |
标准 pairwise 格式¶
判别式 reward model 的训练样本通常是:
训练时分别构造两条模型输入:
模型输出两个 scalar reward,用 pairwise loss 约束:
chosen/rejected 标签不应作为自然语言 judge prompt 的一部分输入模型。judge prompt 适合生成式裁判模型;对 Skywork-Reward 这种 discriminative RM,推荐使用目标 backbone 的 chat template 正常格式化对话,然后在最后 hidden state 上接 scalar reward head。
Backbone 训练方式¶
Skywork-Reward 的论文描述更接近 end-to-end reward model training:使用 instruct backbone,替换或添加 scalar reward head,然后 backbone 和 reward head 一起用 pairwise loss 训练。论文没有描述 freeze backbone,只训练 head。
常见实现选项:
| 方式 | 适用场景 | 代价 |
|---|---|---|
| 全参数训练 backbone + reward head | 追求最佳 RM 性能,接近 Skywork recipe | 显存和训练成本高 |
| LoRA/QLoRA 训练 backbone adapter + reward head | 算力受限但希望模型偏好表示可调整 | 性能依赖 rank、数据和实现 |
| freeze backbone 只训练 reward head | 快速 baseline 或特征线性探测 | 表达能力弱,通常不适合追求强 RM |
当前经验¶
- 同一个 prompt 内比较,避免跨 prompt 分数混入题目难度、领域、长度或风格偏差。
- 数据质量优先于数量。Skywork 的 80K 精筛数据超过 Preference 700K baseline。
- hard negatives 比显然错误样本更有价值,例如表面完整但事实错误、冗长但无信息、过度拒答、包含安全风险的 comply。
- 对抗偏差数据有必要加入,例如 OffsetBias 处理长度偏好等 spurious signals。
- 安全数据需要控制比例和难度。过多 adversarial refusal/compliance pair 可能提升安全分,但损害通用偏好能力。
- 合成偏好数据要记录生成模型和标注器。Magpie + ArmoRM 的流程显示,生成模型分布和 judge 偏差都会影响最终 RM。
- 污染检查应纳入数据发布流程;但污染样本移除后的性能变化需要结合偏好标准解释,不能简单等同于泄漏收益。