如何用更强大的模型自动生成直接偏好优化所需的偏好对?
1. 模型评判生成偏好
- 用能力更强的模型(如更大规模或更强对齐的模型)对较小模型的多条输出打分或排序,自动产出 chosen / rejected 对
- 这种方式可大幅减少人工标注成本,同时保持数据质量
2. 合成数据的工作流
- 先由待对齐模型对同一提示采样多条候选,再交由强模型判定优劣并构建偏好对,最后用 DPO 微调原模型
- 该流程使团队能针对特定失败模式快速迭代对齐修正,在数小时内完成一轮纠偏微调
3. 质量与偏差控制
- 合成偏好需防范强模型的系统性偏差(如偏好更长回答)被放大;应通过多样化提示、质量筛选与长度控制保证数据真实反映人类偏好