1. 监督微调后的策略模型
- DPO 通常以已完成监督微调(SFT)的模型作为训练起点,该模型已具备基本的指令遵循与生成能力
- 若使用参数高效微调(如 LoRA),参考模型可由基础模型隐式提供,无需额外加载
2. 冻结的参考模型
- 参考模型(reference model)是 DPO 训练开始前策略模型的一份冻结副本,用于提供 KL 约束的基线对数概率
- 全量微调时需要同时加载策略模型与参考模型(共两份模型权重);使用 LoRA 时参考即基础模型,可不单独加载
3. 偏好数据集
- 需准备包含 prompt、chosen、rejected 三元的偏好数据集,数据质量直接影响对齐效果
- 数据规模从数千到数百万对不等,规模门槛显著低于 RLHF