1. 环境与超参配置
- 指定策略模型、偏好数据集及 DPO 关键超参:β(KL 惩罚强度,TRL 默认 0.1)、学习率(通常远低于 SFT,全量微调约 5e-7、LoRA 约 5e-6)、训练轮次与批次大小
2. 加载策略与参考模型
- 载入 SFT 后的策略模型作为待优化对象;参考模型加载同一 SFT 模型并冻结
- 使用 LoRA 时可将 ref_model 设为 None,由基础模型隐式充当参考
3. 加载偏好数据
- 载入 prompt / chosen / rejected 三元组,训练器内部完成配对批处理与分词
- 通过 max_length 控制 prompt 与响应的拼接最大长度,通过截断模式决定保留首尾
4. 训练与损失计算
- 每个批次对策略模型与参考模型做前向计算,得到 chosen 与 rejected 的对数概率
- 按 DPO 损失计算梯度并更新策略参数;参考模型全程冻结不参与更新
5. 评测与保存
- 在留存偏好集上评估奖励边界(reward margin)与偏好准确率(reward accuracy),确认对齐提升后保存模型或适配器
- 对齐后的模型可直接用于推理,或作为后续训练阶段的输入