直接偏好优化与 RLHF(PPO)的主要区别是什么?
1. 训练阶段与组件
- RLHF(PPO)需 SFT、奖励模型、强化学习三阶段,训练时通常同时维护策略模型、目标策略、奖励模型与参考模型四份模型
- DPO 仅单阶段,无需奖励模型,只需策略模型与冻结参考模型两份权重
2. 优化方式与稳定性
- RLHF 依赖在线强化学习动态,存在不稳定、奖励黑客与分布偏移风险;DPO 用标准监督损失直接优化,更稳定、超参更鲁棒
3. 算力与门槛
- RLHF 计算与工程开销大,适合前沿大模型的大规模对齐;DPO 省去奖励模型与 PPO 管线,训练更轻、更快,更适合领域微调与中小团队
4. 灵活性取舍
- RLHF 可接入任意奖励信号并独立更新奖励模型,灵活性更高;DPO 以灵活性换取稳定与简洁,两者在理论上具有相同的最优策略假设