直接偏好优化与单纯的监督微调(SFT)有什么区别?
1. 学习目标不同
- SFT 让模型模仿示范回答,学习"什么样的回答长这样";DPO 让模型在成对回答中区分"哪个更好",学习相对偏好
- 二者常前后衔接:先 SFT 获得基础能力,再用 DPO 做偏好对齐
2. 数据形态不同
- SFT 使用(提示,回答)的单样本;DPO 使用(提示,被选,被拒)的成对样本,信息密度更高
- 仅靠 SFT 会同时抬高被选与被拒回答的概率,需用 DPO 的偏好惩罚加以区分
3. 能力侧重
- SFT 奠定基础能力与格式遵从;DPO 负责把"有用、安全、合意"的偏好注入模型,二者互补而非替代