1. 长度偏差
- DPO 倾向于偏好更长的响应,即使质量相当也更可能提升长回答的概率,可能与真实偏好(质量)错位
2. 分布偏移
- DPO 为离线算法,偏好数据若与当前策略的实际输出分布差异过大,会导致对齐质量下降;在线 DPO 等变体通过持续在策略输出上收集偏好来缓解
3. 数据依赖与过拟合
- DPO 需要成对偏好数据,且对有限、确定性偏好数据容易过拟合;IPO 等变体通过有界损失缓解此问题
- 偏好数据的质量直接决定对齐上限,"垃圾进、垃圾出"问题依然存在
4. 灵活性受限
- 相比 RLHF(PPO)可接入任意奖励信号并独立更新奖励模型,DPO 牺牲了部分灵活性以换取稳定与简洁