直接偏好优化是如何从 RLHF 的奖励模型中推导出来的?
1. 从 RLHF 目标出发
- 标准 RLHF 先训练奖励模型 r,再优化策略以最大化期望奖励并受 KL 约束:ℓ(φ) = -E[ r*(x,y) - β·log(π_φ(y|x)/π_SFT(y|x)) ]
- 其最优策略满足 π*(y|x) = (1/Z(x))·π_SFT(y|x)·exp(r*(x,y)/β)
2. 代入偏好模型反解奖励
- DPO 将上式解出 r*(x,y),代回 Bradley-Terry 偏好概率表达式
- 经过整理,原本依赖奖励模型的偏好概率,被完全用策略模型 π_θ 与参考模型 π_ref 的对数似然比表示
3. 得到等价监督损失
- 由此得到一个仅依赖偏好对数据的分类损失,与 RLHF 在理论假设下具有相同的最优策略
- 关键结论是"你的语言模型本身就是奖励模型":无需显式奖励模型,直接用偏好对优化策略参数即可