1. Bradley-Terry 偏好模型
- DPO 假设人类偏好遵循 Bradley-Terry 模型:对响应 y_w 优于 y_l 的概率由两者奖励差经过 sigmoid 函数给出
- 该模型将"偏好"转化为可优化的概率目标,是 DPO 与 RLHF 共用的偏好建模基础
2. 奖励的闭式重参数化
- 在 KL 约束下,RLHF 的最优策略可写为 π*(y|x) ∝ π_ref(y|x)·exp(r(x,y)/β) 的闭式解
- DPO 将上述最优策略代回 Bradley-Terry 模型并反解,得到奖励关于策略与参考模型对数的显式表达,从而把奖励"藏"进策略参数中
3. DPO 损失函数
- DPO 的损失函数为 -log σ(β·(log(π_θ(y_w|x)/π_ref(y_w|x)) - log(π_θ(y_l|x)/π_ref(y_l|x))))
- 该损失直接优化策略参数:增大被选响应相对参考模型的似然比,减小被拒响应的似然比;β 控制相对参考模型的偏移强度(即 KL 惩罚)
4. 隐式奖励
- 训练过程中可定义隐式奖励 r(x,y) = β·(log π_θ(y|x) - log π_ref(y|x))
- 若被选响应的隐式奖励高于被拒响应(reward margin > 0),说明模型已正确偏好被选响应,可据此监控对齐进度