1. 传统 RLHF 的流程痛点
- 基于人类反馈的强化学习(RLHF)通常包含监督微调、奖励模型训练、强化学习策略优化三个阶段,流程长且阶段间超参敏感
- 奖励模型需要单独训练与推理,计算开销大;策略优化阶段使用近端策略优化(PPO)等算法,存在训练不稳定、奖励黑客(reward hacking)与分布偏移等问题
- 对中小团队而言,搭建稳定的 RLHF 管线需要专业的强化学习工程能力与大量算力
2. DPO 的提出动机
- DPO 的提出旨在简化传统 RLHF 的对齐流程,去除显式奖励模型与在线强化学习环节
- 其核心洞察是:在 Bradley-Terry 偏好模型下,KL 约束的最优策略可以用策略模型本身以闭式表达,因此无需再单独拟合奖励模型
- 目标是让偏好对齐的训练像标准监督微调一样简单、稳定,使更多团队能够在实际生产中开展模型对齐