直接偏好优化(Direct Preference Optimization,简称 DPO)是一种用于大语言模型对齐的训练方法,由 Rafailov 等人在 2023 年提出。它通过直接利用人类偏好数据调整模型参数,绕过显式奖励模型的拟合与复杂的强化学习优化过程,使模型输出更符合人类偏好。与基于人类反馈的强化学习(RLHF)相比,DPO 无需训练独立的奖励模型,而是将奖励函数重新参数化为策略模型本身,把对齐问题转化为一个标准的监督式分类损失,从而降低训练复杂度、提升稳定性并减少算力开销。DPO 已被广泛应用于指令遵循、对话安全、摘要生成与代码对齐等场景。