1. IPO(Identity Preference Optimization)
- Azar 等人于 2024 年提出,针对 DPO 依赖 Bradley-Terry 模型的假设,改用有界恒等映射与平方损失,缓解对确定性偏好的过拟合
2. ORPO(Odds Ratio Preference Optimization)
- Hong 等人于 2024 年提出,将 SFT 与偏好优化合并为单阶段,用几率比(odds ratio)惩罚项叠加在语言建模损失上
- 无需参考模型、无需单独偏好阶段,仅需一份模型权重,对算力受限团队更友好
3. SimPO(Simple Preference Optimization)
- Meng 等人于 2024 年(NeurIPS 2024)提出,用响应平均对数概率作为长度归一化的隐式奖励,彻底去除参考模型
- 显式引入目标边界 γ(典型取值 0.5 ~ 1.5),在保持竞争力的同时将显存需求较 DPO 减半
4. KTO(Kahneman-Tversky Optimization)
- Ethayarajh 等人于 2024 年提出,基于 Kahneman-Tversky 前景理论,支持"好 / 坏"独立标注的非配对反馈
- 当已有质量标注而非成对偏好时,KTO 可直接利用,降低了数据构造门槛
5. cDPO(Conservative DPO,保守 DPO)
- Mitchell 于 2023 年提出,假设偏好标签有一定概率被翻转,将损失写成"原始排序"与"反向排序"两个 DPO 损失的加权混合,等价于对偏好标签做平滑处理
- 在含噪声、标注标准不统一的偏好数据上更鲁棒,可避免少数错标样本主导训练;Hugging Face TRL 中以带标签平滑参数的鲁棒损失变体提供了类似能力
6. sDPO(Stepwise DPO,分阶段 DPO)
- Kim 等人于 2024 年提出(arXiv 2403.19270),不再一次性用完偏好数据,而是把偏好数据集切分为多份、分阶段依次训练
- 每一阶段结束后用本阶段已对齐的模型替换参考模型,使后续阶段的 KL 约束基线更贴近当前策略,从而提升最终对齐效果
7. TDPO(Token-level DPO,词元级 DPO)
- Zeng 等人于 2024 年提出(ICML 2024,arXiv 2404.11999),把 DPO 的句子级反向 KL 约束改写为逐词元(token)的马尔可夫决策过程
- 为每个词元引入前向 KL 散度约束,在保持对齐能力的同时改善生成多样性,缓解 DPO 因反向 KL 的寻模倾向带来的多样性下降
8. RPO(缩写存在歧义,需按论文区分)
- RPO 这一缩写在不同论文中指代不同方法,阅读时需结合出处判断,常见的有两种:
- 奖励感知偏好优化(Reward-aware Preference Optimization):NVIDIA 等人于 2024 年提出,在 DPO 的定性偏好("哪个更好")之外引入目标奖励模型的定量信号("好多少"),让隐式奖励去拟合显式奖励的差值
- 相对偏好优化(Relative Preference Optimization):Yin 等人于 2024 年提出(arXiv 2402.10958),通过对比同一提示与相似提示下的响应引入对比加权机制,可同时利用配对与非配对偏好数据
9. 变体演进趋势
- 整体趋势是更少模型、更少阶段、更低基础设施:从 DPO(2 份权重)到 SimPO / ORPO(1 份权重)、从配对到非配对
- 改进方向也更趋多元:除"减模型、减阶段"外,还有提升数据噪声鲁棒性(cDPO)、优化数据使用节奏(sDPO)、把优化粒度细化到词元级(TDPO)等路线
- 去参考模型在简化与省显存的同时,也弱化了 KL 锚定,需警惕奖励过优化风险,选型应结合任务与数据特点