首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化有哪些主流变体?

直接偏好优化有哪些主流变体?

词条归属:直接偏好优化

1. IPO(Identity Preference Optimization)

  • Azar 等人于 2024 年提出,针对 DPO 依赖 Bradley-Terry 模型的假设,改用有界恒等映射与平方损失,缓解对确定性偏好的过拟合

2. ORPO(Odds Ratio Preference Optimization)

  • Hong 等人于 2024 年提出,将 SFT 与偏好优化合并为单阶段,用几率比(odds ratio)惩罚项叠加在语言建模损失上
  • 无需参考模型、无需单独偏好阶段,仅需一份模型权重,对算力受限团队更友好

3. SimPO(Simple Preference Optimization)

  • Meng 等人于 2024 年(NeurIPS 2024)提出,用响应平均对数概率作为长度归一化的隐式奖励,彻底去除参考模型
  • 显式引入目标边界 γ(典型取值 0.5 ~ 1.5),在保持竞争力的同时将显存需求较 DPO 减半

4. KTO(Kahneman-Tversky Optimization)

  • Ethayarajh 等人于 2024 年提出,基于 Kahneman-Tversky 前景理论,支持"好 / 坏"独立标注的非配对反馈
  • 当已有质量标注而非成对偏好时,KTO 可直接利用,降低了数据构造门槛

5. cDPO(Conservative DPO,保守 DPO)

  • Mitchell 于 2023 年提出,假设偏好标签有一定概率被翻转,将损失写成"原始排序"与"反向排序"两个 DPO 损失的加权混合,等价于对偏好标签做平滑处理
  • 在含噪声、标注标准不统一的偏好数据上更鲁棒,可避免少数错标样本主导训练;Hugging Face TRL 中以带标签平滑参数的鲁棒损失变体提供了类似能力

6. sDPO(Stepwise DPO,分阶段 DPO)

  • Kim 等人于 2024 年提出(arXiv 2403.19270),不再一次性用完偏好数据,而是把偏好数据集切分为多份、分阶段依次训练
  • 每一阶段结束后用本阶段已对齐的模型替换参考模型,使后续阶段的 KL 约束基线更贴近当前策略,从而提升最终对齐效果

7. TDPO(Token-level DPO,词元级 DPO)

  • Zeng 等人于 2024 年提出(ICML 2024,arXiv 2404.11999),把 DPO 的句子级反向 KL 约束改写为逐词元(token)的马尔可夫决策过程
  • 为每个词元引入前向 KL 散度约束,在保持对齐能力的同时改善生成多样性,缓解 DPO 因反向 KL 的寻模倾向带来的多样性下降

8. RPO(缩写存在歧义,需按论文区分)

  • RPO 这一缩写在不同论文中指代不同方法,阅读时需结合出处判断,常见的有两种:
  • 奖励感知偏好优化(Reward-aware Preference Optimization):NVIDIA 等人于 2024 年提出,在 DPO 的定性偏好("哪个更好")之外引入目标奖励模型的定量信号("好多少"),让隐式奖励去拟合显式奖励的差值
  • 相对偏好优化(Relative Preference Optimization):Yin 等人于 2024 年提出(arXiv 2402.10958),通过对比同一提示与相似提示下的响应引入对比加权机制,可同时利用配对与非配对偏好数据

9. 变体演进趋势

  • 整体趋势是更少模型、更少阶段、更低基础设施:从 DPO(2 份权重)到 SimPO / ORPO(1 份权重)、从配对到非配对
  • 改进方向也更趋多元:除"减模型、减阶段"外,还有提升数据噪声鲁棒性(cDPO)、优化数据使用节奏(sDPO)、把优化粒度细化到词元级(TDPO)等路线
  • 去参考模型在简化与省显存的同时,也弱化了 KL 锚定,需警惕奖励过优化风险,选型应结合任务与数据特点
相关文章
107_DPO:直接偏好优化
在大型语言模型(LLM)的发展历程中,如何让模型输出与人类偏好保持一致一直是研究的核心挑战。从早期的监督微调(SFT)到基于人类反馈的强化学习(RLHF),再到如今的直接偏好优化(DPO),对齐技术经历了显著的迭代与创新。
安全风信子
2025-11-16
8910
强化学习|直接偏好优化 DPO 介绍
直接偏好优化(Direct Preference Optimization DPO)的核心理论突破在于通过数学变换,将 “奖励建模 + 策略优化” 的 RLHF 关键流程,转化为直接对策略的单阶段优化,绕开了独立奖励模型的训练和高方差的强化学习梯度。本节围绕DPO主要介绍:
AI老马
2026-01-13
1.4K0
使用直接偏好优化在SageMaker AI中定制Nova模型
在某中心纽约峰会推出的Nova基础模型定制方案,提供了一套完整的模型训练生命周期管理能力。这些能力以即用型配方形式提供,涵盖预训练、监督微调和对齐等阶段。
用户11764306
2025-08-17
3310
主流的深度学习模型有哪些?
作者:阿萨姆 | 普华永道 数据科学家 量子位 已获授权编辑发布 转载请联系原作者 深度学习大热以后各种模型层出不穷,很多朋友都在问到底什么是DNN、CNN和RNN,这么多个网络到底有什么不同,作用各是什么? 趁着回答《深度学习的主要分类是什么呀?这些网络cnn dbn dnm rnn是怎样的关系?》这个问题的机会,我也想介绍一下主流的神经网络模型。因为格式问题和传播原因,我把原回答内容在这篇文章中再次向大家介绍。 在更详细的介绍各种网络前,首先说明: 大部分神经网络都可以用深度(depth)和连接结构(c
量子位
2018-03-26
3.2K0
⽬前 主流的开源模型体系 有哪些?
目前主流的开源大语言模型(LLM)体系和生态主要可以分为几个方向,从模型研发主体和技术路线来看,大致如下(截至 2024 年):
福大大架构师每日一题
2025-12-19
2.7K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券