首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化的核心数学原理是什么?

直接偏好优化的核心数学原理是什么?

词条归属:直接偏好优化

1. Bradley-Terry 偏好模型

  • DPO 假设人类偏好遵循 Bradley-Terry 模型:对响应 y_w 优于 y_l 的概率由两者奖励差经过 sigmoid 函数给出
  • 该模型将"偏好"转化为可优化的概率目标,是 DPO 与 RLHF 共用的偏好建模基础

2. 奖励的闭式重参数化

  • 在 KL 约束下,RLHF 的最优策略可写为 π*(y|x) ∝ π_ref(y|x)·exp(r(x,y)/β) 的闭式解
  • DPO 将上述最优策略代回 Bradley-Terry 模型并反解,得到奖励关于策略与参考模型对数的显式表达,从而把奖励"藏"进策略参数中

3. DPO 损失函数

  • DPO 的损失函数为 -log σ(β·(log(π_θ(y_w|x)/π_ref(y_w|x)) - log(π_θ(y_l|x)/π_ref(y_l|x))))
  • 该损失直接优化策略参数:增大被选响应相对参考模型的似然比,减小被拒响应的似然比;β 控制相对参考模型的偏移强度(即 KL 惩罚)

4. 隐式奖励

  • 训练过程中可定义隐式奖励 r(x,y) = β·(log π_θ(y|x) - log π_ref(y|x))
  • 若被选响应的隐式奖励高于被拒响应(reward margin > 0),说明模型已正确偏好被选响应,可据此监控对齐进度
相关文章
107_DPO:直接偏好优化
在大型语言模型(LLM)的发展历程中,如何让模型输出与人类偏好保持一致一直是研究的核心挑战。从早期的监督微调(SFT)到基于人类反馈的强化学习(RLHF),再到如今的直接偏好优化(DPO),对齐技术经历了显著的迭代与创新。
安全风信子
2025-11-16
8910
强化学习|直接偏好优化 DPO 介绍
直接偏好优化(Direct Preference Optimization DPO)的核心理论突破在于通过数学变换,将 “奖励建模 + 策略优化” 的 RLHF 关键流程,转化为直接对策略的单阶段优化,绕开了独立奖励模型的训练和高方差的强化学习梯度。本节围绕DPO主要介绍:
AI老马
2026-01-13
1.4K0
使用直接偏好优化在SageMaker AI中定制Nova模型
在某中心纽约峰会推出的Nova基础模型定制方案,提供了一套完整的模型训练生命周期管理能力。这些能力以即用型配方形式提供,涵盖预训练、监督微调和对齐等阶段。
用户11764306
2025-08-17
3310
KMP算法的数学原理(优化版)
对于一个有限自动机M,它是一个5元组(S,s₀,A,Σ,δ),S是有限状态集,s₀是初始状态(x₀∈X),A是可接受状态集(A⊆X),∑是有限输入表,δ是状态转移函数(从S×Σ到S的映射)。假定有一个模式串p="abaabcb"(长度m),待匹配字符串s="abaabaabcb"(长度n),当第5个字符'c'匹配失败时,寻常的做法是将p的索引回退到0,s的索引回退到1,再重新进行匹配。观察s与p得知:p0...4==s0...4,p0...1==p3...4=="ab",当s5与p5无法匹配时,可以尝试判断s5==p2是否成立,若成立,由前面的推论可知p0...1,2==s3...4,5,所以第5个字符匹配失败时,可以将p的索引回退到2继续进行比较,这样就无需变动s的索引,节约了计算时间,所以只要能够为状态机设计出合理的状态转移函数,就能够加速字符串的匹配。
用户10300703
2023-07-20
5650
偏好获取增强的贝叶斯优化
Elicitation-Augmented Bayesian Optimization
CreateAMind
2026-05-19
2170
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券