首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化是如何从 RLHF 的奖励模型中推导出来的?

直接偏好优化是如何从 RLHF 的奖励模型中推导出来的?

词条归属:直接偏好优化

1. 从 RLHF 目标出发

  • 标准 RLHF 先训练奖励模型 r,再优化策略以最大化期望奖励并受 KL 约束:ℓ(φ) = -E[ r*(x,y) - β·log(π_φ(y|x)/π_SFT(y|x)) ]
  • 其最优策略满足 π*(y|x) = (1/Z(x))·π_SFT(y|x)·exp(r*(x,y)/β)

2. 代入偏好模型反解奖励

  • DPO 将上式解出 r*(x,y),代回 Bradley-Terry 偏好概率表达式
  • 经过整理,原本依赖奖励模型的偏好概率,被完全用策略模型 π_θ 与参考模型 π_ref 的对数似然比表示

3. 得到等价监督损失

  • 由此得到一个仅依赖偏好对数据的分类损失,与 RLHF 在理论假设下具有相同的最优策略
  • 关键结论是"你的语言模型本身就是奖励模型":无需显式奖励模型,直接用偏好对优化策略参数即可
相关文章
大语言模型中的 RLHF:强化学习如何优化 AI 交互体验
近年来,大语言模型(Large Language Model, LLM)取得了突破性的进展,GPT-3、GPT-4 以及其他基于 Transformer 架构的模型在自然语言处理(NLP)任务中展现出卓越的性能。然而,尽管这些模型具备强大的生成能力,它们的输出仍然可能存在不符合人类期望的情况,比如生成误导性信息、带有偏见的内容,或者在对话中缺乏连贯性。
编程小妖女
2025-02-03
1.5K0
从RLHF到DPO再到TDPO,大模型对齐算法已经是「token-level」
在人工智能领域的发展过程中,对大语言模型(LLM)的控制与指导始终是核心挑战之一,旨在确保这些模型既强大又安全地服务于人类社会。早期的努力集中于通过人类反馈的强化学习方法(RLHF)来管理这些模型,成效显著,标志着向更加人性化 AI 迈出的关键一步。
机器之心
2024-06-27
1.4K0
强化学习|直接偏好优化 DPO 介绍
直接偏好优化(Direct Preference Optimization DPO)的核心理论突破在于通过数学变换,将 “奖励建模 + 策略优化” 的 RLHF 关键流程,转化为直接对策略的单阶段优化,绕开了独立奖励模型的训练和高方差的强化学习梯度。本节围绕DPO主要介绍:
AI老马
2026-01-13
1.4K0
最新综述:基于反馈的强化学习
基于人类反馈的强化学习(RLHF)已成为部署最新机器学习系统的重要技术和叙事工具。在本书中,我们希望为具备一定量化背景的读者提供对核心方法的简明介绍。本书首先回顾RLHF的起源——既包括近期文献中的发展,也涵盖经济学、哲学和最优控制等不同科学领域的交汇融合。随后,我们将介绍相关定义、问题建模、数据收集以及文献中常用的数学基础,为后续内容奠定基础。最后,我们将详细介绍当前流行的RLHF算法,并探讨该领域未来的发展方向。
CreateAMind
2026-03-11
8870
斯坦福提出对比偏好学习:无需强化学习即可从人类反馈中学习
在模型与人类意图对齐方面,根据人类反馈的强化学习(RLHF)已经成为一大流行范式。通常来说,RLHF 算法的工作过程分为两个阶段:一、使用人类偏好学习一个奖励函数;二、通过使用强化学习优化所学习的奖励来对齐模型。
机器之心
2023-11-13
9220
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券