首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化是为了解决什么对齐问题提出的?

直接偏好优化是为了解决什么对齐问题提出的?

词条归属:直接偏好优化

1. 传统 RLHF 的流程痛点

  • 基于人类反馈的强化学习RLHF)通常包含监督微调、奖励模型训练、强化学习策略优化三个阶段,流程长且阶段间超参敏感
  • 奖励模型需要单独训练与推理,计算开销大;策略优化阶段使用近端策略优化(PPO)等算法,存在训练不稳定、奖励黑客(reward hacking)与分布偏移等问题
  • 对中小团队而言,搭建稳定的 RLHF 管线需要专业的强化学习工程能力与大量算力

2. DPO 的提出动机

  • DPO 的提出旨在简化传统 RLHF 的对齐流程,去除显式奖励模型与在线强化学习环节
  • 其核心洞察是:在 Bradley-Terry 偏好模型下,KL 约束的最优策略可以用策略模型本身以闭式表达,因此无需再单独拟合奖励模型
  • 目标是让偏好对齐的训练像标准监督微调一样简单、稳定,使更多团队能够在实际生产中开展模型对齐
相关文章
内存数据库中的自动优化是为了解决什么问题?
入库过程后的自动优化,是为了解决传统分布式数据库甚至Hadoop平台也非常常见的:在用户使用一段时间后,发现如果没有对数据库的存储进行人工定时维护,则会引起性能大幅下降的问题。
定向
2022-08-31
5760
这些框架技术的出现都是为了解决什么问题?
这个世界上有各种各样的框架,设计这些五花八门框架的初衷到底是什么?我们该不该学习框架,该如何学习使用这些框架?
用户8639654
2021-07-22
6730
AlignRAG:浙江大学提出的可泛化推理对齐框架,助力 RAG 系统解决推理失配问题
近年来,检索增强生成(Retrieval-Augmented Generation, RAG)成为知识驱动文本生成的核心范式。然而,现有的 RAG 系统在推理过程中常常出现“推理失配”问题,即模型的推理路径与检索到的证据不一致,导致生成内容与事实不符,甚至产生幻觉信息。这种失配在需要精确知识支撑的任务中尤为严重,影响了大模型的可靠性和实用性。
AgenticAI
2025-04-23
3980
什么是零样本学习?为什么好的Prompt能让AI直接解决问题?
🚀 本文收录于Github:AI-From-Zero 项目 —— 一个从零开始系统学习 AI 的知识库。如果觉得有帮助,欢迎 ⭐ Star 支持!
ETL 小当家
2026-03-17
4180
每日论文速递 | [COLING'24] 探索数据多样性对LLM对齐的影响
摘要:与人类偏好对齐可以防止大型语言模型(LLMs)产生误导性或有毒内容,但同时需要高成本的人类反馈。假设人工标注的资源有限,可以考虑两种不同的分配方式:标注更多样化的 "指令"(PROMPTS)或更多样化的 "回应"(RESPONSES)。然而,这两种方式的影响还没有直接的比较。在这项工作中,我们首先根据样本数量控制双方的多样性,以便进行微调,这可以直接反映出它们的影响。我们发现,对于人类对齐而言,更多的response和更少的提示反而能更好地触发 LLM。此外,提示语多样性的概念可能比通常以个位数量化的回答更为复杂。因此,我们提出了一种新的提示多样性表述方式,进一步揭示了微调后 LLM 的最终性能与提示多样性呈线性相关。我们还将其用于数据增强,并通过实验展示其对不同算法的影响。
zenRRan
2024-04-11
6670
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券