首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化与单纯的监督微调(SFT)有什么区别?

直接偏好优化与单纯的监督微调(SFT)有什么区别?

词条归属:直接偏好优化

1. 学习目标不同

  • SFT 让模型模仿示范回答,学习"什么样的回答长这样";DPO 让模型在成对回答中区分"哪个更好",学习相对偏好
  • 二者常前后衔接:先 SFT 获得基础能力,再用 DPO 做偏好对齐

2. 数据形态不同

  • SFT 使用(提示,回答)的单样本;DPO 使用(提示,被选,被拒)的成对样本,信息密度更高
  • 仅靠 SFT 会同时抬高被选与被拒回答的概率,需用 DPO 的偏好惩罚加以区分

3. 能力侧重

  • SFT 奠定基础能力与格式遵从;DPO 负责把"有用、安全、合意"的偏好注入模型,二者互补而非替代
相关文章
深度拆解 LLM 训练三阶段:为什么 AI 能像人一样对话?
做AI入行这么久,经常被新手问一个灵魂问题:明明大模型只是一堆冰冷的参数矩阵,既没有大脑也没有思维,为什么现在能流畅聊天、懂逻辑推理、还能恪守底线不乱说话?
虫无涯
2026-05-26
5040
大语言模型训练范式入门课:LLM都是如何训练出来的?干货满满,一文讲清楚!
PPO(Proximal Policy Optimization,近端策略优化) 和 DPO (Direct Preference Optimization,直接偏好优化) 的核心区别在于训练范式、流程复杂度和适用场景,简单总结如下:
烟雨平生
2026-04-14
1.1K0
深度解析DPO及其变体在多种任务上的表现如何,该如何选择
今天,我要带大家深入了解一项关于大型语言模型(LLMs)的研究,这是由亚利桑那州立大学的Amir Saeidi、Shivanshu Verma和Chitta Baral三位专家带来的前沿成果。他们的最新论文《Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks》为我们揭开了直接偏好优化(DPO)及其衍生方法的神秘面纱,这些方法在优化模型以符合人类偏好方面展现出了巨大潜力。
zenRRan
2024-05-11
3.1K0
RLHF三大挑战与突围之路:如何让大模型更懂人类偏好?
预训练(Pre-training):利用数十亿到数万亿个token的庞大文本语料库对模型继续预训练,使模型能够根据提供的文本来预测「下一个单词」
智谷星瀚
2025-12-17
1.5K1
专访|罗长才:拆解大模型训练全链路,剖析预训练、微调体系对GEO落地的底层赋能逻辑
采访时间:2026 年 7 月 受访人:罗长才,GEO 落地工程师,长期深耕生成式引擎优化工程落地、大模型适配改造、知识结构化治理全流程实践,主导多套垂直场景 GEO 技术架构搭建与落地验证工作
罗长才
2026-07-04
3150
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券