首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化的一次完整训练流程包含哪些步骤?

直接偏好优化的一次完整训练流程包含哪些步骤?

词条归属:直接偏好优化

1. 环境与超参配置

  • 指定策略模型、偏好数据集及 DPO 关键超参:β(KL 惩罚强度,TRL 默认 0.1)、学习率(通常远低于 SFT,全量微调约 5e-7、LoRA 约 5e-6)、训练轮次与批次大小

2. 加载策略与参考模型

  • 载入 SFT 后的策略模型作为待优化对象;参考模型加载同一 SFT 模型并冻结
  • 使用 LoRA 时可将 ref_model 设为 None,由基础模型隐式充当参考

3. 加载偏好数据

  • 载入 prompt / chosen / rejected 三元组,训练器内部完成配对批处理与分词
  • 通过 max_length 控制 prompt 与响应的拼接最大长度,通过截断模式决定保留首尾

4. 训练与损失计算

  • 每个批次对策略模型与参考模型做前向计算,得到 chosen 与 rejected 的对数概率
  • 按 DPO 损失计算梯度并更新策略参数;参考模型全程冻结不参与更新

5. 评测与保存

  • 在留存偏好集上评估奖励边界(reward margin)与偏好准确率(reward accuracy),确认对齐提升后保存模型或适配器
  • 对齐后的模型可直接用于推理,或作为后续训练阶段的输入
相关文章
零门槛复现ChatGPT:预训练模型数据集直接用,包含完整RLHF流程,在线可体验
明敏 发自 凹非寺 量子位 | 公众号 QbitAI 这边ChatGPT、GPT-4等AI大模型和应用打得火热; 另一边“平替”开源复现方案也加紧更新迭代。 这不,“首个开源ChatGPT低成本复现流程”就来了波大更新! 现在,仅需不到百亿参数,利用RLHF简单微调,模型即可掌握中、英双语能力,达到与ChatGPT和GPT-3.5相当的效果。 中文对话效果如下: 这就是ColossalChat。 由Colossal-AI推出。一个月前,Colossal-AI乘着ChatGPT热潮火速开源了低成本复现流程。
量子位
2023-04-06
1.3K0
AI Agent Skill 科普
这些"不可控"的行为,让很多人对 AI 不能完全放手去用,今天,我就来详细聊聊AI Agent Skill 这个让AI变"听话"的工具。
用户1278550
2026-03-10
1.6K0
大模型对齐核心技术拆解:详解RLHF强化学习、PPO优化、DPO偏好对齐的差异与实践22.3
在日常使用大模型的过程中,很多人都会遇到一类典型问题:模型本身储备的知识足够全面,但输出的回答往往生硬冗长、重点模糊,甚至频繁出现内容幻觉、答非所问等问题,无法贴合人类的对话逻辑与使用习惯。这类问题并非源于预训练阶段的知识训练不足,核心原因是模型未完成人类偏好对齐优化。
未闻花名
2026-09-12
1781
大模型的能力究竟从何而来?训练、推理、Reasoning、Tools、Agent:一篇文章理清大模型全链路
OpenAI 的 GPT 系列、Anthropic 的 Claude、Google 的 Gemini,国内的 DeepSeek、Qwen,以及 xAI 的 Grok,都在不断推出新模型。竞争重点也从最早的语言和知识能力,快速扩展到 Reasoning、代码、长上下文、工具调用和 Agent。
数据呼吸Lex
2026-08-20
2780
每日论文速递 | [NeurIPS'23 Oral] DPO:Language Model 是一个 Reward Model
摘要:虽然大规模无监督语言模型(LMs)可以学习广泛的世界知识和一些推理技能,但由于其训练完全不受监督,因此很难实现对其行为的精确控制。获得这种可控性的现有方法通常是通过人类反馈强化学习(RLHF),收集人类对各代模型相对质量的标签,并根据这些偏好对无监督语言模型进行微调。然而,RLHF 是一个复杂且经常不稳定的过程,首先要拟合一个反映人类偏好的奖励模型,然后利用强化学习对大型无监督 LM 进行微调,以最大限度地提高估计奖励,同时不会偏离原始模型太远。在本文中,我们介绍了 RLHF 中奖励模型的一种新参数化方法,它能以封闭形式提取相应的最优策略,使我们只需简单的分类损失就能解决标准的 RLHF 问题。由此产生的算法我们称之为直接偏好优化(DPO),它稳定、性能好、计算量小,在微调过程中无需从 LM 中采样,也无需进行大量的超参数调整。我们的实验表明,DPO 可以对 LM 进行微调,使其与人类偏好保持一致,甚至优于现有方法。值得注意的是,使用 DPO 进行的微调在控制代际情感的能力上超过了基于 PPO 的 RLHF,并且在总结和单轮对话中达到或提高了响应质量,同时在实现和训练方面也要简单得多。
zenRRan
2024-03-25
1.8K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券