首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化训练需要准备哪些前置模型和数据?

直接偏好优化训练需要准备哪些前置模型和数据?

词条归属:直接偏好优化

1. 监督微调后的策略模型

  • DPO 通常以已完成监督微调(SFT)的模型作为训练起点,该模型已具备基本的指令遵循与生成能力
  • 若使用参数高效微调(如 LoRA),参考模型可由基础模型隐式提供,无需额外加载

2. 冻结的参考模型

  • 参考模型(reference model)是 DPO 训练开始前策略模型的一份冻结副本,用于提供 KL 约束的基线对数概率
  • 全量微调时需要同时加载策略模型与参考模型(共两份模型权重);使用 LoRA 时参考即基础模型,可不单独加载

3. 偏好数据集

  • 需准备包含 prompt、chosen、rejected 三元的偏好数据集,数据质量直接影响对齐效果
  • 数据规模从数千到数百万对不等,规模门槛显著低于 RLHF
相关文章
YOLO训练策略与优化技巧:从数据准备到模型收敛
作者:HOS(安全风信子) 日期:2025-12-31 来源平台:GitHub 摘要: 本文全面剖析了YOLO系列算法的训练策略与优化技巧,从数据准备、数据增强到模型训练、损失函数设计,深入解析了YOLO训练过程中的关键环节。通过对比分析不同训练策略的优缺点,揭示了YOLO训练的最佳实践。文章详细介绍了Mosaic数据增强、Label Smoothing、Warmup策略等前沿技术,并通过实际代码示例展示了实现细节。同时,本文讨论了YOLO训练过程中常见的问题及解决方案,为研究者和工程师提供了实用的训练指导。最后,本文展望了YOLO训练技术的未来发展趋势,包括自监督学习、联邦学习、自适应训练等方向,为YOLO训练的进一步优化提供了参考。
安全风信子
2026-01-03
1.8K0
一文速览-合成数据在大模型训练和性能优化中的运用
如果你一直在跟着博主的脚步探索AI大模型的相关内容,从最初的大模型Prompt工程解析,到实际的开发部署,再到深入NL2SQL、知识图谱大模型和ChatBI等更高阶应用,应该已经感受到了我们一步一个脚印,从迈过一道道技术难关,到搭建起属于自己的技术桥梁的过程。如今,我们或许对大模型的开发已经有些轻车熟路,但也必须承认,技术的迭代速度实在太快了。要想跟上AI技术发展的步伐,把最新的人工智能技术融入现有业务和应用场景才是我们追求的最终目标。
fanstuck
2025-01-14
2.7K0
数据湖上跑模型训练?别再“豪横烧钱”了,这样优化性能和成本才靠谱
底层对象存储随便扩,算力随便开,训练集直接从湖里拉,Spark、Flink、PyTorch一通怼——爽是爽,但月底账单出来的时候,心脏也是真疼。
Echo_Wish
2026-02-26
2780
OpenAI没做到,DeepSeek搞定了!开源引爆推理革命
DeepSeek-R1的秘籍在于强化学习微调算法:群体相对策略优化(Group Relative Policy Optimization,GRPO)。
新智元
2025-05-25
7740
得物大模型平台,业务效果提升实践
得物大模型训练与推理平台上线几个月后,我们与公司内部超过 10 个业务领域展开了全面的合作。在一些关键业务指标方面,取得了显著的成效,例如:
得物技术
2023-12-27
8760
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券