首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化可以利用哪些开源训练框架实现?

直接偏好优化可以利用哪些开源训练框架实现?

词条归属:直接偏好优化

1. Hugging Face TRL

  • TRL 是 Hugging Face 维护的强化学习与偏好优化库,提供 DPOTrainer,支持 sigmoid(标准 DPO)、IPO、鲁棒 DPO 等多种损失变体
  • TRL 为在线 DPO(Online DPO)、GRPO 等需要在训练时在线生成的方法集成了 vLLM 以加速生成;而标准的离线 DPOTrainer 不依赖在线生成,可作为标准 Trainer 的替换组件直接用于偏好数据

2. 其他主流框架

  • Axolotl、LLaMA-Factory、Unsloth 等均内置 DPO 训练能力,并在底层调用 TRL;Unsloth 通过自定义内核可将 DPO 训练提速并显著降低显存占用
  • 这些框架普遍支持 LoRA / QLoRA 等参数高效微调,使 DPO 可在单卡或少量 GPU 上开展

3. 腾讯云一站式训推平台

  • 腾讯云大模型训推平台 TI-ONE 提供从数据准备、模型训练、评测到部署的全流程支持,公开案例中已将其用于知识问答、交互式 Agent 等场景的 SFT / DPO 对齐训练,适合希望以托管方式开展 DPO 的企业团队
相关文章
这才是真・开源模型!公开「后训练」一切,性能超越Llama 3.1 Instruct
在最近关于「Scaling Law 是否撞墙」的讨论中,后训练(post-training)被寄予厚望。
机器之心
2025-02-14
5100
得物大模型平台,业务效果提升实践
得物大模型训练与推理平台上线几个月后,我们与公司内部超过 10 个业务领域展开了全面的合作。在一些关键业务指标方面,取得了显著的成效,例如:
得物技术
2023-12-27
8760
AI-Compass RLHF人类反馈强化学习技术栈:集成TRL、OpenRLHF、veRL等框架,涵盖PPO、DPO算法实现大模型人类价值对齐
AI-Compass 致力于构建最全面、最实用、最前沿的AI技术学习和实践生态,通过六大核心模块的系统化组织,为不同层次的学习者和开发者提供从完整学习路径。
汀丶人工智能
2025-08-13
1.8K0
腾讯混元又来开源,一出手就是最大MoE大模型
随着人工智能技术的快速发展,大型语言模型(LLMs)在自然语言处理、计算机视觉和科学任务等领域取得了显著进展。然而,随着模型规模的扩大,如何在保持高性能的同时优化资源消耗成为关键挑战。为了应对这一挑战,腾讯混元团队率先采用混合专家(MoE)模型架构,最新发布的 Hunyuan-Large(Hunyuan-MoE-A52B)模型,是目前业界已经开源的基于 Transformer 的最大 MoE 模型,拥有 389B 总参数和 52B 激活参数。
机器之心
2025-02-14
2.3K0
每日论文速递 | [NeurIPS'23 Oral] DPO:Language Model 是一个 Reward Model
摘要:虽然大规模无监督语言模型(LMs)可以学习广泛的世界知识和一些推理技能,但由于其训练完全不受监督,因此很难实现对其行为的精确控制。获得这种可控性的现有方法通常是通过人类反馈强化学习(RLHF),收集人类对各代模型相对质量的标签,并根据这些偏好对无监督语言模型进行微调。然而,RLHF 是一个复杂且经常不稳定的过程,首先要拟合一个反映人类偏好的奖励模型,然后利用强化学习对大型无监督 LM 进行微调,以最大限度地提高估计奖励,同时不会偏离原始模型太远。在本文中,我们介绍了 RLHF 中奖励模型的一种新参数化方法,它能以封闭形式提取相应的最优策略,使我们只需简单的分类损失就能解决标准的 RLHF 问题。由此产生的算法我们称之为直接偏好优化(DPO),它稳定、性能好、计算量小,在微调过程中无需从 LM 中采样,也无需进行大量的超参数调整。我们的实验表明,DPO 可以对 LM 进行微调,使其与人类偏好保持一致,甚至优于现有方法。值得注意的是,使用 DPO 进行的微调在控制代际情感的能力上超过了基于 PPO 的 RLHF,并且在总结和单轮对话中达到或提高了响应质量,同时在实现和训练方面也要简单得多。
zenRRan
2024-03-25
1.8K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券