1. Hugging Face TRL
- TRL 是 Hugging Face 维护的强化学习与偏好优化库,提供 DPOTrainer,支持 sigmoid(标准 DPO)、IPO、鲁棒 DPO 等多种损失变体
- TRL 为在线 DPO(Online DPO)、GRPO 等需要在训练时在线生成的方法集成了 vLLM 以加速生成;而标准的离线 DPOTrainer 不依赖在线生成,可作为标准 Trainer 的替换组件直接用于偏好数据
2. 其他主流框架
- Axolotl、LLaMA-Factory、Unsloth 等均内置 DPO 训练能力,并在底层调用 TRL;Unsloth 通过自定义内核可将 DPO 训练提速并显著降低显存占用
- 这些框架普遍支持 LoRA / QLoRA 等参数高效微调,使 DPO 可在单卡或少量 GPU 上开展
3. 腾讯云一站式训推平台
- 腾讯云大模型训推平台 TI-ONE 提供从数据准备、模型训练、评测到部署的全流程支持,公开案例中已将其用于知识问答、交互式 Agent 等场景的 SFT / DPO 对齐训练,适合希望以托管方式开展 DPO 的企业团队