1. 数据规模门槛低
- DPO 可在数千到数百万对偏好数据上开展;实践中有 GPU 集群与约 1 万对偏好数据即可在数天内产出可用的领域对齐模型
- 相比 RLHF 需要专业强化学习团队与大量算力,DPO 的起步门槛显著降低
2. 算力需求适配广
- 全量微调 7B ~ 8B 级别模型通常需要多张 A100 / H100 等高端 GPU;通过 LoRA / QLoRA 配合 Unsloth 等加速,可在更小规模的设备上完成
- 对中小团队而言,DPO 让领域模型对齐从"前沿实验室专属"变为可用标准监督式流程实现的能力
3. 成本权衡
- DPO 省去了奖励模型训练与 PPO 强化学习的基础设施成本,但需承担参考模型显存;在预算有限时优先选用 LoRA 加去参考变体的组合,以平衡效果与开销