1. 训练显存与参考模型
- 全量 DPO 训练需同时驻留策略模型与参考模型,显存约为单模型的两倍;改用 LoRA 可让参考由基础模型隐式提供,显著降低开销
- SimPO、ORPO 等去参考模型变体可进一步减半显存
2. 推理侧无额外成本
- DPO 仅在训练阶段引入参考模型,对齐后的模型在推理时就是普通语言模型,不增加任何在线推理开销
- 因此 DPO 的成本主要体现在训练与数据准备,部署侧与 SFT 模型一致
3. 部署与评测闭环
- 对齐后建议接入三阶段评测(轻量体验、客观、主观)再发布为推理服务,并保留迭代能力以便持续修正对齐问题