直接偏好优化在代码生成和指令遵循任务上的表现如何?
1. 指令遵循
- DPO 在指令遵循任务上表现稳定,能有效提升模型对命令、约束与格式要求的遵从度,是开源模型后训练中的常用手段
2. 代码生成对齐
- 在代码生成场景,DPO 借助开发者偏好(正确性、可读性、风格)对齐输出质量,被广泛应用于开源模型的对齐训练
- 公开实践中,Llama-3 等模型将 DPO 作为后训练对齐的核心手段(Meta 在 Llama 3 后训练中采用 DPO);以 Mistral-7B 为底座的开源对齐模型 Zephyr-7B 同样以 DPO 为核心对齐方法
3. 能力边界
- DPO 提升的是"偏好对齐"层面,对模型固有知识或推理能力的增强有限;需要能力提升时应结合继续预训练或强化学习类方法