1. 对话与安全对齐
- 聊天机器人的回答需在有用性与安全性之间取得平衡,DPO 可高效引导模型遵循内容安全策略,降低违规与有害输出
2. 指令遵循与风格对齐
- 对"语气、风格、正式程度"等难以用规则表述的软性对齐目标,用偏好对"这个回答比那个好"直接引导模型学习尤为有效,适合品牌语气等场景
3. 摘要与代码生成
- 在摘要质量、代码正确性与开发者偏好对齐上,DPO 被广泛应用于开源模型的后训练
4. 合规与策略落地
- 针对特定合规要求构造"合规响应优于不合规响应"的偏好对,可直接将策略遵循融入模型,而无需复杂规则系统