1. 偏好对的基本结构
- DPO 使用成对的偏好数据,每条样本由"提示(prompt)""被选响应(chosen)"和"被拒响应(rejected)"三部分组成
- 被选响应是人类标注者更偏好的输出,被拒响应是相对不理想的输出;模型的学习目标是提高被选响应的相对概率、降低被拒响应的相对概率
2. 数据的来源方式
- 人工标注:由标注者对同一提示下的多个候选回答进行排序或 pairwise 比较,得到"哪个更好"的判断
- 模型生成:用更强的模型对较小模型的输出打分,自动产出 chosen / rejected 对
- 规则或原则构造:依据内容安全策略、合规要求等,构造"合规响应优于不合规响应"的偏好对
3. 数据格式要求
- 标准格式包含 prompt、chosen、rejected 三个字段;对话场景可使用角色(role)与内容(content)组成的消息列表
- 数据需为成对结构;若仅有"好 / 坏"独立标注而无配对,则需使用 KTO 等支持非配对反馈的算法