1. 核心训练指标
- 监控隐式奖励边界(reward margin)与偏好准确率(reward accuracy):边界应逐步增大,准确率应趋近 1.0
- 同时观察 chosen / rejected 各自的隐式奖励走势,判断模型是否在正确拉开两者差距
2. 留存集与人工评测
- 在留存的偏好集上验证对齐提升,并结合人工或更强模型评测,确认有用性、安全性未被牺牲
- 对具体任务可用 AlpacaEval、Arena-Hard 等基准衡量胜率变化
3. 防退化检查
- 关注参考模型偏离度(由 β 控制),避免因 KL 惩罚过弱导致策略漂移或过拟合;出现退化时回调 β 或加强数据质量