传统监督学习依赖大量标注的真实/伪造数据集,容易对特定伪造技术过拟合,面对从未见过的新伪造方法时准确率大幅下降。自监督学习仅用真实视频训练,不接触实际深度伪造样本,因此对新伪造技术更鲁棒。
以自监督音视频方法为例,模型在大量真实视频上预训练,学习从音频预测对应的自然面部运动参数(如 FLAME 模型用 53 个参数表示面部表情)。检测时比对视频中实际面部运动与音频预测的运动,显著偏差即为伪造迹象。
自监督方法在多个基准数据集上实现了超过 95% 的平均检测准确率,并在面对新型视频生成模型伪造的内容时仍保持较高检出率,克服了早期自监督方法准确率偏低的短板。
基于面部运动分析的自监督方法对图像压缩、噪声等失真更具鲁棒性,但通常需要大规模预训练和较强算力,目前尚不适用于实时场景。