冻结特征 / 首帧传播实测
DINOv3 / DINOv2 首帧 mask 视频传播完整测试
给视频第一帧的目标掩码,后面所有帧都不再给标注。一套冻结视觉模型能把目标跟到最后吗? 这次没有接入专门训练的视频分割网络,也没有根据验证集标签调阈值。我们把 DINOv3 与 DINOv2 当作冻结的稠密特征提取器,只用首帧官方实例 mask 初始化,再以局部 top-k 特征匹配传播标签。 结论:单目标视频里,这套朴素基线很强;一进入多目标实例维持,多个对象会很快被压成一个前景标签。
正式数据为 DAVIS 2017 val:30 个序列、1,999 帧。所有 J、F、J&F 均由 DAVIS 官方 semi-supervised evaluator 计算。

DINOv3 的总分为 J&F 0.289,DINOv2 为 0.260。总分只是表象,真正值得看的是单目标与多目标之间的断层。
骨干 | 全局 J&F | 单目标 13 序列 | 多目标 17 序列 |
|---|---|---|---|
DINOv3 ViT-B/16 | 0.289 | 0.821 | 0.164 |
DINOv2 ViT-B/14 | 0.260 | 0.741 | 0.147 |
DINOv3 在单目标时能做到 0.821 J&F,多目标则降到 0.164。它能持续找到前景,但不擅长维持“第几个实例”的身份。这是特征跟随与实例追踪之间最关键的差别。

dog 是 DINOv3 的最佳案例之一:J=0.881,F=0.902,J&F=0.892。

从首帧到最后一帧,目标身份没有丢。轮廓会受 patch 网格限制而变粗,但在姿态、尺度与背景变化下,“这还是那条狗”保持住了。这是冻结特征传播最有价值的工作区间:单目标、连续性强、没有复杂身份竞争。
bike-packing 里有两类目标,人和自行车。预测的大范围前景并不完全离谱,但 J&F 只有 0.269。

原因在于 DAVIS 按对象分别评分。人和车很快合并为同一个标签,第二个实例直接得到 0 分。对工业流程而言,“能抠出区域”与“能给每个零件持续编号”是两种完全不同的能力。
lab-coat 首帧有 多个实例。DINOv3 的 J&F 为 0.006,DINOv2 为 0.002。

模型不是看不见人,它仍然覆盖到了人群;失败的是实例分离与身份保持。多个标签没有被稳定保留,最终塌缩为一个共同前景。漂亮的前景叠图,不等于多实例视频分割成功。
1. 首帧读取官方实例 mask,背景为 0,目标为 1、2、3……
2. 每帧抽取 L2 归一化的 DINO patch 特征。
3. 当前 patch 只和首帧、最近 7 个预测帧的局部邻域比相似度。
4. 保留 top-5 匹配,以 temperature=0.2 做加权标签传播。
5. 放大回原图、取 argmax,保存为 DAVIS 官方评测兼容的索引 PNG。
短边固定为 480 像素;局部邻域半径为 12 patches。两种模型使用完全相同的传播参数,脚本只在每个序列开始读取 00000.png;后续标注由官方 evaluator 在预测写完后才读取。
DAVIS 不是工业缺陷数据,这组成绩不能直接当作产线 KPI。但它划出了一条很实用的工程边界。
适合放在前面的环节
单件工件的 ROI 跟随、连续采集中的粗前景提取、人工复核前的区域预标注、把单目标区域交给后续缺陷或 OCR 模块。
不适合直接承担的环节
多个相似零件的稳定 ID、遮挡后的实例一致性、逐件追溯的 OK/NG 决策、小缺陷与像素级尺寸测量。
更合理的系统分工是:DINO 特征提供通用对应和粗 ROI;专用检测器或分割器负责实例;跟踪器负责 ID;规则、几何或专用异常模型负责最终质检判定。
真正值得保留的结论
在视频里,能持续找到前景,不代表能持续保持实例身份。 单目标特征跟随可以很有用;多实例连续质检,仍需要专门的对象记忆、再识别与身份竞争机制。