首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >同一套视觉特征,单目标能跟 多目标为什么会失忆?DINOv3 / DINOv2 首帧 mask 视频传播完整测试

同一套视觉特征,单目标能跟 多目标为什么会失忆?DINOv3 / DINOv2 首帧 mask 视频传播完整测试

作者头像
javpower
发布2026-07-29 20:21:30
发布2026-07-29 20:21:30
70
举报

冻结特征 / 首帧传播实测

同一套视觉特征,单目标能跟 多目标为什么会失忆?

DINOv3 / DINOv2 首帧 mask 视频传播完整测试

给视频第一帧的目标掩码,后面所有帧都不再给标注。一套冻结视觉模型能把目标跟到最后吗? 这次没有接入专门训练的视频分割网络,也没有根据验证集标签调阈值。我们把 DINOv3 与 DINOv2 当作冻结的稠密特征提取器,只用首帧官方实例 mask 初始化,再以局部 top-k 特征匹配传播标签。 结论:单目标视频里,这套朴素基线很强;一进入多目标实例维持,多个对象会很快被压成一个前景标签。

先看成绩

正式数据为 DAVIS 2017 val:30 个序列、1,999 帧。所有 J、F、J&F 均由 DAVIS 官方 semi-supervised evaluator 计算。

DINOv3 的总分为 J&F 0.289,DINOv2 为 0.260。总分只是表象,真正值得看的是单目标与多目标之间的断层。

总分掩盖了什么?

骨干

全局 J&F

单目标 13 序列

多目标 17 序列

DINOv3 ViT-B/16

0.289

0.821

0.164

DINOv2 ViT-B/14

0.260

0.741

0.147

DINOv3 在单目标时能做到 0.821 J&F,多目标则降到 0.164。它能持续找到前景,但不擅长维持“第几个实例”的身份。这是特征跟随与实例追踪之间最关键的差别。

成功案例:一条狗能从头跟到尾

dog 是 DINOv3 的最佳案例之一:J=0.881,F=0.902,J&F=0.892。

从首帧到最后一帧,目标身份没有丢。轮廓会受 patch 网格限制而变粗,但在姿态、尺度与背景变化下,“这还是那条狗”保持住了。这是冻结特征传播最有价值的工作区间:单目标、连续性强、没有复杂身份竞争

中等案例:人和自行车变成同一个标签

bike-packing 里有两类目标,人和自行车。预测的大范围前景并不完全离谱,但 J&F 只有 0.269。

原因在于 DAVIS 按对象分别评分。人和车很快合并为同一个标签,第二个实例直接得到 0 分。对工业流程而言,“能抠出区域”与“能给每个零件持续编号”是两种完全不同的能力。

失败案例:多个人变成一个前景

lab-coat 首帧有 多个实例。DINOv3 的 J&F 为 0.006,DINOv2 为 0.002。

模型不是看不见人,它仍然覆盖到了人群;失败的是实例分离与身份保持。多个标签没有被稳定保留,最终塌缩为一个共同前景。漂亮的前景叠图,不等于多实例视频分割成功。

它到底怎么跑?

1. 首帧读取官方实例 mask,背景为 0,目标为 1、2、3……

2. 每帧抽取 L2 归一化的 DINO patch 特征。

3. 当前 patch 只和首帧、最近 7 个预测帧的局部邻域比相似度。

4. 保留 top-5 匹配,以 temperature=0.2 做加权标签传播。

5. 放大回原图、取 argmax,保存为 DAVIS 官方评测兼容的索引 PNG。

短边固定为 480 像素;局部邻域半径为 12 patches。两种模型使用完全相同的传播参数,脚本只在每个序列开始读取 00000.png;后续标注由官方 evaluator 在预测写完后才读取。

对工业视觉有什么意义?

DAVIS 不是工业缺陷数据,这组成绩不能直接当作产线 KPI。但它划出了一条很实用的工程边界。

适合放在前面的环节

单件工件的 ROI 跟随、连续采集中的粗前景提取、人工复核前的区域预标注、把单目标区域交给后续缺陷或 OCR 模块。

不适合直接承担的环节

多个相似零件的稳定 ID、遮挡后的实例一致性、逐件追溯的 OK/NG 决策、小缺陷与像素级尺寸测量。

更合理的系统分工是:DINO 特征提供通用对应和粗 ROI;专用检测器或分割器负责实例;跟踪器负责 ID;规则、几何或专用异常模型负责最终质检判定。

真正值得保留的结论

在视频里,能持续找到前景,不代表能持续保持实例身份。 单目标特征跟随可以很有用;多实例连续质检,仍需要专门的对象记忆、再识别与身份竞争机制。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-28,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 Coder建设 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 同一套视觉特征,单目标能跟 多目标为什么会失忆?
    • 先看成绩
    • 总分掩盖了什么?
    • 成功案例:一条狗能从头跟到尾
    • 中等案例:人和自行车变成同一个标签
    • 失败案例:多个人变成一个前景
    • 它到底怎么跑?
    • 对工业视觉有什么意义?
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档