首页
学习
活动
专区
圈层
工具
发布
首页标签视频理解

#视频理解

多模态 AI 能力,全维度识别视频标签

多模态 AI 模型的商业应用场景

用户12793589

多模态 AI 模型在将文本、图像、音频和视频整合到统一工作流程的业务中最为有用——营销、客户支持、产品开发和内容生产都是典型场景。当你们选择一个高频率任务、梳理...

8010

神经编码不是“AI 调参数”:看懂下一代视频编码的本质变化

音视频牛哥

过去三十多年,视频编码技术一直沿着一条非常清晰的路线发展:从 MPEG-2、H.264,到 H.265/HEVC,再到更新一代的视频编码技术,核心目标始终没有改...

8500

拆了100个Seedance提示词后,发现3个切片粒度黄金分割点(附模板)

抖知书

0-4秒写什么,4-8秒写什么,8-12秒写什么——这套模板几乎成了Seedance玩家的入门仪式。

11300

让照片开口说话:AI 口型同步的原理、实操与素材准备

老A说

一张照片,配上一段音频,就能让画面里的人开口说话;一段已故亲人的录音,叠上他生前的合影,可以让沉默的画面重新发声。这件事在过去需要影视级的面部捕捉与逐帧绘制,今...

16410

世界模型如何重塑具身智能:从VLA到预测式机器人控制

音视频牛哥

​围绕“世界模型是不是机器人下一个奇点时刻”的讨论正在升温。过去几年,具身智能的发展重点集中在大模型、VLA(Vision-Language-Action)、模...

33310

警惕“擦边视频”诱导下载恶意软件的钓鱼攻击

芦笛

近期极速云安全中心监测到一类高隐蔽性移动端攻击:攻击者在知名平台的擦边视频画面中嵌入网址,诱导用户下载安装恶意程序,安装后软件将窃取手机全部隐私数据并获取设备高...

16300

给 AI 产物瘦身的完整流水线:我在 Agent Bucket 跑通媒体处理的 30 天实测

行者全栈架构师

这篇是我作为 AIGC 内容生产者,把每周 30GB 的图像 视频 文档产物迁到腾讯云 Agent Bucket、用它的媒体处理能力自动出图、自动转码、自动...

41140

破局网络边界:GB28181协议NAT兼容方案,让视频互联无界

美畅物联-南宫美1

大家好!在搞智慧城市或者大型安防监控的时候,大家是不是经常遇到一个让人头疼的问题:成百上千个摄像头分散在各个角落,有的在工厂车间,有的在老家仓库,网络环境那叫一...

16300

本地化视频会议服务器供应链投毒攻击机理与全域防护研究 —— 以 Head Mare 针对 TrueConf 系列攻击为例

芦笛

本地化部署视频会议平台成为政企关键行业替代海外协作工具的主流选型,但服务端原生漏洞、无校验客户端分发机制形成新型供应链攻击缺口。2026 年 7 月卡巴斯基安全...

22710

视频理解RAG:从视觉感知到时序多模态检索系统的架构设计

网渡科技

根据 IDC 发布的数据预测,到2025年全球数据总量将超过 180 ZB,其中大量增长来自:

22010

视频孪生技术:概念定义、核心技术体系与创新应用研究

在路上ing

数字孪生(Digital Twin)作为连接物理世界与数字空间的重要技术体系,已广泛应用于智慧城市、智能制造、智慧交通、能源管理等领域。其核心是构建物理对象的数...

27210

agno v2.6.22发布:视频理解、搜索研究、超时机制、安全修复全面升级,一文看懂全部更新

福大大架构师每日一题

同时,“生成多模态文本嵌入”这一点也非常关键。它代表的不只是简单的视频读取,而是围绕视频内容形成可用于语义处理、检索或理解的文本表示能力。换句话说,这次更新并不...

26200

VideoSeek 长视频理解 Agent : 让 GPT-5 在长视频理解上再提 10 个点的秘密

唐国梁Tommy

整体来看,VideoSeek 给出了一个清晰的设计范式:用结构化工具 + 推理循环替代暴力采帧,而不是简单堆上下文长度。对于正在构建视频理解系统的工程师,这套工...

19700

视频理解太慢?VITA"秒级理解"的技术原理

gavin1024

VITA多模态理解模型基于原生多模态大模型技术,在单个模型内完成端到端的多模态内容理解,助力企业提升视频理解效率。前往腾讯云TokenHub平台,使用VITA的...

26510

视频理解中的时序建模:如何让AI理解"前因后果"?

gavin1024

时序建模是视频理解中的关键技术,它决定了AI是否能够真正理解视频中的"前因后果"。VITA 3.0通过原生多模态架构和统一训练流程,支持更长的上下文与更连续的时...

27510

VITA 3.0全新升级:视频理解、音频理解、图文理解三合一

gavin1024

VITA 3.0实现音视图文全模态统一理解,核心升级视频理解、音频理解、图文理解三项能力,为企业提供更强大的多模态内容理解服务。

60210
领券