首页
学习
活动
专区
圈层
工具
发布
首页标签视频分析

#视频分析

神经编码与 H.266,到底谁更先进?下一代视频 Codec 的真正竞争

音视频牛哥

视频编码发展到今天,一个越来越有意思的问题摆在行业面前:一边是 H.266/VVC,把传统视频编码几十年的技术积累推到了一个新的高度;另一边是快速发展的神经编码...

6210

神经编码不是“AI 调参数”:看懂下一代视频编码的本质变化

音视频牛哥

过去三十多年,视频编码技术一直沿着一条非常清晰的路线发展:从 MPEG-2、H.264,到 H.265/HEVC,再到更新一代的视频编码技术,核心目标始终没有改...

7400

无限画布视频关键帧锚定:解决长时序角色崩坏的技术方案

回头不见

角色崩坏,是长时序 AI 视频绕不开的坎:同一角色,第 1 镜还是本人,第 30 镜脸歪了、发色变了、衣服细节全对不上。 很多人归因于"模型不行",但公开工程复...

14010

从底层DiT到视频生成:拆解Vera 1.1主干网络设计思路

用户12512581

但真正决定生成质量的,是藏在中间的主干网络——DiT(Diffusion Transformer)。它是整个生成流程的"大脑",VAE压缩后的潜空间数据在这里完...

16410

单片机视频生成:在仅几千字节内存里“无中生有”

闪学it点com

每当提到视频生成,大部分工程师脑海中浮现的图景是数据中心里庞大的GPU集群、海量的VRAM以及PyTorch或TensorFlow长长的调用栈。但在这个光谱的另...

11010

Vera1.1 模型浅析:图生 4K 视频的参考特征对齐实现思路

回头不见

图生视频的核心诉求,是让输出视频持续继承输入参考图的人物相貌、服饰、场景构图、色彩风格。市面上多数方案将参考图像只作用于首帧,后续帧依靠模型自主推演运动,在 7...

17510

Vera1.1 技术细读:长时序 4K 视频的帧间稳定机制

用户12512581

在当前 AI 视频生成领域,4K 分辨率 + 长时序连续生成是业务刚需,但原生生成方案普遍存在帧间一致性缺陷:

17810

时空注入架构技术落地,有效缓解AI视频画面闪烁抖动问题

回头不见

当前文生视频、图生视频大模型(扩散模型、Transformer视频模型)已广泛应用于内容创作、数字人、影视剪辑、短视频生成等场景,但帧间时序一致性缺失导致的画面...

14710

Vera 1.1 长时序视频生成遇到的问题与解法

用户12512581

随着文生视频模型迭代,短片段画面质量已经达到可用水准,但一旦视频时长拉长到 8‑16 秒甚至更高,就会集中爆发角色漂移、物体崩坏、镜头跳变、时序逻辑断裂、FVD...

16410

警惕“擦边视频”诱导下载恶意软件的钓鱼攻击

芦笛

中国互联网络信息中心 | 工程师 (已认证)

近期极速云安全中心监测到一类高隐蔽性移动端攻击:攻击者在知名平台的擦边视频画面中嵌入网址,诱导用户下载安装恶意程序,安装后软件将窃取手机全部隐私数据并获取设备高...

15700

数字人口播新基建:Vera 1.1 唇形同步与人物锚定实测

用户12512581

市面上多数数字人方案,唇形驱动与人物身份约束相互割裂。唇形模块负责嘴部运动,人物锚定负责锁定五官脸型,两套信号在推理阶段容易互相干扰。在长时长口播、多语种语音、...

19010
领券