视频编码发展到今天,一个越来越有意思的问题摆在行业面前:一边是 H.266/VVC,把传统视频编码几十年的技术积累推到了一个新的高度;另一边是快速发展的神经编码...
过去三十多年,视频编码技术一直沿着一条非常清晰的路线发展:从 MPEG-2、H.264,到 H.265/HEVC,再到更新一代的视频编码技术,核心目标始终没有改...
角色崩坏,是长时序 AI 视频绕不开的坎:同一角色,第 1 镜还是本人,第 30 镜脸歪了、发色变了、衣服细节全对不上。 很多人归因于"模型不行",但公开工程复...
但真正决定生成质量的,是藏在中间的主干网络——DiT(Diffusion Transformer)。它是整个生成流程的"大脑",VAE压缩后的潜空间数据在这里完...
每当提到视频生成,大部分工程师脑海中浮现的图景是数据中心里庞大的GPU集群、海量的VRAM以及PyTorch或TensorFlow长长的调用栈。但在这个光谱的另...
图生视频的核心诉求,是让输出视频持续继承输入参考图的人物相貌、服饰、场景构图、色彩风格。市面上多数方案将参考图像只作用于首帧,后续帧依靠模型自主推演运动,在 7...
在当前 AI 视频生成领域,4K 分辨率 + 长时序连续生成是业务刚需,但原生生成方案普遍存在帧间一致性缺陷:
当前文生视频、图生视频大模型(扩散模型、Transformer视频模型)已广泛应用于内容创作、数字人、影视剪辑、短视频生成等场景,但帧间时序一致性缺失导致的画面...
随着文生视频模型迭代,短片段画面质量已经达到可用水准,但一旦视频时长拉长到 8‑16 秒甚至更高,就会集中爆发角色漂移、物体崩坏、镜头跳变、时序逻辑断裂、FVD...
中国互联网络信息中心 | 工程师 (已认证)
近期极速云安全中心监测到一类高隐蔽性移动端攻击:攻击者在知名平台的擦边视频画面中嵌入网址,诱导用户下载安装恶意程序,安装后软件将窃取手机全部隐私数据并获取设备高...
市面上多数数字人方案,唇形驱动与人物身份约束相互割裂。唇形模块负责嘴部运动,人物锚定负责锁定五官脸型,两套信号在推理阶段容易互相干扰。在长时长口播、多语种语音、...