AIGC

行业资讯

AIGC模式解析(8)

  • 发布时间
  • 点击次数

视频生成模型

技术路线已收敛(2026):GAN→Diffusion→DiT。主流(Sora 2、Veo 3.1、可灵 3.0、Seedance 2.0)全部是 潜空间 DiT + 时空 Patch + 视频压缩网络 范式。

四步流水线

  1. 数据:视频-文本对流水线(质量过滤→镜头切分→关键帧→多模态打标),课程学习由易到难

  1. 视频 VAE:3D 时空压缩,空间 8× + 时间 4-8×,压缩比 256-512×(否则 1 分钟 1080p 视频 33GB 无法建模)

  1. DiT 骨干:3D Patch 嵌入 + AdaLN-Zero + 空间-时间分解注意力 + Flow Matching(去噪步数 1000+ → 10-50 步,"直线传输"替代"随机游走")

  1. 推理优化:少步蒸馏 + KV Cache + 稀疏注意力;后处理:超分、插帧、条件控制(图生视频/首尾帧)

2025-2026 关键进展

  • 音频原生同步:Veo 3 / Sora 2 / 可灵生成画面同时产出对话、音效、环境声(口型同步)

  • 中文语义理解:可灵/Vidu 原生支持成语、古诗词意境(国产护城河)

  • Arena ELO:可灵 3.0(1241 分)曾登顶;榜单轮流转手于字节/快手/Google/OpenAI

  • 数据决定胜负:架构大家都 DiT,70% 差距来自数据(可灵短视频数据、Seedance 多镜头叙事、Veo 电影数据)

商业落地:短视频内容工厂(单人日产 1→15 条)、TVC 预演(成本降 90%+)、电商主图视频化(CTR +15-30%)、影视分镜预演(2 周→6 小时)。

下一步看点:从"像素生成器"进化为"世界模拟器"——理解物理因果、长视频叙事。与第二十二篇世界模型同频


JK小助手
转人工 ×