视频生成模型
技术路线已收敛(2026):GAN→Diffusion→DiT。主流(Sora 2、Veo 3.1、可灵 3.0、Seedance 2.0)全部是 潜空间 DiT + 时空 Patch + 视频压缩网络 范式。
四步流水线
数据:视频-文本对流水线(质量过滤→镜头切分→关键帧→多模态打标),课程学习由易到难
视频 VAE:3D 时空压缩,空间 8× + 时间 4-8×,压缩比 256-512×(否则 1 分钟 1080p 视频 33GB 无法建模)
DiT 骨干:3D Patch 嵌入 + AdaLN-Zero + 空间-时间分解注意力 + Flow Matching(去噪步数 1000+ → 10-50 步,"直线传输"替代"随机游走")
推理优化:少步蒸馏 + KV Cache + 稀疏注意力;后处理:超分、插帧、条件控制(图生视频/首尾帧)
2025-2026 关键进展
音频原生同步:Veo 3 / Sora 2 / 可灵生成画面同时产出对话、音效、环境声(口型同步)
中文语义理解:可灵/Vidu 原生支持成语、古诗词意境(国产护城河)
Arena ELO:可灵 3.0(1241 分)曾登顶;榜单轮流转手于字节/快手/Google/OpenAI
数据决定胜负:架构大家都 DiT,70% 差距来自数据(可灵短视频数据、Seedance 多镜头叙事、Veo 电影数据)
商业落地:短视频内容工厂(单人日产 1→15 条)、TVC 预演(成本降 90%+)、电商主图视频化(CTR +15-30%)、影视分镜预演(2 周→6 小时)。
下一步看点:从"像素生成器"进化为"世界模拟器"——理解物理因果、长视频叙事。与第二十二篇世界模型同频
