2025-26 年 AIGC 质变:AI 具备视觉推理,理解物理法则与光影逻辑。
视觉铁三角:图生图 I2I(编辑)/ 文生视频 T2V(从零创建)/ 图生视频 I2V(资产转动态)。
图像生成演进:GAN(开创)→ 扩散模型(主流,逐步去噪)→ MMDiT(文本图像深度协同,提速 3-5 倍)。
可控工具:ControlNet(姿态构图)、LoRA(轻量微调)、Inpainting(局部重绘)、提示词权重。
视频生成:Sora 证明可行性 → Frame-IT 1 分钟长视频 → 开源模型爆发。难点:时序一致性、物理真实性、长视频稳定、控制精度。
音频:语音合成(SoVITS)、音乐生成(12 声道分轨)、声音克隆(少样本)。
趋势:统一多模态模型("根据剧本生成分镜和配乐");CLIP 等已建立跨模态语义关联。
安全合规:防深度伪造(数字水印、溯源)、版权审计、内容过滤;量化压缩降能耗。
2026 展望:精细可控、人机协同、端侧推理、AR/VR 融合、国产模型强化中文能力。
