AI音乐生成
两大技术架构:
自回归 Transformer:音频经神经编解码器(EnCodec/RVQ)离散化为 token,逐 token 生成——局部连贯强(MusicGen、Suno)
潜空间扩散:VAE 压缩 → 去噪生成,一次性生成整段——音质保真高(Stable Audio)
商业闭源系统(Suno/Udio)为混合私有架构,含独立人声合成模块
行业格局(2026):
Suno v5:5000 万+ 用户,免费档 10 首/天;Pro $10/月含商用授权
版权战拐点:UMG 与 Udio 和解(传闻 $200M+、15% 收入分成);Warner×Suno、Merlin、NMPA 相继签约;仅 Sony 仍在诉讼
美国版权局裁定:纯 AI 生成人声无版权——"写歌词+AI 伴奏"可保护,"一句话生成"不可
实践要点:
商用必须付费档(免费档无授权);平台保留用你的作品训练模型的权利
弱点:宏观结构(主歌-副歌-桥段、调性转折)仍是 frontier,同 LLM 的 lost-in-the-middle
音乐人正确姿势:stem 分离、自动混音、母带处理当"助理"用,而非替代
