语音合成TTS
技术演进:拼接合成 → 统计参数(HMM)→ 神经网络(WaveNet/Tacotron/FastSpeech/HiFi-GAN)→ 零样本克隆时代。
核心能力:
零样本声音克隆:3-10 秒参考音频即可复刻音色(VALL-E 路线)
情感控制:显式标签([laughter] 等)+ 隐式风格迁移双路线
流式合成:首包延迟 150ms(CosyVoice 2.0),支持实时对话
跨语言克隆:保持音色说目标语言从未录制的语言
标杆数据:
ElevenLabs 盲测人类相似度 98%,识别率不超随机概率
市场规模 2025 年 84 亿美元,2030 年预计超 470 亿美元
AI 配音比传统配音成本低 85-95%,42% 新播客使用 AI 语音
工程要点:
端到端架构:文本→音素→梅尔频谱→波形,HiFi-GAN 声码器实时运行
选型:质量选 ElevenLabs;性价比 Play.ht;企业合规 Azure Custom Neural Voice;本地部署 Bert-VITS2/CosyVoice
风险:声音诈骗、配音演员维权;《民法典》声音参照肖像权保护,ELVIS 法案要求披露 AI 语音
