AIGC

行业资讯

AIGC 进阶实战指南(20)

  • 发布时间
  • 点击次数

实时语音大模型

架构三代演进

  1. 级联管道(ASR→LLM→TTS):延迟下限 300-500ms,丢语气/情绪/打断能力

  1. 半级联(音频编码→文本推理→TTS):OpenAI Realtime、Gemini Live 路线,保留韵律、支持流式

  1. 原生端到端全双工:单一模型边听边说,Moshi/GPT-Live/StepAudio 路线

全双工的核心难点:不是外挂打断检测模块(系统级全双工),而是把持续倾听、语义理解、语音生成、节奏控制内化进模型——包括何时开口、何时附和"嗯"、被打断时立即让位。

代表系统

  • Moshi(Kyutai):双 Mimi 音频流+内心独白文本流并行,理论延迟 160ms,单 L4 GPU 实跑 200ms;可自我打断、可附和

  • NVIDIA PersonaPlex(7B,开源 MIT):声音+人设双 Prompt 定义角色,Moshi 架构

  • 哈工大 Lychee-FD(ACL 2026 杰出论文):发现声学与语义在深层共享参数会产生梯度冲突导致"全双工降智",用层次化解耦(浅层共享、深层分通道)解决;vLLM 定制多流推理提速 2.96×

  • StepAudio 2.5 / GPT-Live / Amazon Nova 2 Sonic:国产与商用第一梯队,端侧已出现 1.5-3B 小模型(Liquid LFM2-Audio)

关键洞察:内心独白文本流(生成语音同时生成转写)能显著提升语义连贯性,且转写免费获得。

落地场景:语音 Agent(听懂即执行:预约/查资料/日程)、客服全双工、情感机器人(无唤醒词、表情同步)、实时同传(Hibiki 式流式语音翻译)。

选型建议:要可控可审计→半级联;要极致自然交互→端到端全双工;端侧隐私场景→小参数 Speech-LLM。


JK小助手
转人工 ×