实时语音大模型
架构三代演进
级联管道(ASR→LLM→TTS):延迟下限 300-500ms,丢语气/情绪/打断能力
半级联(音频编码→文本推理→TTS):OpenAI Realtime、Gemini Live 路线,保留韵律、支持流式
原生端到端全双工:单一模型边听边说,Moshi/GPT-Live/StepAudio 路线
全双工的核心难点:不是外挂打断检测模块(系统级全双工),而是把持续倾听、语义理解、语音生成、节奏控制内化进模型——包括何时开口、何时附和"嗯"、被打断时立即让位。
代表系统
Moshi(Kyutai):双 Mimi 音频流+内心独白文本流并行,理论延迟 160ms,单 L4 GPU 实跑 200ms;可自我打断、可附和
NVIDIA PersonaPlex(7B,开源 MIT):声音+人设双 Prompt 定义角色,Moshi 架构
哈工大 Lychee-FD(ACL 2026 杰出论文):发现声学与语义在深层共享参数会产生梯度冲突导致"全双工降智",用层次化解耦(浅层共享、深层分通道)解决;vLLM 定制多流推理提速 2.96×
StepAudio 2.5 / GPT-Live / Amazon Nova 2 Sonic:国产与商用第一梯队,端侧已出现 1.5-3B 小模型(Liquid LFM2-Audio)
关键洞察:内心独白文本流(生成语音同时生成转写)能显著提升语义连贯性,且转写免费获得。
落地场景:语音 Agent(听懂即执行:预约/查资料/日程)、客服全双工、情感机器人(无唤醒词、表情同步)、实时同传(Hibiki 式流式语音翻译)。
选型建议:要可控可审计→半级联;要极致自然交互→端到端全双工;端侧隐私场景→小参数 Speech-LLM。
