语音识别ASR
四代架构:
流式 Conformer:生产级实时主力,RTF<0.2;牺牲未来上下文换速度
Encoder-Decoder Transformer(Whisper 范式):高精度,已上端侧——Large v3 Turbo(8 亿参数)本地运行媲美 GPT-4o-transcribe
Speech LLM(统一架构):ASR+LLM+TTS 三段式管道 → 单模型,消除误差累积与三段延迟(Voxtral Realtime 等)
LLM 后处理混合:用 LLM 修 ASR 输出——结构缺陷:LLM 听不到音频,无法纠正同音异义错误
关键数据:
Whisper large-v3:500 万小时训练数据(100 万弱标注 + 400 万伪标签);标准英文 95-99% 准确率
1 小时录音 <1 分钟 GPU 转录(RTF 68.56)——"全量转录"替代"抽样转录"
2026 端侧趋势:模型 <1GB、实时转写、99+ 语言、完全本地隐私
生产管线八件套:VAD 静音剥离 → 30s 分窗(带重叠)→ GPU 批处理 → 重叠去重 → 说话人分离 → 低置信度人工审核 → 实体标注 → 审计日志。
选型:隐私敏感(医疗/法律/金融)→ 自托管 Whisper;多语言+方言 → Whisper/Qwen3-ASR;实时对话 → 流式 Conformer 或 Speech LLM。
