AIGC

行业资讯

AIGC 效率倍增手册(5)

  • 发布时间
  • 点击次数

语音识别ASR

四代架构

  • 流式 Conformer:生产级实时主力,RTF<0.2;牺牲未来上下文换速度

  • Encoder-Decoder Transformer(Whisper 范式):高精度,已上端侧——Large v3 Turbo(8 亿参数)本地运行媲美 GPT-4o-transcribe

  • Speech LLM(统一架构):ASR+LLM+TTS 三段式管道 → 单模型,消除误差累积与三段延迟(Voxtral Realtime 等)

  • LLM 后处理混合:用 LLM 修 ASR 输出——结构缺陷:LLM 听不到音频,无法纠正同音异义错误

关键数据

  • Whisper large-v3:500 万小时训练数据(100 万弱标注 + 400 万伪标签);标准英文 95-99% 准确率

  • 1 小时录音 <1 分钟 GPU 转录(RTF 68.56)——"全量转录"替代"抽样转录"

  • 2026 端侧趋势:模型 <1GB、实时转写、99+ 语言、完全本地隐私

生产管线八件套:VAD 静音剥离 → 30s 分窗(带重叠)→ GPU 批处理 → 重叠去重 → 说话人分离 → 低置信度人工审核 → 实体标注 → 审计日志。

选型:隐私敏感(医疗/法律/金融)→ 自托管 Whisper;多语言+方言 → Whisper/Qwen3-ASR;实时对话 → 流式 Conformer 或 Speech LLM。


JK小助手
转人工 ×