跳到主内容
智客 ZICQ

智客百科 模型与产品

Whisper

模型与产品
别名: Whisper OpenAI Whisper ASR ·2026-09-14

Whisper

Whisper 是 OpenAI 于 2022 年开源的自动语音识别(ASR)模型。凭借出色的多语种 鲁棒性和开源可用性,迅速成为业界 ASR 事实标准。

模型规格

规格 参数 显存 相对速度
tiny 39M ~1 GB ~32x
base 74M ~1 GB ~16x
small 244M ~2 GB ~6x
medium 769M ~5 GB ~2x
large-v3 1.5B ~10 GB 1x

核心能力

  • 多语种识别:99 种语言,WER 在大语种上接近人类水平。
  • 翻译:直接把外语语音翻译成英文文本。
  • 时间戳:词级别 / 段级别时间戳输出。
  • 长音频:分段处理支持任意长度。
  • 鲁棒性:在口音、噪声、电话音上比传统 Kaldi 系统好得多。

一行启动

pip install openai-whisper
whisper audio.mp3 --language zh --model medium

中文体验

  • 中文识别准确率很高(medium 以上就很好)。
  • 数字 / 专有名词偶尔出错,需要后处理纠错。
  • 说话人分离(diarization)需要额外工具(pyannote.audio)。

部署方案

  • 本地 CLI:上面那个 whisper 命令,最简单。
  • Python 库:whisper.load_model("large-v3"),嵌入应用。
  • whisper.cpp:C++ 重写,CPU / Apple Silicon / Android 都能跑。
  • faster-whisper:CTranslate2 后端,速度 4-5x,显存 1/2。
  • whisper-jax:JAX 后端,TPU 加速。

局限

  • 不能做说话人分离(diarization)。
  • 实时流式识别需要自己包(whisper_streaming 等)。
  • 长静音 / 切歌场景可能产生幻觉文本。

进一步阅读