Whisper
Whisper 是 OpenAI 于 2022 年开源的自动语音识别(ASR)模型。凭借出色的多语种 鲁棒性和开源可用性,迅速成为业界 ASR 事实标准。
模型规格
| 规格 | 参数 | 显存 | 相对速度 |
|---|---|---|---|
| tiny | 39M | ~1 GB | ~32x |
| base | 74M | ~1 GB | ~16x |
| small | 244M | ~2 GB | ~6x |
| medium | 769M | ~5 GB | ~2x |
| large-v3 | 1.5B | ~10 GB | 1x |
核心能力
- 多语种识别:99 种语言,WER 在大语种上接近人类水平。
- 翻译:直接把外语语音翻译成英文文本。
- 时间戳:词级别 / 段级别时间戳输出。
- 长音频:分段处理支持任意长度。
- 鲁棒性:在口音、噪声、电话音上比传统 Kaldi 系统好得多。
一行启动
pip install openai-whisper
whisper audio.mp3 --language zh --model medium
中文体验
- 中文识别准确率很高(medium 以上就很好)。
- 数字 / 专有名词偶尔出错,需要后处理纠错。
- 说话人分离(diarization)需要额外工具(pyannote.audio)。
部署方案
- 本地 CLI:上面那个
whisper命令,最简单。 - Python 库:
whisper.load_model("large-v3"),嵌入应用。 - whisper.cpp:C++ 重写,CPU / Apple Silicon / Android 都能跑。
- faster-whisper:CTranslate2 后端,速度 4-5x,显存 1/2。
- whisper-jax:JAX 后端,TPU 加速。
局限
- 不能做说话人分离(diarization)。
- 实时流式识别需要自己包(
whisper_streaming等)。 - 长静音 / 切歌场景可能产生幻觉文本。