Groq
Groq 是美国 AI 推理芯片 + 云服务公司,自研 LPU(Language Processing Unit) 推理芯片,以"极致低延迟"著称。在 LLM API 市场是 OpenAI / Anthropic 之外的第三选择。
LPU vs GPU
- GPU(NVIDIA):通用并行计算,HBM 高带宽,但 kernel launch 开销对单 batch 不友好。
- LPU(Groq):专为大模型推理设计的 ASIC,确定性时延,无 kernel launch 开销。 单 token 延迟比 GPU 低 5-10x。
Groq Cloud 模型
Groq 不自研模型,提供开源模型推理服务:
- Llama 3.1 8B / 70B / 405B
- Mixtral 8x7B
- Gemma 2 9B
- Whisper(语音转录)
价格
极便宜:Llama 70B 推理 $0.59/M tokens(输入 + 输出平均),比 GPT-4o 便宜 20x。
速度实测
Llama 3.1 70B:
- Groq LPU:~280 tokens/s
- vLLM on H100:~120 tokens/s
- OpenAI API(GPT-4o):~80 tokens/s
适用场景
- 实时聊天 / 流式输出:低延迟用户体验远好于 GPT-4。
- 代码补全:即时响应是生产力关键。
- 批量 API 调用:便宜 + 快,跑 evaluation 很划算。
- 音频转录:Whisper 在 LPU 上跑得飞快。
限制
- 只有开源模型:不能用 Claude / GPT-5 等闭源模型。
- 容量有限:高峰期需要排队或 rate limit。
- 不能 fine-tune:只能调 prompt。
与其他推理服务对比
| 服务 | 速度 | 价格 | 模型选择 |
|---|---|---|---|
| Groq LPU | ★★★★★ | ★★★★★ | 开源 |
| Together.ai | ★★★★ | ★★★★ | 开源 + 闭源 |
| OpenRouter | ★★★★ | ★★★★ | 聚合多 provider |
| Fireworks | ★★★★ | ★★★★ | 开源 |
| Replicate | ★★★ | ★★★ | 开源(CPU/GPU) |
| OpenAI API | ★★★ | ★★ | 闭源旗舰 |