跳到主内容
智客 ZICQ

智客百科 模型与产品

Groq

模型与产品
别名: Groq Groq LPU LPU Inference Engine ·2026-09-14

Groq

Groq 是美国 AI 推理芯片 + 云服务公司,自研 LPU(Language Processing Unit) 推理芯片,以"极致低延迟"著称。在 LLM API 市场是 OpenAI / Anthropic 之外的第三选择。

LPU vs GPU

  • GPU(NVIDIA):通用并行计算,HBM 高带宽,但 kernel launch 开销对单 batch 不友好。
  • LPU(Groq):专为大模型推理设计的 ASIC,确定性时延,无 kernel launch 开销。 单 token 延迟比 GPU 低 5-10x。

Groq Cloud 模型

Groq 不自研模型,提供开源模型推理服务:

  • Llama 3.1 8B / 70B / 405B
  • Mixtral 8x7B
  • Gemma 2 9B
  • Whisper(语音转录)

价格

极便宜:Llama 70B 推理 $0.59/M tokens(输入 + 输出平均),比 GPT-4o 便宜 20x。

速度实测

Llama 3.1 70B:

  • Groq LPU:~280 tokens/s
  • vLLM on H100:~120 tokens/s
  • OpenAI API(GPT-4o):~80 tokens/s

适用场景

  • 实时聊天 / 流式输出:低延迟用户体验远好于 GPT-4。
  • 代码补全:即时响应是生产力关键。
  • 批量 API 调用:便宜 + 快,跑 evaluation 很划算。
  • 音频转录:Whisper 在 LPU 上跑得飞快。

限制

  • 只有开源模型:不能用 Claude / GPT-5 等闭源模型。
  • 容量有限:高峰期需要排队或 rate limit。
  • 不能 fine-tune:只能调 prompt。

与其他推理服务对比

服务 速度 价格 模型选择
Groq LPU ★★★★★ ★★★★★ 开源
Together.ai ★★★★ ★★★★ 开源 + 闭源
OpenRouter ★★★★ ★★★★ 聚合多 provider
Fireworks ★★★★ ★★★★ 开源
Replicate ★★★ ★★★ 开源(CPU/GPU)
OpenAI API ★★★ ★★ 闭源旗舰