Gemini
Gemini 是 Google DeepMind 在 2023 年底发布的大语言模型系列,是 Google 应对 GPT-4 / Claude 的旗舰武器。最新版本 Gemini 2.0 系列在多模态、长上下文方面表现突出。
关键特性
- 原生多模态:从一开始就把文本、图片、音频、视频统一在同一个模型里 (不是事后拼接 vision encoder)。
- 超长上下文:Gemini 1.5 Pro 支持 1M tokens,Gemini 2.0 部分模型推 2M。
- TPU 训练:Google 自研 TPU 训练,不依赖 NVIDIA GPU。
- 速度快:Gemini Flash 系列专门为低延迟优化。
变体
| 模型 | 定位 | 上下文 |
|---|---|---|
| Gemini 2.0 Ultra | 旗舰 | 2M |
| Gemini 2.0 Pro | 主力 | 1M-2M |
| Gemini 2.0 Flash | 低延迟 | 1M |
| Gemini 2.0 Flash-Lite | 极轻量 / 便宜 | 1M |
独特卖点
- 视频理解:原生支持视频输入(其他模型需要先抽帧)。
- 音频理解:直接处理音频,无需 ASR 前置。
- Workspace 集成:Google 套件(Gmail、Drive、Calendar)深度集成。
- Android / Chrome:移动端和浏览器内置 Gemini Nano。
与 GPT-5 / Claude 对比
| 维度 | Gemini 2.0 Pro | GPT-5 | Claude 4 |
|---|---|---|---|
| 上下文 | 1-2M | 128k-1M | 200k |
| 多模态 | ★★★★★(原生) | ★★★★ | ★★★(vision only) |
| 推理 | ★★★★ | ★★★★★ | ★★★★ |
| 长文档 | ★★★★★ | ★★★★ | ★★★★★ |
| 中文 | ★★★ | ★★★★ | ★★★ |
| 价格 | 中 | 高 | 中高 |
适用场景
- 超长上下文任务:整本小说、代码库库分析、长视频。
- 多模态任务:视频理解、图片问答、音频转录。
- Google 生态集成:Gmail / Calendar / Docs 智能助理。
限制
- 中文能力弱:训练语料英文为主,中文任务逊于 GPT-5 / Qwen。
- API 不如 OpenAI 开放:部分功能仅 Vertex AI 用户可用。
- 第三方生态:相比 OpenAI / Anthropic,第三方工具集成少。