Ollama
Ollama 是把开源 LLM 跑在本地 / 边缘的最简单工具。一行命令拉模型、跑起来、 暴露 OpenAI 兼容 API。
一行启动
ollama run qwen2.5:7b
自动下载量化版本(默认 Q4_K_M),本地推理,无网络依赖。
特性
- 模型库:Qwen、Llama、Mistral、Gemma、DeepSeek、Phi 等主流模型开箱即用。
- Modelfile:自定义 system prompt / 温度 / 模板,可继承复用。
- OpenAI 兼容 API:
http://localhost:11434/v1/chat/completions,直接对接现有工具。 - 多平台:macOS / Linux / Windows 原生,Apple Silicon 自动启用 Metal 加速。
- GGUF 量化:默认用 llama.cpp + GGUF,CPU/GPU 混合推理。
vs 其他方案
| 工具 | 优势 | 劣势 |
|---|---|---|
| Ollama | 易用、跨平台、模型库丰富 | 定制性弱,不适合极端性能 |
| llama.cpp | 极致性能、完全可控 | 命令行,需自己管理 |
| LM Studio | GUI 友好 | 仅桌面,无服务端模式 |
| vLLM | 生产级吞吐 | 需要 NVIDIA GPU + Linux |
适用
- 个人开发 / 学习 / 实验。
- 离线 / 内网 / 数据合规场景。
- 边缘部署(NVIDIA Jetson、Mac mini 等)。