跳到主内容
智客 ZICQ

智客百科 基础设施

Ollama

基础设施
别名: Ollama ·2026-09-14

Ollama

Ollama 是把开源 LLM 跑在本地 / 边缘的最简单工具。一行命令拉模型、跑起来、 暴露 OpenAI 兼容 API。

一行启动

ollama run qwen2.5:7b

自动下载量化版本(默认 Q4_K_M),本地推理,无网络依赖。

特性

  • 模型库:Qwen、Llama、Mistral、Gemma、DeepSeek、Phi 等主流模型开箱即用。
  • Modelfile:自定义 system prompt / 温度 / 模板,可继承复用。
  • OpenAI 兼容 API:http://localhost:11434/v1/chat/completions,直接对接现有工具。
  • 多平台:macOS / Linux / Windows 原生,Apple Silicon 自动启用 Metal 加速。
  • GGUF 量化:默认用 llama.cpp + GGUF,CPU/GPU 混合推理。

vs 其他方案

工具 优势 劣势
Ollama 易用、跨平台、模型库丰富 定制性弱,不适合极端性能
llama.cpp 极致性能、完全可控 命令行,需自己管理
LM Studio GUI 友好 仅桌面,无服务端模式
vLLM 生产级吞吐 需要 NVIDIA GPU + Linux

适用

  • 个人开发 / 学习 / 实验。
  • 离线 / 内网 / 数据合规场景。
  • 边缘部署(NVIDIA Jetson、Mac mini 等)。