Ollama
Go · MIT
本地运行各种开源大模型的命令行工具,模型即命令可启动。生态繁荣。
概览
Ollama(177k+ stars,MIT)是本地 LLM 推理服务(默认 :11434 端口),支持一键 ollama run <model> 启动模型;vLLM(88k+ stars,Apache-2.0)主打生产级高吞吐 LLM serving,多 GPU + continuous batching。本文从定位、部署难度、性能优化、生态和典型场景五个角度对比。
| 适合场景 | Ollama | vLLM |
|---|---|---|
| 产品定位 | 本地推理服务:默认监听 :11434,提供 REST API(/api/generate /api/chat /api/embed 等)。桌面应用 / 个人开发者 / 离线场景通用 | 生产级 LLM serving:高吞吐 + 多 GPU + continuous batching。OpenAI 兼容 API。适合大模型生产部署 |
| 上手难度 | macOS / Linux 装一个 binary 就跑。Modelfile 自定义模型 + 默认 Modelfile 库 (llama3 / qwen / mistral 等) 开箱即用 | 需要 Python + pip install vllm + 选择模型 + 配置 GPU。生产环境一般要 Docker + Kubernetes |
| 性能优化 | 开箱即用,但定制优化空间小。CPU / GPU 推理走 llama.cpp 底层 | PagedAttention + continuous batching + speculative decoding。吞吐量是 vLLM 的招牌优势 |
| 生态集成 | Open WebUI / AnythingLLM / LangChain / LlamaIndex 等都内置 Ollama 支持。Modelfile 生态丰富 | OpenAI 兼容 API 是事实标准,几乎所有 LLM 框架 / agent SDK 都直接对接。HuggingFace 生态集成完整 |
| 典型场景 | 桌面 LLM 体验 / 个人开发 / 离线场景 / 边缘设备 / 嵌入式。不想碰 Kubernetes 也能用 | 中等规模生产部署(10-1000 QPS) / 多模型路由 / GPU 集群 / 高吞吐 Agent 后端 |
| Metric | Ollama | vLLM |
|---|---|---|
| Stars | 178.2k | 88.7k |
| Forks | 17.3k | 20.5k |
| 语言 | Go | Python |
| 许可证 | MIT | Apache-2.0 |
| 最近提交 | 2026年8月10日 | 2026年8月11日 |
建议根据你的主要工作流、技术栈语言和集成需求来选择。用于生产前,请进一步查看项目文档、社区活跃度和最近的 GitHub 维护情况。
能。常见架构是 vLLM 作为生产 serving(高吞吐 OpenAI 兼容 API),Ollama 作为个人开发 / 调试工具。两者都用相同的 GGUF / HuggingFace 模型格式。
取决于规模。小流量 < 10 QPS 的内部工具、个人开发者用 Ollama 没问题;超过这个量级,vLLM 的 continuous batching + PagedAttention 优势明显。Ollama 也支持 API server(port 11434),但吞吐比 vLLM 差。
主要场景要 GPU(CUDA / ROCm)。CPU 推理也能跑但速度慢很多。一般建议至少 1 张 24GB+ 的 GPU 跑 7B-13B 模型,4+ 张跑 70B。
本地 RAG demo / 学习 / 单用户应用选 Ollama(5 分钟跑通)。要部署给团队 / 生产环境,选 vLLM。如果你的 RAG 是单机 + < 5 QPS,Ollama 完全够用;超过则上 vLLM。