概览

Ollama 与 vLLM:本地推理 vs 服务化推理

Ollama(177k+ stars,MIT)是本地 LLM 推理服务(默认 :11434 端口),支持一键 ollama run <model> 启动模型;vLLM(88k+ stars,Apache-2.0)主打生产级高吞吐 LLM serving,多 GPU + continuous batching。本文从定位、部署难度、性能优化、生态和典型场景五个角度对比。

对比项目

Ollama

Go · MIT

178.2k ★

本地运行各种开源大模型的命令行工具,模型即命令可启动。生态繁荣。

llmlocalinferenceagent-tools
查看项目 →

vLLM

Python · Apache-2.0

88.7k ★

vLLM 是一个高吞吐量、低内存占用的 LLM 推理与服务引擎,支持连续批处理、PagedAttention 等优化技术,广泛用于生产环境中的大模型部署。

llmpythonframeworkapiobservability
查看项目 →

功能对比

适合场景 OllamavLLM
产品定位 本地推理服务:默认监听 :11434,提供 REST API(/api/generate /api/chat /api/embed 等)。桌面应用 / 个人开发者 / 离线场景通用 生产级 LLM serving:高吞吐 + 多 GPU + continuous batching。OpenAI 兼容 API。适合大模型生产部署
上手难度 macOS / Linux 装一个 binary 就跑。Modelfile 自定义模型 + 默认 Modelfile 库 (llama3 / qwen / mistral 等) 开箱即用 需要 Python + pip install vllm + 选择模型 + 配置 GPU。生产环境一般要 Docker + Kubernetes
性能优化 开箱即用,但定制优化空间小。CPU / GPU 推理走 llama.cpp 底层 PagedAttention + continuous batching + speculative decoding。吞吐量是 vLLM 的招牌优势
生态集成 Open WebUI / AnythingLLM / LangChain / LlamaIndex 等都内置 Ollama 支持。Modelfile 生态丰富 OpenAI 兼容 API 是事实标准,几乎所有 LLM 框架 / agent SDK 都直接对接。HuggingFace 生态集成完整
典型场景 桌面 LLM 体验 / 个人开发 / 离线场景 / 边缘设备 / 嵌入式。不想碰 Kubernetes 也能用 中等规模生产部署(10-1000 QPS) / 多模型路由 / GPU 集群 / 高吞吐 Agent 后端

GitHub 数据

Metric OllamavLLM
Stars 178.2k88.7k
Forks 17.3k20.5k
语言 GoPython
许可证 MITApache-2.0
最近提交 2026年8月10日2026年8月11日

应该选择哪一个?

建议根据你的主要工作流、技术栈语言和集成需求来选择。用于生产前,请进一步查看项目文档、社区活跃度和最近的 GitHub 维护情况。

常见问题

Ollama 和 vLLM 能同时用吗?

能。常见架构是 vLLM 作为生产 serving(高吞吐 OpenAI 兼容 API),Ollama 作为个人开发 / 调试工具。两者都用相同的 GGUF / HuggingFace 模型格式。

Ollama 适合生产吗?

取决于规模。小流量 < 10 QPS 的内部工具、个人开发者用 Ollama 没问题;超过这个量级,vLLM 的 continuous batching + PagedAttention 优势明显。Ollama 也支持 API server(port 11434),但吞吐比 vLLM 差。

vLLM 一定要 GPU 吗?

主要场景要 GPU(CUDA / ROCm)。CPU 推理也能跑但速度慢很多。一般建议至少 1 张 24GB+ 的 GPU 跑 7B-13B 模型,4+ 张跑 70B。

选 Ollama 还是 vLLM 给本地 RAG?

本地 RAG demo / 学习 / 单用户应用选 Ollama(5 分钟跑通)。要部署给团队 / 生产环境,选 vLLM。如果你的 RAG 是单机 + < 5 QPS,Ollama 完全够用;超过则上 vLLM。