vLLM
活跃简介
vLLM 是一个高吞吐量、低内存占用的 LLM 推理与服务引擎,支持连续批处理、PagedAttention 等优化技术,广泛用于生产环境中的大模型部署。
核心特性
- PagedAttention 内存管理 — 通过分页机制高效管理注意力 KV cache,大幅降低显存占用
- 连续批处理与分块预取 — 支持 continuous batching、chunked prefill 和 prefix caching,实现高吞吐推理
- 多量化格式支持 — 覆盖 FP8、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors 等主流量化方案
- 200+ 模型架构兼容 — 无缝支持 HuggingFace 上的 Decoder-only、MoE、混合注意力、多模态等模型
- 分布式推理 — 支持张量并行、流水线并行、数据并行、专家并行和上下文并行
- OpenAI 兼容 API — 提供 OpenAI 兼容服务器,同时支持 Anthropic Messages API 和 gRPC 协议
适用场景
💡 生产环境 LLM 推理服务部署,为 AI 应用提供高吞吐低延迟的模型 API
💡 多模型并行推理,在多个 GPU 上分布式运行大参数模型
💡 量化模型部署,使用 INT8/INT4/FP8 等量化方案在有限显存下运行大模型
💡 构建 RAG 系统的推理后端,为检索增强生成场景提供高效的文本生成能力
💡 多模态模型服务,部署支持图文理解的多模态大模型推理
快速开始
# 安装 vLLM
pip install vllm
# 使用 OpenAI 兼容 API 启动服务
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3-8B-Instruct
# 或使用 Python API 直接推理
from vllm import LLM
llm = LLM(model="meta-llama/Llama-3-8B-Instruct")
output = llm.generate("Hello, what is AI?")
print(output[0].outputs[0].text)