vLLM

活跃
GitHub Python Apache-2.0

简介

vLLM 是一个高吞吐量、低内存占用的 LLM 推理与服务引擎,支持连续批处理、PagedAttention 等优化技术,广泛用于生产环境中的大模型部署。

核心特性

  • PagedAttention 内存管理 — 通过分页机制高效管理注意力 KV cache,大幅降低显存占用
  • 连续批处理与分块预取 — 支持 continuous batching、chunked prefill 和 prefix caching,实现高吞吐推理
  • 多量化格式支持 — 覆盖 FP8、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors 等主流量化方案
  • 200+ 模型架构兼容 — 无缝支持 HuggingFace 上的 Decoder-only、MoE、混合注意力、多模态等模型
  • 分布式推理 — 支持张量并行、流水线并行、数据并行、专家并行和上下文并行
  • OpenAI 兼容 API — 提供 OpenAI 兼容服务器,同时支持 Anthropic Messages API 和 gRPC 协议

适用场景

💡 生产环境 LLM 推理服务部署,为 AI 应用提供高吞吐低延迟的模型 API
💡 多模型并行推理,在多个 GPU 上分布式运行大参数模型
💡 量化模型部署,使用 INT8/INT4/FP8 等量化方案在有限显存下运行大模型
💡 构建 RAG 系统的推理后端,为检索增强生成场景提供高效的文本生成能力
💡 多模态模型服务,部署支持图文理解的多模态大模型推理

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(91.3k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • Issue 积压较多(7.7k 个 open issues)

快速开始

# 安装 vLLM
pip install vllm

# 使用 OpenAI 兼容 API 启动服务
python -m vllm.entrypoints.openai.api_server \
    --model meta-llama/Llama-3-8B-Instruct

# 或使用 Python API 直接推理
from vllm import LLM
llm = LLM(model="meta-llama/Llama-3-8B-Instruct")
output = llm.generate("Hello, what is AI?")
print(output[0].outputs[0].text)

相关项目

OpenLLM

12.5k · Python
活跃 A+

OpenLLM 是一个开源 LLM 部署平台,可将 DeepSeek、Llama 等任意开源模型以 OpenAI 兼容的 API 端点形式部署到云端。支持模型微调、量化和分布式推理,简化生产环境中的大模型运维。

llmpythonapi +3
  • · 任意开源LLM支持:运行DeepSeek、Llama、Qwen等任意开源模型
  • · OpenAI兼容API:提供与OpenAI API兼容的端点,无缝集成现有应用
  • · 内置聊天UI:提供开箱即用的聊天界面

OpenRAG

4.6k · Python
活跃 A

一站式检索增强生成(RAG)平台,集成 Langflow、Docling 和 OpenSearch,提供从文档解析到向量检索再到生成的完整流水线,支持多种模型和向量数据库。

ragllmframework +2
  • · 一体化 RAG 平台:文档摄入、向量搜索和 LLM 驱动的生成集成于单一包中
  • · 基于 OpenSearch,提供企业级可扩展的向量检索
  • · 基于 Langflow 的拖拽式可视化工作流构建器,快速迭代 RAG 管道

WrenAI

17.5k · Python
活跃 A

WrenAI 是一个开源的 Text-to-SQL 和 Text-to-Chart GenBI Agent,内置语义层,支持用自然语言查询数据库,自动生成 SQL 语句和可视化图表,兼容 PostgreSQL、BigQuery、Snowflake 等十余种数据源。

llmtypescriptagent +2
  • · 开源上下文层,为 AI Agent 提供业务语义、示例和治理能力
  • · Agent 驱动设计,CLI 内置工作流指南按需加载
  • · 建模定义语言(MDL)支持模型、关系、立方体、指标和行级/列级访问控制

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率