简介
vLLM 是一个快速且易于使用的 LLM 推理与服务库,口号是“Easy, fast, and cheap LLM serving for everyone(人人可用的简单、快速、廉价的 LLM 服务)”。该项目最初由加州大学伯克利分校 Sky Computing Lab 开发,如今已发展为一个非常活跃的开源 AI 项目,由来自 2000 多名贡献者、数十个学术机构和公司组成的多样化社区共同构建与维护。
根据不同类型的用户,vLLM 提供了对应的入门路径:
- 在 vLLM 上运行开源模型:建议从 Quickstart Guide 开始
- 基于 vLLM 构建应用:建议从 User Guide 开始
- 构建 vLLM 本身:建议从 Developer Guide 开始
主要功能
高性能推理
vLLM 在性能方面具备以下特性:
- 业界领先的推理服务吞吐能力
- 使用 PagedAttention 高效管理注意力 Key/Value 显存
- 请求连续批处理(Continuous batching)、分块预填充(chunked prefill)、前缀缓存(prefix caching)
- 基于 piecewise 与完整 CUDA/HIP 图的快速灵活模型执行
- 多种量化方案:FP8、MXFP8/MXFP4、NVFP4、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors、ModelOpt、TorchAO 等
- 优化注意力内核:FlashAttention、FlashInfer、TRTLLM-GEN、FlashMLA、Triton
- 基于 CUTLASS、TRTLLM-GEN、CuTeDSL 的优化 GEMM/MoE 内核
- 推测解码(Speculative decoding):n-gram、suffix、EAGLE、DFlash
- 使用 torch.compile 的自动内核生成与图级转换
- 分离的预填充、解码与编码(Disaggregated prefill, decode, and encode)
灵活易用
- 与热门 Hugging Face 模型无缝集成
- 高吞吐服务,支持并行采样、束搜索等多种解码算法
- 分布式推理的多种并行方式:张量、流水线、数据、专家、上下文并行
- 流式输出
- 使用 xgrammar 或 guidance 生成结构化输出
- 工具调用与推理解析器
- 兼容 OpenAI 的 API 服务,以及 Anthropic Messages API 与 gRPC 支持
- 针对稠密与 MoE 层的高效多 LoRA 支持
- 硬件支持广泛:NVIDIA GPU、AMD GPU、x86/ARM/PowerPC CPU,以及 Google TPU、Intel Gaudi、IBM Spyre、华为昇腾、Rebellions NPU、Apple Silicon、MetaX GPU 等多种硬件插件
模型架构支持
vLLM 无缝支持 HuggingFace 上 200+ 种模型架构,包括:
- 仅解码器 LLM(如 Llama、Qwen、Gemma)
- 混合专家 LLM(如 Mixtral、DeepSeek-V3、Qwen-MoE、GPT-OSS)
- 混合注意力与状态空间模型(如 Mamba、Qwen3.5)
- 多模态模型(如 LLaVA、Qwen-VL、Pixtral)
- 嵌入与检索模型(如 E5-Mistral、GTE、ColBERT)
- 奖励与分类模型(如 Qwen-Math)
适用场景
- 模型部署与推理服务:在多种硬件上快速部署开源大模型并提供高吞吐在线服务
- 应用开发:基于兼容 OpenAI 的 API 或 gRPC 构建对话、工具调用、结构化生成等 LLM 应用
- 分布式与多硬件推理:利用张量/流水线/专家等并行及各类加速器插件进行规模化推理
- 研究与二次开发:通过 Developer Guide 参与 vLLM 内核、调度与硬件适配的研发
更多背景可参考 vLLM 发布博客(PagedAttention 介绍)、SOSP 2023 论文,以及关于连续批处理提升吞吐的研究。