vLLM

vLLM

vLLM

访问网站
我的收藏184 次访问更新于 25 days ago反馈
vLLM screenshot

详细介绍

vLLM

简介

vLLM 是一个快速且易于使用的 LLM 推理与服务库,口号是“Easy, fast, and cheap LLM serving for everyone(人人可用的简单、快速、廉价的 LLM 服务)”。该项目最初由加州大学伯克利分校 Sky Computing Lab 开发,如今已发展为一个非常活跃的开源 AI 项目,由来自 2000 多名贡献者、数十个学术机构和公司组成的多样化社区共同构建与维护。

根据不同类型的用户,vLLM 提供了对应的入门路径:

  • 在 vLLM 上运行开源模型:建议从 Quickstart Guide 开始
  • 基于 vLLM 构建应用:建议从 User Guide 开始
  • 构建 vLLM 本身:建议从 Developer Guide 开始

主要功能

高性能推理

vLLM 在性能方面具备以下特性:

  • 业界领先的推理服务吞吐能力
  • 使用 PagedAttention 高效管理注意力 Key/Value 显存
  • 请求连续批处理(Continuous batching)、分块预填充(chunked prefill)、前缀缓存(prefix caching)
  • 基于 piecewise 与完整 CUDA/HIP 图的快速灵活模型执行
  • 多种量化方案:FP8、MXFP8/MXFP4、NVFP4、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors、ModelOpt、TorchAO 等
  • 优化注意力内核:FlashAttention、FlashInfer、TRTLLM-GEN、FlashMLA、Triton
  • 基于 CUTLASS、TRTLLM-GEN、CuTeDSL 的优化 GEMM/MoE 内核
  • 推测解码(Speculative decoding):n-gram、suffix、EAGLE、DFlash
  • 使用 torch.compile 的自动内核生成与图级转换
  • 分离的预填充、解码与编码(Disaggregated prefill, decode, and encode)

灵活易用

  • 与热门 Hugging Face 模型无缝集成
  • 高吞吐服务,支持并行采样、束搜索等多种解码算法
  • 分布式推理的多种并行方式:张量、流水线、数据、专家、上下文并行
  • 流式输出
  • 使用 xgrammar 或 guidance 生成结构化输出
  • 工具调用与推理解析器
  • 兼容 OpenAI 的 API 服务,以及 Anthropic Messages API 与 gRPC 支持
  • 针对稠密与 MoE 层的高效多 LoRA 支持
  • 硬件支持广泛:NVIDIA GPU、AMD GPU、x86/ARM/PowerPC CPU,以及 Google TPU、Intel Gaudi、IBM Spyre、华为昇腾、Rebellions NPU、Apple Silicon、MetaX GPU 等多种硬件插件

模型架构支持

vLLM 无缝支持 HuggingFace 上 200+ 种模型架构,包括:

  • 仅解码器 LLM(如 Llama、Qwen、Gemma)
  • 混合专家 LLM(如 Mixtral、DeepSeek-V3、Qwen-MoE、GPT-OSS)
  • 混合注意力与状态空间模型(如 Mamba、Qwen3.5)
  • 多模态模型(如 LLaVA、Qwen-VL、Pixtral)
  • 嵌入与检索模型(如 E5-Mistral、GTE、ColBERT)
  • 奖励与分类模型(如 Qwen-Math)

适用场景

  • 模型部署与推理服务:在多种硬件上快速部署开源大模型并提供高吞吐在线服务
  • 应用开发:基于兼容 OpenAI 的 API 或 gRPC 构建对话、工具调用、结构化生成等 LLM 应用
  • 分布式与多硬件推理:利用张量/流水线/专家等并行及各类加速器插件进行规模化推理
  • 研究与二次开发:通过 Developer Guide 参与 vLLM 内核、调度与硬件适配的研发

更多背景可参考 vLLM 发布博客(PagedAttention 介绍)、SOSP 2023 论文,以及关于连续批处理提升吞吐的研究。