跳到内容

欢迎来到 vLLM

vLLM Light vLLM Dark

为每个人提供简单、快速且便宜的 LLM 推理服务

Star Watch Fork

vLLM 是一个快速且易于使用的 LLM 推理和服务库。

vLLM 最初是在加州大学伯克利分校的 Sky Computing Lab 开发的,现已成长为最活跃的开源 AI 项目之一,由来自数十家学术机构和公司的 2000 多名贡献者组成的多元化社区构建和维护。

从哪里开始了解 vLLM 取决于用户类型。如果您希望:

有关 vLLM 开发的信息,请参阅

vLLM 的快速体现在:

  • 最先进的推理吞吐量
  • 通过 PagedAttention 有效管理 Attention 键(Key)和值(Value)内存
  • 对传入请求进行连续批处理(Continuous batching)、分块预填充(chunked prefill)以及前缀缓存(prefix caching)
  • 通过分段和完整的 CUDA/HIP 图实现快速灵活的模型执行
  • 量化支持:FP8、MXFP8/MXFP4、NVFP4、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors、ModelOpt、TorchAO 等 更多
  • 优化的 Attention 内核,包括 FlashAttention、FlashInfer、TRTLLM-GEN、FlashMLA 和 Triton
  • 使用 CUTLASS、TRTLLM-GEN、CuTeDSL 优化各种精度的 GEMM/MoE 内核
  • 投机解码(Speculative decoding),包括 n-gram、suffix、EAGLE、DFlash
  • 使用 torch.compile 实现自动内核生成和图级转换
  • 解耦的预填充(prefill)、解码(decode)和编码(encode)

vLLM 的灵活和易用体现在:

  • 与流行的 Hugging Face 模型无缝集成
  • 支持各种解码算法的高吞吐量服务,包括 并行采样束搜索 (beam search)
  • 支持分布式推理的张量、流水线、数据、专家和上下文并行
  • 流式输出
  • 使用 xgrammar 或 guidance 生成结构化输出
  • 工具调用(Tool calling)和推理(reasoning)解析器
  • 兼容 OpenAI 的 API 服务器,并支持 Anthropic Messages API 和 gRPC
  • 对稠密层和 MoE 层的高效 multi-LoRA 支持
  • 支持 NVIDIA GPU、AMD GPU 和 x86/ARM/PowerPC CPU。此外,还支持各种硬件插件,如 Google TPU、Intel Gaudi、IBM Spyre、华为昇腾 (Ascend)、Rebellions NPU、Apple Silicon、摩尔线程 (MetaX) GPU 等。

vLLM 无缝支持 HuggingFace 上的 200 多种模型架构,包括:

  • Decoder-only LLM(如 Llama, Qwen, Gemma)
  • 混合专家模型 MoE LLM(如 Mixtral, DeepSeek-V3, Qwen-MoE, GPT-OSS)
  • 混合注意力与状态空间模型(如 Mamba, Qwen3.5)
  • 多模态模型(如 LLaVA, Qwen-VL, Pixtral)
  • 嵌入(Embedding)与检索模型(如 E5-Mistral, GTE, ColBERT)
  • 奖励与分类模型(如 Qwen-Math)

点击 此处 查看支持模型的完整列表。

欲了解更多信息,请查看以下资源: