vLLM

高吞吐、内存高效的 LLM 推理与在线服务引擎,支持 TPU/XPU 等异构加速器

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景

内容水印函数调用可观测性追踪强化学习训练投机解码加速模型推理服务模型量化压缩视频理解
访问官网
收录动态

7

最近更新

2026-10-05

评价样本

未收录

GitHub Stars

93,505

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景

核心功能

8 项已整理
内容水印
函数调用
可观测性追踪
强化学习训练
投机解码加速
模型推理服务
模型量化压缩
视频理解

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-10-05
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-10-05版本发布

    vLLM 发布 v0.31.0(717 次提交、307 位贡献者):新增 vllm preload 权重缓存守护进程,引擎跨重启无需重新加载权重(支持数据并行、MTP draft、/health 端点),实验性 vllm snapshot create/restore 可经 CRIU 恢复已初始化引擎;Model Runner V2 支持 draft 模型投机解码、自定义 logits 处理器与 LiLiCorr drafter;大规模服务新增 MoonEP all2all 后端、prefill 上下文并行、DeepEPv2 序列并行与 KV 卸载背压检测;DeepSeek-V4.1-Flash 在 SM100 默认启用 FlashMLA mega attention + NVFP4 压缩 KV 缓存;安全上默认拒绝每请求多模态 kwargs,前缀缓存块哈希纳入 LoRA 路径防碰撞;并含多项破坏性变更。

  2. 2026-09-22版本发布

    vLLM 发布 v0.30.0(762 次提交、315 位贡献者):新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL 等模型支持;Fast Start 权重缓存守护进程支持 FP4 与多节点 TP,引擎重启经 CUDA IPC 映射免重新加载;新增 Gumbel-max 水印生成与检测(支持每请求退出、兼容投机解码);HiSparse 主机驻留层将稀疏 MLA 解码的 KV 页溢出到固定主机内存;Model Runner V2 支持流水线并行下 MTP/EAGLE3 投机解码,图捕获由 12s 降至 2s;并含多项破坏性变更(scale-out 端点改为 --enable-scale-out 显式开启)。

  3. 2026-09-17功能更新

    vLLM 官方博客宣布集成 PyNvVideoCodec,新增 NVIDIA GPU 硬件视频解码(NVDEC)支持:将 VLM 视频描述/标注任务的视频解码负载从 CPU(OpenCV+FFMPEG)转移到 GPU,消除多 GPU 节点上的 CPU 解码瓶颈,可良好扩展至 8 卡;在 8xH100 上 GPU 解码吞吐较 CPU 方案提升一倍以上。功能已内置标准 CUDA 版 vLLM,自定义安装需依赖 PyNvVideoCodec==2.0.4,并需启动 CUDA MPS、通过 --media-io-kwargs 指定 pynvvideocodec 后端。

  4. 2026-09-11功能更新

    SemiAnalysis 于 2026-09-11 实测确认:DeepSeek V4.1 Flash 发布首日,NVIDIA 版 vLLM 开箱即用,在 H100、H200、B200、B300、GB200、GB300 全部 6 款 GPU SKU 上零问题运行;相比之下 AMD ROCm 版 vLLM 当时仍无法运行该模型。为部署 V4.1 Flash 的硬件与推理引擎选型提供直接参考。

  5. 2026-09-09版本发布

    vLLM 发布 v0.29.0(594 次提交、277 位贡献者):Model Runner V2 成为所有模型默认执行器;新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA/GraniteMoeSWA、NemotronH Omni Reasoning V3、Kimi K3 NVFP4 等模型支持;投机解码支持每请求接受率指标;RL 训练新增 sharded_rdt P2P 权重同步、rank-local IPC 与稀疏 checkpoint 更新;量化新增 MXFP8/FP4/AutoRound FP8 后端;并含多项破坏性变更。

  6. 2026-09-07功能更新

    vLLM 稳定版对面壁智能 MiniCPM5-2B 提供 day-0 原生支持:自 v0.21.0 起可以标准 LlamaForCausalLM 架构直接加载该 2.6B Dense 模型,无需自定义算子或模型代码分支,支持原生 128K/131K 上下文与同一 checkpoint 的 Think/No-Think 切换;新增 minicpm5 工具调用解析器(PR #43175),可用 --enable-auto-tool-choice --tool-call-parser minicpm5 启用 XML 风格工具调用。

  7. 2026-08-26功能更新

    Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。

vLLM 常见问题

关于 vLLM 的定位、核心功能、价格与最近更新。

vLLM 是什么?

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景。

vLLM 有哪些核心功能?

vLLM 当前已核验的核心功能包括:内容水印、函数调用、可观测性追踪、强化学习训练、投机解码加速、模型推理服务、模型量化压缩、视频理解。

vLLM 如何收费?

AI Equal 当前没有收录 vLLM 的可验证价格信息。

vLLM 最近有什么更新?

2026-10-05:vLLM 发布 v0.31.0(717 次提交、307 位贡献者):新增 vllm preload 权重缓存守护进程,引擎跨重启无需重新加载权重(支持数据并行、MTP draft、/health 端点),实验性 vllm snapshot create/restore 可经 CRIU 恢复已初始化引擎;Model Runner V2 支持 draft 模型投机解码、自定义 logits 处理器与 LiLiCorr drafter;大规模服务新增 MoonEP all2all 后端、prefill 上下文并行、DeepEPv2 序列并行与 KV 卸载背压检测;DeepSeek-V4.1-Flash 在 SM100 默认启用 FlashMLA mega attention + NVFP4 压缩 KV 缓存;安全上默认拒绝每请求多模态 kwargs,前缀缓存块哈希纳入 LoRA 路径防碰撞;并含多项破坏性变更。