
vLLM
高吞吐、内存高效的 LLM 推理与在线服务引擎,支持 TPU/XPU 等异构加速器
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景
7
2026-10-05
未收录
93,505
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-10-05
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-10-05版本发布
vLLM 发布 v0.31.0(717 次提交、307 位贡献者):新增 vllm preload 权重缓存守护进程,引擎跨重启无需重新加载权重(支持数据并行、MTP draft、/health 端点),实验性 vllm snapshot create/restore 可经 CRIU 恢复已初始化引擎;Model Runner V2 支持 draft 模型投机解码、自定义 logits 处理器与 LiLiCorr drafter;大规模服务新增 MoonEP all2all 后端、prefill 上下文并行、DeepEPv2 序列并行与 KV 卸载背压检测;DeepSeek-V4.1-Flash 在 SM100 默认启用 FlashMLA mega attention + NVFP4 压缩 KV 缓存;安全上默认拒绝每请求多模态 kwargs,前缀缓存块哈希纳入 LoRA 路径防碰撞;并含多项破坏性变更。
- 2026-09-22版本发布
vLLM 发布 v0.30.0(762 次提交、315 位贡献者):新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL 等模型支持;Fast Start 权重缓存守护进程支持 FP4 与多节点 TP,引擎重启经 CUDA IPC 映射免重新加载;新增 Gumbel-max 水印生成与检测(支持每请求退出、兼容投机解码);HiSparse 主机驻留层将稀疏 MLA 解码的 KV 页溢出到固定主机内存;Model Runner V2 支持流水线并行下 MTP/EAGLE3 投机解码,图捕获由 12s 降至 2s;并含多项破坏性变更(scale-out 端点改为 --enable-scale-out 显式开启)。
- 2026-09-17功能更新
vLLM 官方博客宣布集成 PyNvVideoCodec,新增 NVIDIA GPU 硬件视频解码(NVDEC)支持:将 VLM 视频描述/标注任务的视频解码负载从 CPU(OpenCV+FFMPEG)转移到 GPU,消除多 GPU 节点上的 CPU 解码瓶颈,可良好扩展至 8 卡;在 8xH100 上 GPU 解码吞吐较 CPU 方案提升一倍以上。功能已内置标准 CUDA 版 vLLM,自定义安装需依赖 PyNvVideoCodec==2.0.4,并需启动 CUDA MPS、通过 --media-io-kwargs 指定 pynvvideocodec 后端。
- 2026-09-11功能更新
SemiAnalysis 于 2026-09-11 实测确认:DeepSeek V4.1 Flash 发布首日,NVIDIA 版 vLLM 开箱即用,在 H100、H200、B200、B300、GB200、GB300 全部 6 款 GPU SKU 上零问题运行;相比之下 AMD ROCm 版 vLLM 当时仍无法运行该模型。为部署 V4.1 Flash 的硬件与推理引擎选型提供直接参考。
- 2026-09-09版本发布
vLLM 发布 v0.29.0(594 次提交、277 位贡献者):Model Runner V2 成为所有模型默认执行器;新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA/GraniteMoeSWA、NemotronH Omni Reasoning V3、Kimi K3 NVFP4 等模型支持;投机解码支持每请求接受率指标;RL 训练新增 sharded_rdt P2P 权重同步、rank-local IPC 与稀疏 checkpoint 更新;量化新增 MXFP8/FP4/AutoRound FP8 后端;并含多项破坏性变更。
- 2026-09-07功能更新
vLLM 稳定版对面壁智能 MiniCPM5-2B 提供 day-0 原生支持:自 v0.21.0 起可以标准 LlamaForCausalLM 架构直接加载该 2.6B Dense 模型,无需自定义算子或模型代码分支,支持原生 128K/131K 上下文与同一 checkpoint 的 Think/No-Think 切换;新增 minicpm5 工具调用解析器(PR #43175),可用 --enable-auto-tool-choice --tool-call-parser minicpm5 启用 XML 风格工具调用。
- 2026-08-26功能更新
Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。
vLLM 常见问题
关于 vLLM 的定位、核心功能、价格与最近更新。
vLLM 是什么?
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景。
vLLM 有哪些核心功能?
vLLM 当前已核验的核心功能包括:内容水印、函数调用、可观测性追踪、强化学习训练、投机解码加速、模型推理服务、模型量化压缩、视频理解。
vLLM 如何收费?
AI Equal 当前没有收录 vLLM 的可验证价格信息。
vLLM 最近有什么更新?
2026-10-05:vLLM 发布 v0.31.0(717 次提交、307 位贡献者):新增 vllm preload 权重缓存守护进程,引擎跨重启无需重新加载权重(支持数据并行、MTP draft、/health 端点),实验性 vllm snapshot create/restore 可经 CRIU 恢复已初始化引擎;Model Runner V2 支持 draft 模型投机解码、自定义 logits 处理器与 LiLiCorr drafter;大规模服务新增 MoonEP all2all 后端、prefill 上下文并行、DeepEPv2 序列并行与 KV 卸载背压检测;DeepSeek-V4.1-Flash 在 SM100 默认启用 FlashMLA mega attention + NVFP4 压缩 KV 缓存;安全上默认拒绝每请求多模态 kwargs,前缀缓存块哈希纳入 LoRA 路径防碰撞;并含多项破坏性变更。