vLLM

高吞吐、内存高效的 LLM 推理与在线服务引擎,支持 TPU/XPU 等异构加速器

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景

模型推理服务
访问官网
收录动态

1

最近更新

2026-08-26

评价样本

未收录

GitHub Stars

90,134

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景

核心功能

1 项已整理
模型推理服务

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-08-26
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-08-26功能更新

    Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。

vLLM 常见问题

关于 vLLM 的定位、核心功能、价格与最近更新。

vLLM 是什么?

vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景。

vLLM 有哪些核心功能?

vLLM 当前已核验的核心功能包括:模型推理服务。

vLLM 如何收费?

AI Equal 当前没有收录 vLLM 的可验证价格信息。

vLLM 最近有什么更新?

2026-08-26:Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。