
vLLM
高吞吐、内存高效的 LLM 推理与在线服务引擎,支持 TPU/XPU 等异构加速器
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景
1
2026-08-26
未收录
90,134
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-08-26
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-08-26功能更新
Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。
vLLM 常见问题
关于 vLLM 的定位、核心功能、价格与最近更新。
vLLM 是什么?
vLLM 是 UC Berkeley Sky Computing Lab 发起、现由逾两千名贡献者共建的开源 LLM 推理与在线服务引擎。它以 PagedAttention 高效管理注意力键值内存,通过连续批处理、分块预填充、前缀缓存实现业界领先的服务吞吐,为 LLM 提供易用、快速且低成本的模型推理与部署。近期集成原生 TPU 支持并对 Qwen3 Embedding 系列做企业级优化,可承载长上下文多模态嵌入推理,支撑语义检索、推荐系统等企业场景。
vLLM 有哪些核心功能?
vLLM 当前已核验的核心功能包括:模型推理服务。
vLLM 如何收费?
AI Equal 当前没有收录 vLLM 的可验证价格信息。
vLLM 最近有什么更新?
2026-08-26:Google Cloud 将原生 TPU 支持集成进 vLLM,针对 Qwen3 Embedding 系列工程优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理,提供硬件安全张量对齐、TPU 惰性加载与编译预热,并配合 GKE Custom Compute Classes 弹性伸缩。