Cloudflare Workers AI
Cloudflare 边缘 GPU 上的开源模型推理服务
Cloudflare Workers AI 在 Cloudflare 各地数据中心的 GPU 上为开源大模型提供推理服务,让请求在靠近用户的位置执行。平台已承载 Moonshot 的 Kimi K 系列与 Z.ai 的 GLM 等长上下文 MoE 模型,并通过 KV 缓存 FP8 量化、模型权重 INT4 压缩、预填充与解码分离等手段提升单卡并发与吞吐,在不改变模型精度的前提下降低单 Token 成本
1
2026-08-03
未收录
—
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
Cloudflare Workers AI 在 Cloudflare 各地数据中心的 GPU 上为开源大模型提供推理服务,让请求在靠近用户的位置执行。平台已承载 Moonshot 的 Kimi K 系列与 Z.ai 的 GLM 等长上下文 MoE 模型,并通过 KV 缓存 FP8 量化、模型权重 INT4 压缩、预填充与解码分离等手段提升单卡并发与吞吐,在不改变模型精度的前提下降低单 Token 成本
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-08-03
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-08-03功能更新
Cloudflare Workers AI 上线三项推理优化并用于生产流量:Kimi K2.6 解码阶段 KV 缓存由 BF16 改为 FP8,可驻留上下文从约 68.6 万 Token 翻倍到约 137 万,并发从 32 提到 64、峰值吞吐 2192 tok/s(比 BF16 高约 41%)、单 Token 成本降约 30%;GLM 5.2 权重从 FP8 压缩为 INT4,检查点 705GB 降至 421GB,单卡显存 88GB 降至 52GB,可容约 118 万 Token 缓存;全部基于开源推理框架 SGLang,评测精度无变化,影响长上下文模型 API 调用的并发与成本。
Cloudflare Workers AI 常见问题
关于 Cloudflare Workers AI 的定位、核心功能、价格与最近更新。
Cloudflare Workers AI 是什么?
Cloudflare Workers AI 在 Cloudflare 各地数据中心的 GPU 上为开源大模型提供推理服务,让请求在靠近用户的位置执行。平台已承载 Moonshot 的 Kimi K 系列与 Z.ai 的 GLM 等长上下文 MoE 模型,并通过 KV 缓存 FP8 量化、模型权重 INT4 压缩、预填充与解码分离等手段提升单卡并发与吞吐,在不改变模型精度的前提下降低单 Token 成本。
Cloudflare Workers AI 有哪些核心功能?
Cloudflare Workers AI 当前已核验的核心功能包括:模型推理服务。
Cloudflare Workers AI 如何收费?
AI Equal 当前没有收录 Cloudflare Workers AI 的可验证价格信息。
Cloudflare Workers AI 最近有什么更新?
2026-08-03:Cloudflare Workers AI 上线三项推理优化并用于生产流量:Kimi K2.6 解码阶段 KV 缓存由 BF16 改为 FP8,可驻留上下文从约 68.6 万 Token 翻倍到约 137 万,并发从 32 提到 64、峰值吞吐 2192 tok/s(比 BF16 高约 41%)、单 Token 成本降约 30%;GLM 5.2 权重从 FP8 压缩为 INT4,检查点 705GB 降至 421GB,单卡显存 88GB 降至 52GB,可容约 118 万 Token 缓存;全部基于开源推理框架 SGLang,评测精度无变化,影响长上下文模型 API 调用的并发与成本。