SGLang

面向生产环境的大模型高性能推理服务框架

SGLang 是由非营利开源组织 LMSYS 托管的大语言模型与多模态模型高性能推理服务框架,面向生产级部署设计,可在单卡到大规模分布式集群之间提供低延迟、高吞吐的推理服务,目前支撑全球超过 40 万块 GPU 上的大规模生产部署,每天生成数万亿 token

强化学习训练性能基准模型推理服务模型量化压缩
访问官网
收录动态

10

最近更新

2026-09-21

评价样本

未收录

GitHub Stars

36,444

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

SGLang 是由非营利开源组织 LMSYS 托管的大语言模型与多模态模型高性能推理服务框架,面向生产级部署设计,可在单卡到大规模分布式集群之间提供低延迟、高吞吐的推理服务,目前支撑全球超过 40 万块 GPU 上的大规模生产部署,每天生成数万亿 token

核心功能

4 项已整理
强化学习训练
性能基准
模型推理服务
模型量化压缩

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 2 条收录动态
最近更新
2026-09-21
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-21功能更新

    SGLang-Diffusion 发布对阿里 Qwen-Image 2.1 的 Day-0 推理支持,单 checkpoint 即可提供文生图、多图编辑与透明 RGBA 输出;单张 RTX 4090 24GB 配合 CPU offload 可原生精度运行,1024×1024 生成约 18.7 秒、图像编辑约 21.7 秒(峰值显存 22.7 GiB),RTX PRO 6000 96GB 上生成约 8.0 秒。

  2. 2026-09-18版本发布

    SGLang 发布 v0.5.20(713 个 PR、237 位贡献者):新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、K2 Horizon、Hy4-Preview、Nanbeige4.2 及 MiniMax-H3 蒸馏等多款模型推理支持;推出面向 RL rollout 的 return_sampling_mask 采样掩码、CPU-only 推理模拟器与真实流量回放基准;统一 radix tree 支持 SWA 分支点缓存与外部 linker,DSpark 支持 PD 解耦下的 decode 上下文并行;新增 Intel XPU、摩尔线程 MUSA、ROCm 10 发布镜像,DeepSeek-V4 在 Blackwell/RTX PRO 6000 上内核提速;并停用 CUDA 12 通道、移除 prefill CP v1,/v1/responses 存储默认关闭。

  3. 2026-09-09功能更新

    SGLang 社区为蚂蚁百灵新发布的原生多模态模型 Ling-3.0-flash-VL(124B 总参 / 5.5B 激活 MoE,支持原生图像与视频理解、1M token 上下文)提供 Day-0 推理服务支持,用户可在 SGLang 中直接部署该视觉模型,扩展其多模态模型首日上线生态。

  4. 2026-09-07功能更新

    SGLang 为面壁智能 MiniCPM5-2B 提供 Day-0 推理服务支持,发布覆盖 NVIDIA RTX PRO 6000、RTX 5090、DGX Spark 与 Hopper 显卡的部署配方;在 RTX 5090 上启用 DSpark 后,编码任务 bs=1 单用户解码速度超过 250 tok/s。

  5. 2026-09-05版本发布

    SGLang 发布 v0.5.19:新增 Qwen3.8、Granite 4.2、Spark2.5、Ling-3.0 等模型推理支持,并新增 beam search(beam_width 返回 n 个最优序列)、DeepEP v2 ElasticBuffer MoE A2A 后端、LayerNorm 序列并行、W4A8 MoE 量化,统一 radix tree 默认用于所有配置,FlashInfer 升级至 0.6.18,推理性能与部署能力显著增强。

  6. 2026-08-22功能更新

    SGLang 推出新的 Weight Cache Daemon 权重缓存守护进程:在 Ling-2.6-1T FP8 上将权重加载时间缩短至约 0.63 秒(比磁盘加载快约 780 倍),引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟,显著加速大型权重模型启动。

  7. 2026-08-22版本发布

    SGLang 发布 v0.5.18:新增 Muse Glimmer、SANA-Video、LTX-2.5、Cosmos3 Edge & Distilled 等 7 款模型推理支持,引入启动时重叠 checkpoint 分页(Qwen3-32B 在 H100 上启动提速 8.6-11.7%,对比普通默认快 2.38x),CUDA PyTorch 栈升级至 torch 2.13.0,并将所有编译内核缓存统一归入 SGLANG_CACHE_DIR(升级后首次启动需重新编译)。

  8. 2026-08-21版本发布

    SGLang cookbook 收录 Qwen3.8-27B 的 NVFP4 量化与 DFlash2 投机解码推理配方,用户可据此在 SGLang 上以 4-bit 量化运行并启用 DFlash2 投机解码加速 Qwen3.8-27B 推理。

  9. 2026-08-17功能更新

    SGLang 重构 CUDA Graph 支持:拆分 runner/backend 接口使不同捕获策略可复用,社区首创的 Breakable CUDA Graph(BCG)现为 prefill 默认方案,代码量仅为 torch.compile 方案的约四分之一(521 行对 1,771 行),prefill 图构建快 3.8-5.2 倍,并支持基于请求填充的 prefill 全图捕获(prefill 相对 eager 快 1.70-1.93 倍)。

  10. 2026-08-11功能更新

    SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning(30B 总参数/3B 激活的混合 MoE,最长 1M token 上下文),提供专用 docker 镜像与 sglang serve 命令,支持 MTP、DFlash、DSpark 三种投机解码,并通过 OpenAI 兼容 API 接入智能体工作流。

SGLang 常见问题

关于 SGLang 的定位、核心功能、价格与最近更新。

SGLang 是什么?

SGLang 是由非营利开源组织 LMSYS 托管的大语言模型与多模态模型高性能推理服务框架,面向生产级部署设计,可在单卡到大规模分布式集群之间提供低延迟、高吞吐的推理服务,目前支撑全球超过 40 万块 GPU 上的大规模生产部署,每天生成数万亿 token。

SGLang 有哪些核心功能?

SGLang 当前已核验的核心功能包括:强化学习训练、性能基准、模型推理服务、模型量化压缩。

SGLang 如何收费?

AI Equal 当前没有收录 SGLang 的可验证价格信息。

SGLang 最近有什么更新?

2026-09-21:SGLang-Diffusion 发布对阿里 Qwen-Image 2.1 的 Day-0 推理支持,单 checkpoint 即可提供文生图、多图编辑与透明 RGBA 输出;单张 RTX 4090 24GB 配合 CPU offload 可原生精度运行,1024×1024 生成约 18.7 秒、图像编辑约 21.7 秒(峰值显存 22.7 GiB),RTX PRO 6000 96GB 上生成约 8.0 秒。