SGLang 是由非营利开源组织 LMSYS 托管的大语言模型与多模态模型高性能推理服务框架,面向生产级部署设计,可在单卡到大规模分布式集群之间提供低延迟、高吞吐的推理服务,目前支撑全球超过 40 万块 GPU 上的大规模生产部署,每天生成数万亿 token。
Capability Timeline
模型量化压缩
对模型权重做量化/压缩以降低显存与算力占用,产出可本地推理的低比特构建
相关工具
14Liquid AI 提供 Liquid Foundation Models(LFM)系列基础模型,主打在手机、笔记本、汽车、可穿戴等设备本地运行的低延迟推理,可在 CPU、GPU、NPU 上通过 llama.cpp、MLX、ONNX、CoreML、vLLM 等运行时部署,并支持针对自有数据与具体场景做微调定制,形成从架构、优化到部署的全栈方案。
Atomic Chat 是一款开源免费的本地 AI 聊天应用,支持 Mac、Windows、Linux、iOS 和 Android 平台。内置 Google TurboQuant 量化技术,可将大模型压缩至 3-bit 并实现 8 倍推理加速和 6 倍内存节省,且无精度损失。支持 1000+ 模型(GGUF/MLX/ONNX),可一键运行 Hermes、Cline 等 Agent,所有数据完全离线运行于本地设备。
Ling-3.0-tiny 是蚂蚁百灵(inclusionAI)开源的轻量级混合推理 MoE 模型,总参数 7.9B,每 token 仅激活 1.3B 参数,采用 KDA 与 MLA 按 3:1 交替堆叠加 128 路由专家的稀疏 MoE FFN。支持快速响应与多步骤推理两种模式,可按请求开关思考模式,在智能体任务、代码、数学与科学推理、长上下文理解上表现均衡,并提供 BF16、FP8、INT4 权重,已在 DGX Spark、Apple Silicon MacBook 与 Mac mini 上验证本地部署。
ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中
LFM2.5-2.6B 是 Liquid AI 面向端侧部署的 26 亿参数混合架构智能体模型,基于 LFM2 架构并做智能体后训练,支持 131072 token 上下文与 16 种语言,可完成规划、工具调用与多步任务。官方提供基础版与后训练版,并有 GGUF、ONNX、MLX 等量化与跨平台格式,可在手机、CPU 与 Apple Silicon 上本地运行推理。
LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理。
Ling-3.0-flash 是蚂蚁百灵(inclusionAI)推出的混合专家(MoE)大模型,总参数约 1240 亿,每 token 激活约 51 亿参数,支持 262144 token 上下文窗口、单次最大输出 32768 token。该模型已上架 OpenRouter,可通过统一 API 免费调用,适合需要长上下文与低成本推理的开发场景。
LTX-Video 是 Lightricks 推出的基于 DiT 架构的视频生成模型,官方称其为首个能实时生成高质量视频的 DiT 视频生成模型,可在 1216×704 分辨率下输出 30 FPS 视频。模型定位为扩散式图生视频模型,提供 13B 与 2B 多种规格,并包含 distilled 蒸馏版与 fp8 量化版本以降低显存占用、加快迭代速度,同时官方提供 inference.py 配置与推荐的 ComfyUI 工作流供直接调用。
Maple-Preview 是 DeepGrove 推出的开源 20B-A1B 三值权重推理大模型,采用 24 层、256 专家(8 个激活)与 3:1 SWA-512:GA 注意力结构,专为端侧高效推理设计。检查点仅 5.31GB,支持 131,072 token 上下文,在 M4 Mac mini 上可达 218 tokens/s,能解答 IMO 级数学题,按 MIT 许可发布。
Muse Glimmer 是 Meta Superintelligence Lab 发布的 300 亿参数因果语言模型,带独立感知编码器,专为消费级硬件上的自主智能体任务打造。它把多步推理、可靠工具调用、图文多模态理解与失败恢复整合进单一模型,可在本地运行而无需云端基础设施或联网,并兼容 OpenClaw、Hermes Agent 等智能体编排框架。
Needle 2 是 Cactus 推出的开源 45M 参数端侧模型,专注工具调用、设备操作与结构化抽取。整个模型是单个 14MB 二进制文件,单次会话约占 28MB 内存,可在树莓派 5、ESP32 级微控制器、VR 头显及 200 美元以下手机上离线运行;输出由 schema 编译的字节级语法约束,并带置信度分数决定本地执行或升级云端,仓库支持本机 LoRA 微调。
Soup 是开源的大模型微调与后训练命令行工具,用一份 YAML 即可自动生成训练配置,涵盖 SFT 与 DPO、ORPO、SimPO、KTO 等对齐方法。其 Layer Streaming 把冻结底座放在内存或 NVMe 中逐层送入显存并量化为 NF4,使 Llama-3.1-8B 可在 4 GB 显存笔记本 GPU 上微调,并可与 HuggingFace、Ollama、vLLM 等生态对接。
Swiftlet 是面向 Apple 设备的 Swift + Metal 模型运行时,支持 Qwen3-Next 与 Qwen3.5/3.6 的 MoE 混合模型家族。它只将小型稠密核心常驻内存,按需从存储流式加载路由专家权重,使 4-bit Qwen3.6-35B 峰值内存约 2.6 GB、Qwen3-Next-80B 约 4.3 GB,在 M5 Mac 可达每秒数 token,35B 还能在 iPhone 17 以约 2.5 GB 内存运行。




