colibri

在本地电脑上运行超大开源 MoE 模型的极简推理引擎

colibri 是开源纯 C 本地大模型推理引擎,无需 GPU 即可在普通电脑内存与磁盘上运行数千亿参数 MoE 开源模型。内置 GLM、DeepSeek、Qwen、Kimi、MiMo 等 13 个引擎,支持本地对话、OpenAI 兼容 API 服务、工具调用、图像理解与 Qwen-Image 文本生成图像,并提供 System One 决策 API。v2.0.0 新增 Vulkan GPU 加速、双 GPU 专家分层与最多 16 路并发会话

函数调用命令行工具图像理解图像生成对话助手工具协议集成投机解码加速本地模型推理模型推理服务模型量化压缩
访问官网
收录动态

1

最近更新

2026-10-06

评价样本

未收录

社区规模

—

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

colibri 是开源纯 C 本地大模型推理引擎,无需 GPU 即可在普通电脑内存与磁盘上运行数千亿参数 MoE 开源模型。内置 GLM、DeepSeek、Qwen、Kimi、MiMo 等 13 个引擎,支持本地对话、OpenAI 兼容 API 服务、工具调用、图像理解与 Qwen-Image 文本生成图像,并提供 System One 决策 API。v2.0.0 新增 Vulkan GPU 加速、双 GPU 专家分层与最多 16 路并发会话

核心功能

10 项已整理
函数调用
命令行工具
图像理解
图像生成
对话助手
工具协议集成
投机解码加速
本地模型推理
模型推理服务
模型量化压缩

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-10-06
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-10-06版本发布

    colibri 发布 v2.0.0:全部 MoE 引擎支持 Vulkan GPU 加速,包括共享专家层、稠密层设备链、双 GPU 专家分布与部分层上卡;每个文本引擎最多 16 路并发会话(coli serve --kv-slots);新增 MiMo-V2.6、Qwen3-Coder-30B、Qwen-Image-2.1(文本生成图像)引擎与 Qwen3.8-27B 稠密检查点;Qwen3.8 Flash Next 默认开启 int4 专家与基于 MTP 头的投机解码(+12-14%);安装包自带 Vulkan/CUDA/Metal GPU 后端,一键安装新增 MCP 服务器,并以 System One 决策 API 取代 /v1/brio。

colibri 常见问题

关于 colibri 的定位、核心功能、价格与最近更新。

colibri 是什么?

colibri 是开源纯 C 本地大模型推理引擎,无需 GPU 即可在普通电脑内存与磁盘上运行数千亿参数 MoE 开源模型。内置 GLM、DeepSeek、Qwen、Kimi、MiMo 等 13 个引擎,支持本地对话、OpenAI 兼容 API 服务、工具调用、图像理解与 Qwen-Image 文本生成图像,并提供 System One 决策 API。v2.0.0 新增 Vulkan GPU 加速、双 GPU 专家分层与最多 16 路并发会话。

colibri 有哪些核心功能?

colibri 当前已核验的核心功能包括:函数调用、命令行工具、图像理解、图像生成、对话助手、工具协议集成、投机解码加速、本地模型推理、模型推理服务、模型量化压缩。

colibri 如何收费?

AI Equal 当前没有收录 colibri 的可验证价格信息。

colibri 最近有什么更新?

2026-10-06:colibri 发布 v2.0.0:全部 MoE 引擎支持 Vulkan GPU 加速,包括共享专家层、稠密层设备链、双 GPU 专家分布与部分层上卡;每个文本引擎最多 16 路并发会话(coli serve --kv-slots);新增 MiMo-V2.6、Qwen3-Coder-30B、Qwen-Image-2.1(文本生成图像)引擎与 Qwen3.8-27B 稠密检查点;Qwen3.8 Flash Next 默认开启 int4 专家与基于 MTP 头的投机解码(+12-14%);安装包自带 Vulkan/CUDA/Metal GPU 后端,一键安装新增 MCP 服务器,并以 System One 决策 API 取代 /v1/brio。