功能图谱

Capability Timeline

模型量化压缩

对模型权重做量化/压缩以降低显存与算力占用,产出可本地推理的低比特构建

14 个工具44 条动态

相关工具

14

面向端侧设备的基础模型与部署栈

Liquid AI 提供 Liquid Foundation Models(LFM)系列基础模型,主打在手机、笔记本、汽车、可穿戴等设备本地运行的低延迟推理,可在 CPU、GPU、NPU 上通过 llama.cpp、MLX、ONNX、CoreML、vLLM 等运行时部署,并支持针对自有数据与具体场景做微调定制,形成从架构、优化到部署的全栈方案。

模型量化压缩模型推理服务模型训练学习性能基准
近7天 3 动态

开源本地 AI 聊天应用,内置 TurboQuant 极速量化推理

Atomic Chat 是一款开源免费的本地 AI 聊天应用,支持 Mac、Windows、Linux、iOS 和 Android 平台。内置 Google TurboQuant 量化技术,可将大模型压缩至 3-bit 并实现 8 倍推理加速和 6 倍内存节省,且无精度损失。支持 1000+ 模型(GGUF/MLX/ONNX),可一键运行 Hermes、Cline 等 Agent,所有数据完全离线运行于本地设备。

代码生成对话助手模型量化压缩智能体
近7天 2 动态

蚂蚁百灵轻量混合推理 MoE 开源模型

Ling-3.0-tiny 是蚂蚁百灵(inclusionAI)开源的轻量级混合推理 MoE 模型,总参数 7.9B,每 token 仅激活 1.3B 参数,采用 KDA 与 MLA 按 3:1 交替堆叠加 128 路由专家的稀疏 MoE FFN。支持快速响应与多步骤推理两种模式,可按请求开关思考模式,在智能体任务、代码、数学与科学推理、长上下文理解上表现均衡,并提供 BF16、FP8、INT4 权重,已在 DGX Spark、Apple Silicon MacBook 与 Mac mini 上验证本地部署。

代码生成复杂推理模型量化压缩模型训练学习性能基准
近7天 2 动态

面向视觉专业人员的模块化节点图AI创作引擎,精细控制图像生成与编辑流程

ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中

开放世界3D生成模型量化压缩视频处理视频生成图像编辑
近7天 1 动态131,510 Stars

智能手机可跑的端侧智能体小模型

LFM2.5-2.6B 是 Liquid AI 面向端侧部署的 26 亿参数混合架构智能体模型,基于 LFM2 架构并做智能体后训练,支持 131072 token 上下文与 16 种语言,可完成规划、工具调用与多步任务。官方提供基础版与后训练版,并有 GGUF、ONNX、MLX 等量化与跨平台格式,可在手机、CPU 与 Apple Silicon 上本地运行推理。

模型量化压缩深度研究长文本处理智能体
近7天 1 动态

可在端侧本地运行的视觉语言模型,支持 OCR 与工具调用

LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理。

函数调用模型量化压缩目标检测图像理解OCR 文字识别
近7天 1 动态

Lightricks 实时 DiT 视频生成模型

LTX-Video 是 Lightricks 推出的基于 DiT 架构的视频生成模型,官方称其为首个能实时生成高质量视频的 DiT 视频生成模型,可在 1216×704 分辨率下输出 30 FPS 视频。模型定位为扩散式图生视频模型,提供 13B 与 2B 多种规格,并包含 distilled 蒸馏版与 fp8 量化版本以降低显存占用、加快迭代速度,同时官方提供 inference.py 配置与推荐的 ComfyUI 工作流供直接调用。

模型量化压缩视频生成
近7天 1 动态

Meta 面向本地智能体的 30B 开源模型

Muse Glimmer 是 Meta Superintelligence Lab 发布的 300 亿参数因果语言模型,带独立感知编码器,专为消费级硬件上的自主智能体任务打造。它把多步推理、可靠工具调用、图文多模态理解与失败恢复整合进单一模型,可在本地运行而无需云端基础设施或联网,并兼容 OpenClaw、Hermes Agent 等智能体编排框架。

代码生成复杂推理工具协议集成合成数据生成联网搜索
近7天 1 动态

14MB 端侧函数调用与设备操作小模型

Needle 2 是 Cactus 推出的开源 45M 参数端侧模型,专注工具调用、设备操作与结构化抽取。整个模型是单个 14MB 二进制文件,单次会话约占 28MB 内存,可在树莓派 5、ESP32 级微控制器、VR 头显及 200 美元以下手机上离线运行;输出由 schema 编译的字节级语法约束,并带置信度分数决定本地执行或升级云端,仓库支持本机 LoRA 微调。

函数调用结构化抽取模型量化压缩模型训练学习
近7天 1 动态

一条命令完成大模型微调与后训练的 CLI

Soup 是开源的大模型微调与后训练命令行工具,用一份 YAML 即可自动生成训练配置,涵盖 SFT 与 DPO、ORPO、SimPO、KTO 等对齐方法。其 Layer Streaming 把冻结底座放在内存或 NVMe 中逐层送入显存并量化为 NF4,使 Llama-3.1-8B 可在 4 GB 显存笔记本 GPU 上微调,并可与 HuggingFace、Ollama、vLLM 等生态对接。

模型量化压缩模型训练学习强化学习训练性能基准自动化工作流
近7天 1 动态5,259 Stars

在 Mac 与 iPhone 本地跑 35B/80B Qwen 的 Swift 运行时

Swiftlet 是面向 Apple 设备的 Swift + Metal 模型运行时,支持 Qwen3-Next 与 Qwen3.5/3.6 的 MoE 混合模型家族。它只将小型稠密核心常驻内存,按需从存储流式加载路由专家权重,使 4-bit Qwen3.6-35B 峰值内存约 2.6 GB、Qwen3-Next-80B 约 4.3 GB,在 M5 Mac 可达每秒数 token,35B 还能在 iPhone 17 以约 2.5 GB 内存运行。

模型量化压缩模型推理服务
近7天 1 动态607 Stars