picchio

单文件本地LLM性能诊断工具:检测量化标签偏差与GPU静默回退

picchio 是单文件 Python 工具,诊断本地 LLM 推理性能。检测三种故障:同标签量化实际 bits per weight 差异、GPU 掉线导致静默 CPU 回退、被误记的 tok/s。拆分 prefill/decode/wallclock 三条速度通道,对比引擎日志与 OS GPU 监控,输出 GPU 是否参与计算的判定。支持 llama.cpp、ollama,覆盖量化审计、上下文衰减测量、模型容量规划,适用 Apple Silicon 和 NVIDIA

性能基准
访问官网
收录动态

2

最近更新

2026-08-22

评价样本

未收录

GitHub Stars

18

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

picchio 是单文件 Python 工具,诊断本地 LLM 推理性能。检测三种故障:同标签量化实际 bits per weight 差异、GPU 掉线导致静默 CPU 回退、被误记的 tok/s。拆分 prefill/decode/wallclock 三条速度通道,对比引擎日志与 OS GPU 监控,输出 GPU 是否参与计算的判定。支持 llama.cpp、ollama,覆盖量化审计、上下文衰减测量、模型容量规划,适用 Apple Silicon 和 NVIDIA

核心功能

1 项已整理
性能基准

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-08-22
覆盖行业
程序员

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-08-22版本发布

    picchio 发布首个正式版本 v1.0.0(单文件 Python 包,Python 3.9+,macOS/Linux/Windows)。该版本在单次运行中报告 GPU 层放置、prefill、decode、GPU 工作、内存、功耗与每 token 能耗,并提供 --share bug-report 命令生成可直接粘贴给 Ollama 或 llama.cpp 的 Issue 报告;官方实测在 RTX 5090 与 RTX 4070 SUPER 上捕获了 14.3× 的 decode 差距。

  2. 2026-07-10开源

    picchio 开源发布于 GitHub(MIT 许可)。单文件 Python 工具,诊断本地 LLM 三大性能问题:同标签量化 bits-per-weight 偏差、静默 CPU 回退、误记 tok/s。支持 llama.cpp 与 ollama,覆盖 quant label 审计、prefill/decode/wallclock 三通道拆分、GPU 占用监控判定,适用于 Apple Silicon 与 NVIDIA 环境。

picchio 常见问题

关于 picchio 的定位、核心功能、价格与最近更新。

picchio 是什么?

picchio 是单文件 Python 工具,诊断本地 LLM 推理性能。检测三种故障:同标签量化实际 bits per weight 差异、GPU 掉线导致静默 CPU 回退、被误记的 tok/s。拆分 prefill/decode/wallclock 三条速度通道,对比引擎日志与 OS GPU 监控,输出 GPU 是否参与计算的判定。支持 llama.cpp、ollama,覆盖量化审计、上下文衰减测量、模型容量规划,适用 Apple Silicon 和 NVIDIA。

picchio 有哪些核心功能?

picchio 当前已核验的核心功能包括:性能基准。

picchio 如何收费?

AI Equal 当前没有收录 picchio 的可验证价格信息。

picchio 最近有什么更新?

2026-08-22:picchio 发布首个正式版本 v1.0.0(单文件 Python 包,Python 3.9+,macOS/Linux/Windows)。该版本在单次运行中报告 GPU 层放置、prefill、decode、GPU 工作、内存、功耗与每 token 能耗,并提供 --share bug-report 命令生成可直接粘贴给 Ollama 或 llama.cpp 的 Issue 报告;官方实测在 RTX 5090 与 RTX 4070 SUPER 上捕获了 14.3× 的 decode 差距。