功能图谱

Capability Timeline

性能基准

对AI模型推理速度、量化精度、GPU利用率等性能指标进行基准测试与诊断分析

5 个工具5 条动态

相关工具

5

开源自托管的 AI DevOps 排障平台

DevOps Open Agent 是开源、可自托管的 AI 驱动 DevOps 排障平台,帮助 DevOps 工程师、SRE 和平台团队调查基础设施问题、优化云成本、审查 Pull Request、调试性能并扫描安全漏洞。支持按需或定时主动运行,并将建议推送至 Slack、Microsoft Teams 和 PagerDuty。提供 Kubernetes 调试、AWS 多账户排障(STS AssumeRole)、云成本检测、PR 审查、Linux 性能调试与安全扫描等模块。

安全检测代码审查性能基准用量与费用管控智能体
近7天 2 动态44 Stars

美团LongCat开源搜索智能体评测基准

LoHoSearch 是美团 LongCat 团队发布的搜索智能体评测基准,基于 762 万实体维基百科知识图谱自动生成 544 道问题,覆盖 11 个领域,采用树与图结构。该基准旨在解决 BrowseComp 等现有搜索智能体基准趋于饱和的问题,已开源。在 11 个前沿模型测试中最佳得分仅 34.74%,远低于当前模型在 BrowseComp 上约 90% 的成绩。

联网搜索性能基准智能体
近7天 1 动态

单文件本地LLM性能诊断工具:检测量化标签偏差与GPU静默回退

picchio 是单文件 Python 工具,诊断本地 LLM 推理性能。检测三种故障:同标签量化实际 bits per weight 差异、GPU 掉线导致静默 CPU 回退、被误记的 tok/s。拆分 prefill/decode/wallclock 三条速度通道,对比引擎日志与 OS GPU 监控,输出 GPU 是否参与计算的判定。支持 llama.cpp、ollama,覆盖量化审计、上下文衰减测量、模型容量规划,适用 Apple Silicon 和 NVIDIA。

性能基准
近7天 1 动态17 Stars

平头哥为真武 AI 芯片打造的开源全栈软件栈

T-Head SAIL 是阿里平头哥为其真武系列 AI 芯片打造的自研 AI 软件栈,已正式开源。软件栈由 Driver 与 Runtime 层、编程语言层、编译器层、高性能库层、开发者工具层五层组成,全面适配 PyTorch、TensorFlow、vLLM、SGLang 等 260 余个主流训练与推理框架,主流模型即开即用。平头哥开发者社区同步上线,提供全栈技术文档、SDK 软件包、内核驱动、性能分析和调试工具下载。

性能基准
近7天 1 动态

进化式代码优化服务,使用大模型生成变异候选并通过评估函数迭代收敛至最优代码

AlphaEvolve 是 Google DeepMind 推出的进化式代码优化服务,现已作为 Gemini Enterprise Agent Platform 上的 GA 产品提供。它从基线算法出发,使用 Gemini 模型生成变异候选程序,通过用户定义的评估函数打分并迭代,最终收敛至优化后的人类可读代码。评估器运行在客户端基础架构上,代码不会离开客户环境。适用于存在可测量评估函数的场景,如机器学习训练吞吐、IDE 补全延迟、仓库拣选路径等。

代码生成性能基准
近7天 0 动态