Skillgrade

Agent Skills 单元测试与评估工具,支持多代理接入与 CI 自动化监控

Skillgrade 是一款专为 AI 智能体技能设计的评估与测试工具。它通过 eval.yaml 配置文件定义测试任务与评分标准,自动调度 Gemini、Claude、Codex 或自定义 CLI 代理执行任务。工具提供确定性脚本校验与 LLM 语义评分两种机制,支持多轮并行测试、Web/CLI 报告查看,并可通过 --ci 模式集成至持续集成流水线实现自动化质量监控与阈值拦截

测试生成
访问官网
收录动态

1

最近更新

2026-07-13

评价样本

未收录

GitHub Stars

636

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

Skillgrade 是一款专为 AI 智能体技能设计的评估与测试工具。它通过 eval.yaml 配置文件定义测试任务与评分标准,自动调度 Gemini、Claude、Codex 或自定义 CLI 代理执行任务。工具提供确定性脚本校验与 LLM 语义评分两种机制,支持多轮并行测试、Web/CLI 报告查看,并可通过 --ci 模式集成至持续集成流水线实现自动化质量监控与阈值拦截

核心功能

1 项已整理
测试生成

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-07-13
覆盖行业
程序员

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-07-13版本发布

    Skillgrade发布v0.2.0版本,新增command agent能力,允许开发者通过标准输入将自定义CLI脚本或外部代理直接接入Skills测试流程。工具提供确定性规则校验与大模型Rubric评分,支持配置化任务评估、并行测试及CI流水线集成,实现AI Agent技能调用的自动化质量保障与回归监控。

Skillgrade 常见问题

关于 Skillgrade 的定位、核心功能、价格与最近更新。

Skillgrade 是什么?

Skillgrade 是一款专为 AI 智能体技能设计的评估与测试工具。它通过 eval.yaml 配置文件定义测试任务与评分标准,自动调度 Gemini、Claude、Codex 或自定义 CLI 代理执行任务。工具提供确定性脚本校验与 LLM 语义评分两种机制,支持多轮并行测试、Web/CLI 报告查看,并可通过 --ci 模式集成至持续集成流水线实现自动化质量监控与阈值拦截

Skillgrade 有哪些核心功能?

Skillgrade 当前已核验的核心功能包括:测试生成。

Skillgrade 如何收费?

AI Equal 当前没有收录 Skillgrade 的可验证价格信息。

Skillgrade 最近有什么更新?

2026-07-13:Skillgrade发布v0.2.0版本,新增command agent能力,允许开发者通过标准输入将自定义CLI脚本或外部代理直接接入Skills测试流程。工具提供确定性规则校验与大模型Rubric评分,支持配置化任务评估、并行测试及CI流水线集成,实现AI Agent技能调用的自动化质量保障与回归监控。