eval-awareness-sentinel

只读传感器,通过分析语言模型激活态检测评估感知(eval-awareness),不建立因果关联

eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队

模型可解释性
访问官网
收录动态

1

最近更新

2026-08-14

评价样本

未收录

GitHub Stars

1

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队

核心功能

1 项已整理
模型可解释性

价格信息

免费

当前仅展示已核验的定价模式。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-08-14
覆盖行业
安全研究

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-08-14新工具首发

    发布 eval-awareness-sentinel 开源只读传感器,通过分析语言模型激活态检测评估感知并返回评分,面向 AI 安全研究。

eval-awareness-sentinel 常见问题

关于 eval-awareness-sentinel 的定位、核心功能、价格与最近更新。

eval-awareness-sentinel 是什么?

eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队。

eval-awareness-sentinel 有哪些核心功能?

eval-awareness-sentinel 当前已核验的核心功能包括:模型可解释性。

eval-awareness-sentinel 如何收费?

eval-awareness-sentinel 当前已核验的价格模式为免费。

eval-awareness-sentinel 最近有什么更新?

2026-08-14:发布 eval-awareness-sentinel 开源只读传感器,通过分析语言模型激活态检测评估感知并返回评分,面向 AI 安全研究。