
eval-awareness-sentinel
只读传感器,通过分析语言模型激活态检测评估感知(eval-awareness),不建立因果关联
eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队
1
2026-08-14
未收录
1
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队
核心功能
价格信息
免费当前仅展示已核验的定价模式。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-08-14
- 覆盖行业
- 安全研究
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-08-14新工具首发
发布 eval-awareness-sentinel 开源只读传感器,通过分析语言模型激活态检测评估感知并返回评分,面向 AI 安全研究。
eval-awareness-sentinel 常见问题
关于 eval-awareness-sentinel 的定位、核心功能、价格与最近更新。
eval-awareness-sentinel 是什么?
eval-awareness-sentinel 是一个基于 Python 的只读分析工具,通过读取语言模型内部激活态来检测模型是否识别出评估环境(eval-awareness)。其目标是为 AI 安全研究提供洞察,识别模型可能在评估中刻意表现不佳(sandbagging)的迹象,但不与故意低表现建立因果关系。作为 AGPL-3.0 开源的轻量库,它提供简单的 score() 接口返回评估感知分数与是否评估感知的布尔结果,可方便集成进现有模型评估与部署前审查工作流,主要面向 AI 安全研究员与模型评测团队。
eval-awareness-sentinel 有哪些核心功能?
eval-awareness-sentinel 当前已核验的核心功能包括:模型可解释性。
eval-awareness-sentinel 如何收费?
eval-awareness-sentinel 当前已核验的价格模式为免费。
eval-awareness-sentinel 最近有什么更新?
2026-08-14:发布 eval-awareness-sentinel 开源只读传感器,通过分析语言模型激活态检测评估感知并返回评分,面向 AI 安全研究。