
τ^τ-Bench
智能体构建能力的端到端评测环境
τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域
1
2026-09-04
未收录
2
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-09-04
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-09-04开源
Sierra Research 与普林斯顿大学发布并开源 τ^τ-bench(Hyper-τ):把「构建智能体」本身设为任务,编码智能体在沙箱构建套件中根据政策文档、客服记录、通话录音、截图、流程图和客户 REST API 交付可执行客服智能体,再用 τ³-bench 内循环在保留模拟客户任务上评分,覆盖 airline_plus、retail_plus、telecom、banking_knowledge 四个领域共 53 个任务;DAIR.AI 引述论文称 Claude Opus 5 在 Claude Code 下只通过 23.9% 评测,专家人类参考为 82.2%。
τ^τ-Bench 常见问题
关于 τ^τ-Bench 的定位、核心功能、价格与最近更新。
τ^τ-Bench 是什么?
τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域。
τ^τ-Bench 有哪些核心功能?
τ^τ-Bench 当前已核验的核心功能包括:代码沙箱执行、性能基准。
τ^τ-Bench 如何收费?
AI Equal 当前没有收录 τ^τ-Bench 的可验证价格信息。
τ^τ-Bench 最近有什么更新?
2026-09-04:Sierra Research 与普林斯顿大学发布并开源 τ^τ-bench(Hyper-τ):把「构建智能体」本身设为任务,编码智能体在沙箱构建套件中根据政策文档、客服记录、通话录音、截图、流程图和客户 REST API 交付可执行客服智能体,再用 τ³-bench 内循环在保留模拟客户任务上评分,覆盖 airline_plus、retail_plus、telecom、banking_knowledge 四个领域共 53 个任务;DAIR.AI 引述论文称 Claude Opus 5 在 Claude Code 下只通过 23.9% 评测,专家人类参考为 82.2%。