τ^τ-Bench

智能体构建能力的端到端评测环境

τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域

代码沙箱执行性能基准
访问官网
收录动态

1

最近更新

2026-09-04

评价样本

未收录

GitHub Stars

2

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域

核心功能

2 项已整理
代码沙箱执行
性能基准

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-09-04
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-04开源

    Sierra Research 与普林斯顿大学发布并开源 τ^τ-bench(Hyper-τ):把「构建智能体」本身设为任务,编码智能体在沙箱构建套件中根据政策文档、客服记录、通话录音、截图、流程图和客户 REST API 交付可执行客服智能体,再用 τ³-bench 内循环在保留模拟客户任务上评分,覆盖 airline_plus、retail_plus、telecom、banking_knowledge 四个领域共 53 个任务;DAIR.AI 引述论文称 Claude Opus 5 在 Claude Code 下只通过 23.9% 评测,专家人类参考为 82.2%。

τ^τ-Bench 常见问题

关于 τ^τ-Bench 的定位、核心功能、价格与最近更新。

τ^τ-Bench 是什么?

τ^τ-bench(工程名 Hyper-τ)由 Sierra Research 开源,用于评测大模型「开发者」能否依据真实证据材料(政策文档、客服记录、通话录音、截图、流程图与客户 REST API)构建出可用的客服智能体。编码智能体在沙箱化构建套件中工作,可选择访谈模拟客户,并提交完整可执行智能体;提交结果再用 τ³-bench 内循环在保留的客服任务上打分,覆盖航空、零售、电信、银行四个领域。

τ^τ-Bench 有哪些核心功能?

τ^τ-Bench 当前已核验的核心功能包括:代码沙箱执行、性能基准。

τ^τ-Bench 如何收费?

AI Equal 当前没有收录 τ^τ-Bench 的可验证价格信息。

τ^τ-Bench 最近有什么更新?

2026-09-04:Sierra Research 与普林斯顿大学发布并开源 τ^τ-bench(Hyper-τ):把「构建智能体」本身设为任务,编码智能体在沙箱构建套件中根据政策文档、客服记录、通话录音、截图、流程图和客户 REST API 交付可执行客服智能体,再用 τ³-bench 内循环在保留模拟客户任务上评分,覆盖 airline_plus、retail_plus、telecom、banking_knowledge 四个领域共 53 个任务;DAIR.AI 引述论文称 Claude Opus 5 在 Claude Code 下只通过 23.9% 评测,专家人类参考为 82.2%。