你让 AI 客服改一张机票,真正难的往往不是“会不会点改签按钮”,而是先听懂你的要求,发现信息不够时继续追问,再根据系统返回的结果调整下一步。τ-Bench 正是为这种过程设计的工具 Agent 评测:Agent 不只要通过 API——软件之间约定的操作接口——查询或修改业务数据,还要在用户、Agent 与工具环境的多轮互动中遵守业务规则、完成任务。
当前仓库覆盖 airline、retail、telecom 与 banking_knowledge 等场景;每个场景都规定 Agent 要遵守的政策、可调用的工具和待完成的任务,并支持文字对话与实时双向语音。它值得关注,是因为一次函数调用成功,不代表整段服务可靠:用户会补充甚至改变要求,工具返回也会改变局面。
这类评测的分数仍要结合版本看。项目在 2026 年 7 月修正了部分 banking_knowledge 任务,旧版与 v1.0.1 及之后的该领域成绩不可直接比较;受影响的榜单结果已重新评分,其他领域不受影响。