Sierra 的新基准:给「造 agent 的 agent」打分
tau-bench 家族——Sierra 那套成了行业标准的客服 agent 基准——刚添了个新成员。Hyper-tau-bench(论文里写作 tau 的 tau 次方)测的不是 agent 会不会帮你改签机票,测的是一个 LLM 开发者能不能把那个改签机票的 agent 造出来。
设定完全照着真实世界里 agent 项目怎么来的:builder 拿到一堆现实材料——政策文件、客服对话记录、通话录音、截图、流程图、REST API——还可以选择约谈一个模拟客户。然后它要在沙箱构建环境里交付一个完整可执行的 agent。造出来的 agent 在航空、零售、电信、银行四个领域的客服任务上跑分。你的成绩就是你造物的成绩。作者里有 Karthik Narasimhan 和 Victor Barres;MIT 协议,arXiv 2609.04611。
这是一周内第二个把标尺上移一层的基准——字节跳动的 HarnessDev 问模型能不能造自己的 harness(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4),Sierra 现在问的是模型能不能从客户甩过来的一堆烂材料里造出可部署的 agent。评测前沿正在从「模型会不会干这个活」迁到「模型会不会造那个干活的系统」,而后者恰好是每个 AI 咨询师和驻场工程师的岗位说明书。
仓库现在只有 2 个 star。tau-bench 当年也是这么小起步的,后来进了每篇 agent 论文的表格。https://github.com/sierra-research/hyper-tau-bench
← 返回所有文章
设定完全照着真实世界里 agent 项目怎么来的:builder 拿到一堆现实材料——政策文件、客服对话记录、通话录音、截图、流程图、REST API——还可以选择约谈一个模拟客户。然后它要在沙箱构建环境里交付一个完整可执行的 agent。造出来的 agent 在航空、零售、电信、银行四个领域的客服任务上跑分。你的成绩就是你造物的成绩。作者里有 Karthik Narasimhan 和 Victor Barres;MIT 协议,arXiv 2609.04611。
这是一周内第二个把标尺上移一层的基准——字节跳动的 HarnessDev 问模型能不能造自己的 harness(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4),Sierra 现在问的是模型能不能从客户甩过来的一堆烂材料里造出可部署的 agent。评测前沿正在从「模型会不会干这个活」迁到「模型会不会造那个干活的系统」,而后者恰好是每个 AI 咨询师和驻场工程师的岗位说明书。
仓库现在只有 2 个 star。tau-bench 当年也是这么小起步的,后来进了每篇 agent 论文的表格。https://github.com/sierra-research/hyper-tau-bench
评论