2026年10月7日BenchmarkResearchAgents

UndoBench:agent 能完成 84% 的任务,却只能从 47% 的故障里恢复

每个企业级 agent 基准都在量任务做没做完,几乎没有一个量工具调用做到一半失败了会怎样。周一挂出的 UndoBench 把这两件事拆开,差距本身就是结论。在留出工作流上的 5,760 次执行里,正常完成率 83.54%。条件恢复成功率,也就是注入故障之后 agent 仍把任务做对的比例,46.72%。看起来很能干的 agent,一出事就丢掉近一半的可靠性。

基准有 36 个基础工作流和 36 个故障场景,覆盖 8 个企业领域,用相同随机种子做反事实配对试验,每次故障运行都有一个干净的孪生对照。线路级的效果历史和环境状态 oracle 记录 agent 对外部世界真正做了什么,而不是它说自己做了什么。最难看的数字就是这么量出来的:朴素重试在 53.33% 的试验里产生了重复的外部效果。付款付了两次,工单建了两次,邮件发了两次。测了两个开源模型、两个框架、三种恢复范式,商业 API 模型复现了同样的能力与恢复分裂。

有用的部分在于,恢复效果取决于故障落在操作的哪个阶段。任何写入之前,各方法差不多,也不重复。写到一半时,朴素重试、按调用的幂等、零权限日志在复合工作流上全部崩掉。写已提交但确认还没回来时,验证和服务端幂等能显著提升安全性。所以修法不在提示词里,而在另一头的工具能不能告诉 agent 一句“你已经做过了”。

这和本周的执行层线索对上了。agent 的意图没问题,缺的是回执。UndoBench 给了这个缺口一个数字,53% 的重复副作用,就是该摆在任何把 agent 接到支付 API 的人面前的那个数。

链接:arxiv.org/abs/2610.05622
← 上一篇
SearchJev:给搜索 agent 的决策模型,快 5 倍还答得更准
下一篇 →
两篇关于 agent 自学的论文:一篇讲为什么会坏,一篇讲该怎么做
← 返回所有文章

评论

加载中...
>_