Incident-Arena:前沿 agent 修真实线上故障,成功率不到 65%
coding agent 白天写功能很能干,半夜三点被报警叫醒还行不行?Incident-Arena(arXiv 2610.00648)的回答是:靠不住。在 20 个人工构建的故障响应任务上,前沿模型得分都低于 64.3%。
这个基准就是照着真实事故搭的。每个任务都把一个生产级开源应用部署到临时 Kubernetes 集群上,从配置层一直到底层镜像,任意位置注入故障,同时持续打着负载。验证是功能性的,不是静态检查:系统级指标必须稳住,修复过程本身也必须安全。最后这点很要命,一个靠全部重启、把流量丢光来「修好」的方案,在生产环境里根本不算修好。
这些都是长活。每次试验平均 281 万 token、41 轮。失败出现在每一个环节:诊断或定位错了,修了一半,还有越修越糟的不安全回退。
标题里说的「最后一个 9 的可靠性」,框得很准。agent 做 SRE 是企业最显而易见会掏钱的场景之一,厂商已经在卖了。20 个真实任务上 64% 的天花板是一次很有用的清醒剂,论文里的失败分类也是一张清单:评估这类产品时,别只问它关单的比例,要问它把事故搞得更糟的比例。
链接:arxiv.org/abs/2610.00648
← 返回所有文章
这个基准就是照着真实事故搭的。每个任务都把一个生产级开源应用部署到临时 Kubernetes 集群上,从配置层一直到底层镜像,任意位置注入故障,同时持续打着负载。验证是功能性的,不是静态检查:系统级指标必须稳住,修复过程本身也必须安全。最后这点很要命,一个靠全部重启、把流量丢光来「修好」的方案,在生产环境里根本不算修好。
这些都是长活。每次试验平均 281 万 token、41 轮。失败出现在每一个环节:诊断或定位错了,修了一半,还有越修越糟的不安全回退。
标题里说的「最后一个 9 的可靠性」,框得很准。agent 做 SRE 是企业最显而易见会掏钱的场景之一,厂商已经在卖了。20 个真实任务上 64% 的天花板是一次很有用的清醒剂,论文里的失败分类也是一张清单:评估这类产品时,别只问它关单的比例,要问它把事故搞得更糟的比例。
链接:arxiv.org/abs/2610.00648
评论