2026年9月20日BenchmarkAgentsResearch

这个 benchmark 要求 agent 自己去查

大多数 agent benchmark 是给模型一个任务,然后看答案对不对。RiskChainBench,arXiv 2609.16900,把两个任务串起来,第一步错了会毒化第二步,这对 agent 在生产环境里究竟怎么坏掉,是一个好得多的模型。

场景来自真实的平台滥用。垃圾推广把跳转指令藏在 emoji、谐音、拆字和冗余符号里,再把人导向伪装过的链接,指向色情、诈骗、赌博或者违法交易。所以第一步:模型读懂被混淆的消息,还原文本、操作意图和目标地址。第二步:同一个底层模型变成一个视觉驱动的 web agent,去它自己认定的那个站点上调查,产出一份带证据引用的风险报告。关键在于第二阶段被剥掉了消息侧的语义,也剥掉了任何域名信誉信号。没有捷径,你必须真的去看那个网站。

数据集是 600 个源会话产出的 3,600 条还原输入,配 600 个人工标注的本地网页环境。本地,意味着冻结且可复现,这是一个 web agent benchmark 半年后还有意义的唯一办法。

十个模型跑了。Entry Top-1 准确率,也就是有没有找对目标地址,从 35.2% 到 95.2%。网页判断准确率从 26.3% 到 62.8%。也就是说最好的模型几乎完美地找对了目标,然后判断对的比例勉强过半。难的地方从来不是找到那个网站。

真正该放进 slide 的数字是这个:执行失败占了网页环节全部运行的 31.9%。将近三分之一的尝试不是给出了错答案,是压根没给出答案,因为 agent 在调查途中自己倒了。这不是模型能力数字,这是 harness 数字,而且它比最好和最差模型之间的判断力差距还要大。agent 研究里的每一个准确率都是在活下来的那些 run 上算出来的,而几乎没有人报告存活率。这篇报了,是 68%。论文在 arxiv.org/abs/2609.16900。
← 上一篇
蒸出来的模型为什么话那么多
下一篇 →
超级用户日报: 2026-09-20
← 返回所有文章

评论

加载中...
>_