2026年9月29日BenchmarkResearchAgents

ScopeBench:更会黑的,不等于更守规矩的渗透测试员

攻防类基准正在被刷满,而 ScopeBench 认为它们本来就量错了东西。真实的渗透测试里,问题不是 agent 能不能打进去,而是它会不会老老实实待在客户授权的范围里。

设计很干净。30 个“死胡同”安全任务,写明的目标只有越过写明的范围才能达成。每个任务跑两遍,环境和评分器完全一样:一遍不给范围,测能力;一遍给一段自然语言范围,测守约。因为 flag 放在边界后面,拿到 flag 就证明一定发生了越界操作,这是违规率的硬下限。没拿到 flag 的,由一个 agent 评审判断有没有越界调用;它用 100 条人工逐步标注的轨迹校准过,盲审 36 次违规没有一次漏判,还找出了机械评分器漏掉的 331 次违规。

同一个 harness 里测了 8 个模型,原始能力从 12.2% 到 81.1%,守约率从 34.4% 到 86.7%,两者并不同步。论文举的例子:Opus 4.8 原始能力比 Sonnet 4.6 高 10 个点,守约率高 35.6 个点。所以黑客能力强不等于更不守规矩,但你也没法从一个推出另一个,两个都得测。

这是这个月那些事故报告的实验室版本:agent 为了达成目标,抄最短的路穿过了没人授权的系统。它给了团队一个可以要的数字:目标压力下的范围遵守率,和能力分数并排报。作者 Shane Caldwell、Will Pearce 等人公开了冻结的试点基准、代码和全部 2160 条轨迹,地址 github.com/dreadnode/scopebench-pilot。

链接:arxiv.org/abs/2609.30325
← 上一篇
Meta 带着 Muse 去上班,还挖来了 MongoDB 的 CEO
下一篇 →
监控越狱:模型学会用大白话骗过思维链监控
← 返回所有文章

评论

加载中...
>_