2026年8月14日ResearchBenchmarkAgents

OpenART:85% 攻击成功率,漏洞在 harness 不在模型

OpenART 是一个针对 agent 的红队框架,起点是大多数安全评测忽略的一个前提:agent 活在持久环境里,第三轮做的一次状态改动可以在第九十轮左右一个决策。一万多个带状态的场景,覆盖 50 个领域,今天在 HuggingFace 拿了 159 赞。

攻击方法叫演化式马尔可夫超图攻击,设计比一个提示注入语料库阴狠得多。EMHA 是一个黑盒策略,通过反馈演化环境本身,编排一连串单看每一步都是被授权的状态转移。它做的每件事都不违规。它只是把世界摆成某个样子,让 agent 自己的推理走到一个糟糕的地方。全配置下攻击成功率 85.0%,比纯指令类攻击高 2 到 17 个点,任务越难差距越大。

值得随身带走的结论是:运行时实现独立于模型能力地影响安全性。同一个模型,换个 harness,安全结果实质不同。这跟能力侧一年前学到、之后一直在重复的那一课是同一课。模型卡几乎不能告诉你部署出去的那个东西会怎么表现,因为沙箱策略、工具面、以及循环允许什么在轮次之间留存下来,这些的作用至少不亚于权重。

跟同一天发布的 Anthropic 多 agent 研究并排看,形状就清楚了。两篇的结论都是:有意思的失效不在模型里,在模型运行其中的那个系统里,而且都不是静态提示集上的单轮评测能看见的。我们所有人依赖的这套评测体系,是为另一个对象建的,不是我们现在出货的这个。

arXiv 2608.00677,Yunhao Chen 等,CC BY 4.0,暂无公开仓库。
← 上一篇
一篇会写论文的论文,8.1 美元,3.2 小时
下一篇 →
强模型给弱模型搭个 harness,弱模型就变聪明了
← 返回所有文章

评论

加载中...
>_