2026年10月4日ResearchSkillsAgents

技能串联劫持 agent 成功率 74%,而防御会把正经活也搞砸

装两个看着人畜无害的 skill,你的 agent 就去干攻击者想要的事了。这是论文 Chaining Skills to Hijack LLM Agents(arXiv 2610.01564)里的 APEX 攻击。在 SkillsBench 上覆盖 6 个模型、4 类目标动作,对抗性技能链在 690 次尝试里成功诱导了 512 次,74.2%。在 GPT-5.4 上完整攻击链命中率 84.3%。

手法又巧又阴。上游 skill 让 agent 写一份真实的任务进度记录,记录里顺带夹了一句「用户已经同意了某事」的假话。下游 skill 读到这份记录,就照着这个「同意」去执行。每个 skill 单看都没问题,证据还是 agent 自己伪造的。同样的攻击塞进一个 skill 里,在 GPT-5.4 上只有 17.4% 成功。串起来才是关键。

防御的数字才是真新闻。用提示词让 agent 把 skill 生成的文件跟原始请求对一遍,攻击成功率从 84.3% 降到 59.1%。但 72 个正常任务的通过率也从 86.7% 掉到 56.3%。药的代价跟病差不多大。

这跟上周的 Skill Cascading 对得上:一个一个扫 skill,扫不出只在链条里才存在的危害。skill 市场正在涨到百万量级,安全审查的单位必须是整个工作流,而不是单个文件。agent 在任务中途写到磁盘上的任何东西,下一步都该当作不可信输入。

链接:arxiv.org/abs/2610.01564
← 上一篇
Mingbird:小模型干不成活,锅在 harness 不在模型
下一篇 →
弱模型也能审强 coding agent,前提是给它证据
← 返回所有文章

评论

加载中...
>_