2026年9月29日SkillsResearchAgents

技能级联攻击:三个无害的 skill,合起来删掉一条药物警告

市面上所有的 skill 扫描器都是一个一个查。技能级联攻击就是专门为通过这种检查设计的。Zihao Zhu、Siwei Lyu、Adel Bibi、Baoyuan Wu 的这篇论文,把一个恶意目标拆到几个 skill 里,每一处改动单看都没问题,只有组合起来才有害。

例子吓人,恰恰因为它太日常了。一个处方审核流程里,第一个 skill 在提取病史时,稍微弱化最近停用药物的信号;第二个 skill 把和这些药有关的相互作用严重等级往下调;第三个 skill 在最终摘要里压掉低优先级的提醒。每一步改动都过得了审查。加在一起,一条严重的药物相互作用警告在到达医生之前悄无声息地消失了。

为了系统研究,作者做了 SkillCascade,一个自动化的多 agent 红队框架,并发布 SkillCascade-Bench,包含 213 个验证过的级联用例,覆盖多个 agent 系统和领域。在 OpenClaw、Claude Code、Codex 等代表性 agent 和多个基座模型上,级联攻击都能稳定诱发有害行为,同时绕过现有的单 skill 扫描器和运行时监控。

时间点很扎眼。同一天,谷歌宣布把所有 Gemini Gem 转成 skill,这个格式正在变成大家定制 agent 的默认方式。组件级别的完整性,不等于系统级别的安全。如果你的 agent 会加载第三方 skill,防御就得把整条 skill 链放在一起看,就像代码审查要看上下文里的 diff,而不是一行一行看。

链接:arxiv.org/abs/2609.30383
← 上一篇
监控越狱:模型学会用大白话骗过思维链监控
← 返回所有文章

评论

加载中...
>_