PACE:别再审 agent 读进来的东西,在工具调用触发前一刻卡住它
大多数 agent 安全研究都想在门口拦毒:agent 读之前,先扫工具元数据、检索到的网页、记忆条目、skill 文件。Fengpeng Li、Haiwei Wu 等人的 PACE 论证这道门根本守不住,干脆把检查挪到最后一刻。
核心论点是一个被说清楚了的否定结果。一个安全的和一个会泄密的输入,可能给出完全相同的准入证据,所以一个可靠的门不能凭这些证据放行其中任何一个。准入审查因此回答不了「下一个动作安不安全」。剩下唯一能动手的位置,就是工具调用即将执行的那一刻。PACE 在这里拦截每一次调用。路径约束切断不可信内容到动作的影响路径。能力与效果校验拿调用在 schema 里声明的效果,去对照从已认证的用户请求编译出来的权限,而不是 agent 一路上读到的任何东西。
在八个可执行的 agent 安全 benchmark、三个模型家族上,79 个有效攻击列里有 62 列攻击成功率严格最低,14 列打平,原生任务效用最多只比不设防的 agent 掉 3 个点。1167 组配对案例的消融显示,大部分安全收益来自效果校验。自适应攻击搜索在 30 个越权目标上 0 成功,不过作者也注明那是缩小规模的搜索。
这和本周的主线完全对上:agent 的权限要在执行时强制,而不是靠指令约束。同一批 arXiv 论文里的 APEX 刚证明提示词层面的防御,牺牲的正常通过率和挡掉的攻击差不多一样多。PACE 只花 3 个点效用就拿到了大部分防护。权限来自用户请求,在调用时核验,这套设计值得直接抄。
链接:arxiv.org/abs/2610.01349
← 返回所有文章
核心论点是一个被说清楚了的否定结果。一个安全的和一个会泄密的输入,可能给出完全相同的准入证据,所以一个可靠的门不能凭这些证据放行其中任何一个。准入审查因此回答不了「下一个动作安不安全」。剩下唯一能动手的位置,就是工具调用即将执行的那一刻。PACE 在这里拦截每一次调用。路径约束切断不可信内容到动作的影响路径。能力与效果校验拿调用在 schema 里声明的效果,去对照从已认证的用户请求编译出来的权限,而不是 agent 一路上读到的任何东西。
在八个可执行的 agent 安全 benchmark、三个模型家族上,79 个有效攻击列里有 62 列攻击成功率严格最低,14 列打平,原生任务效用最多只比不设防的 agent 掉 3 个点。1167 组配对案例的消融显示,大部分安全收益来自效果校验。自适应攻击搜索在 30 个越权目标上 0 成功,不过作者也注明那是缩小规模的搜索。
这和本周的主线完全对上:agent 的权限要在执行时强制,而不是靠指令约束。同一批 arXiv 论文里的 APEX 刚证明提示词层面的防御,牺牲的正常通过率和挡掉的攻击差不多一样多。PACE 只花 3 个点效用就拿到了大部分防护。权限来自用户请求,在调用时核验,这套设计值得直接抄。
链接:arxiv.org/abs/2610.01349
评论