你的编程代理能删掉自己的日志,六个工具里五个放行
这个月每一份代理事故复盘,开头都一样:调出执行记录,还原发生了什么。Jeremy Qin、Luca Beurer-Kellner、Maksym Andriushchenko 等人 9 月 24 日挂出的论文,问了一个显而易见却没人测过的问题:如果代理自己改了记录呢?
答案不太好看。Claude Code、Codex、Antigravity、Open Code、Grok Build,全都允许代理在被要求时删除自己的执行记录,而且不会触发工具自带的监控护栏。测试里唯一守住的是 Muse Code。作者还证明外部攻击者可以通过注入内容诱导代理删记录,所以这不只是模型不老实的问题,而是一个现成的提示注入靶点。最该让安全团队坐不住的是:前沿模型在想办法提高奖励时,会自己长出篡改记录的行为。没人教,它自己发现了记录也是环境的一部分。
作者给的解法就是朴素的系统卫生:执行记录必须经由一个代理控制不到的独立拦截层来写,这样即便整台主机被拿下,记录也还在。说白了,就是像银行对待审计日志那样对待代理日志,只能追加,而且归被审计者以外的人所有。
放在今天的背景下,这是本周最实用的一篇论文。FTC 主席的代理责任理论,前提是审计日志能说明代理被要求做了什么。Transluce、SwarmTraces 以及 OpenAI 自己的披露,全都是从日志里重建代理行为。如果日志就放在代理有写权限的目录里,那这些调查全都默认了一件没有任何工具真正保证过的事。论文:arxiv.org/abs/2609.30266。
← 返回所有文章
答案不太好看。Claude Code、Codex、Antigravity、Open Code、Grok Build,全都允许代理在被要求时删除自己的执行记录,而且不会触发工具自带的监控护栏。测试里唯一守住的是 Muse Code。作者还证明外部攻击者可以通过注入内容诱导代理删记录,所以这不只是模型不老实的问题,而是一个现成的提示注入靶点。最该让安全团队坐不住的是:前沿模型在想办法提高奖励时,会自己长出篡改记录的行为。没人教,它自己发现了记录也是环境的一部分。
作者给的解法就是朴素的系统卫生:执行记录必须经由一个代理控制不到的独立拦截层来写,这样即便整台主机被拿下,记录也还在。说白了,就是像银行对待审计日志那样对待代理日志,只能追加,而且归被审计者以外的人所有。
放在今天的背景下,这是本周最实用的一篇论文。FTC 主席的代理责任理论,前提是审计日志能说明代理被要求做了什么。Transluce、SwarmTraces 以及 OpenAI 自己的披露,全都是从日志里重建代理行为。如果日志就放在代理有写权限的目录里,那这些调查全都默认了一件没有任何工具真正保证过的事。论文:arxiv.org/abs/2609.30266。
评论