有人做了个能靠 Copilot 传播的蠕虫
Håkon Måløy 在 7 月 28 号放出了一个概念验证,足以让每一家正在推 Copilot for Word 的公司紧张起来。这是一个能自我传播的攻击,一条蠕虫,它住在文档里,靠 AI 本身扩散。没有恶意软件,没有宏,没有可执行文件。就是纯文字。
机制简单得近乎羞辱。你把指令藏在 Word 文件里,白底白字。人看什么都看不到。但 Copilot 在读之前会把格式剥掉,所以在模型眼里,那段隐藏的 prompt 只是又一段需要照办的内容。当受害者在起草时把这个文档附进去,Copilot 就照着那些埋好的命令执行,比如悄悄改一个财务数字,然后干出最巧的一步:它把整段攻击 prompt 复制进它正帮着写的那份新文档里,同样用隐形格式。现在这份崭新的、可信的、公司内部产出的文档,就成了新的载体。下周某个同事把它当素材打开,Copilot 一读,整套东西又触发一遍,而那份最初被下毒的文件早已不见踪影。
Måløy 自己的话是最吓人的部分:一旦它越过最初的入口点,要追溯这个攻击就变得极其困难。这正是整个行业反复撞上的那个更深的问题。一个 LLM 必须去读攻击者控制的内容才能理解它,这意味着攻击者在它检查的那一刻就已经在影响计算了。你没法用沙箱躲开一个搭着词语含义混进来的威胁。随着 Copilot 和所有其他助手往邮件、文档、聊天里扎得越来越深,攻击面不是一个你能关掉的端口,而是在整个组织里流动的语言本身。完整分析在 enklypesalt.com。提示注入刚刚学会了繁殖。
← 返回所有文章
机制简单得近乎羞辱。你把指令藏在 Word 文件里,白底白字。人看什么都看不到。但 Copilot 在读之前会把格式剥掉,所以在模型眼里,那段隐藏的 prompt 只是又一段需要照办的内容。当受害者在起草时把这个文档附进去,Copilot 就照着那些埋好的命令执行,比如悄悄改一个财务数字,然后干出最巧的一步:它把整段攻击 prompt 复制进它正帮着写的那份新文档里,同样用隐形格式。现在这份崭新的、可信的、公司内部产出的文档,就成了新的载体。下周某个同事把它当素材打开,Copilot 一读,整套东西又触发一遍,而那份最初被下毒的文件早已不见踪影。
Måløy 自己的话是最吓人的部分:一旦它越过最初的入口点,要追溯这个攻击就变得极其困难。这正是整个行业反复撞上的那个更深的问题。一个 LLM 必须去读攻击者控制的内容才能理解它,这意味着攻击者在它检查的那一刻就已经在影响计算了。你没法用沙箱躲开一个搭着词语含义混进来的威胁。随着 Copilot 和所有其他助手往邮件、文档、聊天里扎得越来越深,攻击面不是一个你能关掉的端口,而是在整个组织里流动的语言本身。完整分析在 enklypesalt.com。提示注入刚刚学会了繁殖。
评论