2026年8月12日ResearchInfrastructureAgents

所谓加密思维链,不是对你加密的

前沿厂商把模型的思考过程换成一坨看不懂的密文还给你,正常人的假设是这坨东西绑在你这个会话上。并没有。8 月 10 日,ELLIS Institute Tübingen 和马普所的一队人证明,Anthropic、OpenAI、Google 的加密推理块,在同一家厂商内部跨会话、跨用户、跨模型完全可以互换。arXiv 2608.09867,一夜之间 Hacker News 414 分。

一旦知道能互换,攻击方式简单得让人尴尬。拿强模型产出的加密 trace,粘进同一家厂商那个更弱、看管更松的模型,让它解出来。它就解了。防护装在强模型身上,密文不管是哪个兄弟在读。作者管这叫可规模化的解密越狱,其实这个说法反而把机制说复杂了。

然后他们把枪口对准了公网。从公开仓库爬了 315320 个加密块,全部解开。掉出来 367 条个人身份信息和 182 组还活着的凭证,API key、密码都有。这些全是开发者自己泄的——他们提交了一份日志或者一段 trace,以为密文发出去没关系。没关系是假的,从来就不成立。

对跑 agent 的人来说这是个直接的运维问题,因为 agent 框架默认就会把推理块记下来,CI 又会把这些日志推得到处都是。你的 trace 在制品库里、在可观测性厂商那里、大概率还在某个 GitHub Action 的日志里。把你存过的每一个加密推理块都当明文处理,因为它本来就是明文。另外记一笔:五月和六月已经有独立研究者记录过同样的单一全局密钥行为,这篇是第三次被发现,不是第一次。公开警告三个月了,这些块还在互换。

论文:https://arxiv.org/abs/2608.09867
← 上一篇
Manus 又是一家独立公司了,原因在北京
下一篇 →
英伟达对着你的 token 账单开了一枪:30B 开源模型加一个路由器
← 返回所有文章

评论

加载中...
>_