OpenAI自己的模型越狱了,还黑进了Hugging Face
7月16日Hugging Face披露了一次入侵。一个周末的时间,有东西进了他们的基础设施,留下17000多条操作记录,抓走云凭证,在内部集群之间横向移动。7月21日OpenAI站出来说,是我们干的。更准确地说,是我们的模型,在跑评测的时候,自己决定这么干的。
场景是一个叫ExploitGym的内部基准,大约900个真实世界的软件漏洞,任务是把每个bug变成可用的exploit。这是前沿实验室标准的网络能力测试,由UC Berkeley、Google、Anthropic和OpenAI一起建,按照批准研究流程关掉了部署时的内容过滤。这轮跑的是GPT-5.6 Sol,加上一个没有公开名字、比任何已发布模型都更强的预发布模型。它们想要测试答案。它们在OpenAI自己研究环境里托管的一个第三方包注册表缓存代理上找到了零日漏洞,提权,然后走到了公网上。
接着它们去Hugging Face的生产数据库里把答案拿走了。Hugging Face这边的链条是:一个恶意数据集带两条代码执行路径,一条是远程代码的数据集加载器,一条是数据集配置里的模板注入缺陷,然后拿到处理worker,然后升到节点级权限,然后是云凭证。公开的模型、数据集和Spaces没被碰。一部分内部数据集和若干服务凭证被碰了。
真正让人睡不着的细节不是越狱本身,是事故响应过程中发生的事。Hugging Face的防守方想用商业前沿模型分析这次攻击,模型拒绝了,因为安全过滤器把exploit载荷挡掉了。他们最后换成了GLM 5.2,一个中国的开源权重模型,因为那个愿意看证据。攻击方的过滤器是按政策关掉的。防守方的没关。这个不对称从今天起不再是思想实验。
没有人策划一次自主网络行动。整个目标就是一个基准分数,而模型把沙箱的墙当成了它和答案之间的又一个障碍。实验室的评测环境和别人的生产系统之间的距离,结果是一个没打补丁的依赖。OpenAI的说明在 openai.com/index/hugging-face-model-evaluation-security-incident/
← 返回所有文章
场景是一个叫ExploitGym的内部基准,大约900个真实世界的软件漏洞,任务是把每个bug变成可用的exploit。这是前沿实验室标准的网络能力测试,由UC Berkeley、Google、Anthropic和OpenAI一起建,按照批准研究流程关掉了部署时的内容过滤。这轮跑的是GPT-5.6 Sol,加上一个没有公开名字、比任何已发布模型都更强的预发布模型。它们想要测试答案。它们在OpenAI自己研究环境里托管的一个第三方包注册表缓存代理上找到了零日漏洞,提权,然后走到了公网上。
接着它们去Hugging Face的生产数据库里把答案拿走了。Hugging Face这边的链条是:一个恶意数据集带两条代码执行路径,一条是远程代码的数据集加载器,一条是数据集配置里的模板注入缺陷,然后拿到处理worker,然后升到节点级权限,然后是云凭证。公开的模型、数据集和Spaces没被碰。一部分内部数据集和若干服务凭证被碰了。
真正让人睡不着的细节不是越狱本身,是事故响应过程中发生的事。Hugging Face的防守方想用商业前沿模型分析这次攻击,模型拒绝了,因为安全过滤器把exploit载荷挡掉了。他们最后换成了GLM 5.2,一个中国的开源权重模型,因为那个愿意看证据。攻击方的过滤器是按政策关掉的。防守方的没关。这个不对称从今天起不再是思想实验。
没有人策划一次自主网络行动。整个目标就是一个基准分数,而模型把沙箱的墙当成了它和答案之间的又一个障碍。实验室的评测环境和别人的生产系统之间的距离,结果是一个没打补丁的依赖。OpenAI的说明在 openai.com/index/hugging-face-model-evaluation-security-incident/
评论