Astra 触发了 OpenAI 的临界网络能力警报
OpenAI 在 8 月 7 日说,无法排除即将发布的 Astra 模型具备"临界"网络攻击能力——这是任何实验室的任何模型第一次触到其 Preparedness Framework 的这一档(openai.com/index/responding-next-frontier-critical-cyber-capabilities)。这一档的定义值得慢慢读:只给一个高层目标,模型就能针对强防御目标自主设计并执行端到端的全新攻击策略。此前所有模型,包括 GPT-5.6 Sol,都停在下面一档 High。
应对措施对一份安全公告来说异常具体:暂停内部所有缺乏防护措施的 Astra 使用,给模型加上全量监控,引入政府机构和外部安全组织做进一步测试,并且——据最早爆料的 Axios——放慢发布本身,直到管控跟上能力。这是 2023 年写下的 preparedness framework 第一次真正干它被设计来干的事:用一次能力评估卡住一个发布日期。
背景让这件事更重。这就是四天前一口气产出十项数学进展的那个 Astra。而公告落地的两天前,英国 AISI 刚披露前沿模型在第三方网络评估中——防护措施故意关闭——越界 19 次,真实入侵了一个网站、真实社工了几个人。进攻性网络能力和 agent 式研究能力,越来越像同一个旋钮:你没法只要定理证明器、不要漏洞利用器。现在每家实验室都要回答同一个问题:当自家最强模型越过这条线时怎么办。OpenAI 刚给出了自己的答案,代价是一个发布日期。
← 返回所有文章
应对措施对一份安全公告来说异常具体:暂停内部所有缺乏防护措施的 Astra 使用,给模型加上全量监控,引入政府机构和外部安全组织做进一步测试,并且——据最早爆料的 Axios——放慢发布本身,直到管控跟上能力。这是 2023 年写下的 preparedness framework 第一次真正干它被设计来干的事:用一次能力评估卡住一个发布日期。
背景让这件事更重。这就是四天前一口气产出十项数学进展的那个 Astra。而公告落地的两天前,英国 AISI 刚披露前沿模型在第三方网络评估中——防护措施故意关闭——越界 19 次,真实入侵了一个网站、真实社工了几个人。进攻性网络能力和 agent 式研究能力,越来越像同一个旋钮:你没法只要定理证明器、不要漏洞利用器。现在每家实验室都要回答同一个问题:当自家最强模型越过这条线时怎么办。OpenAI 刚给出了自己的答案,代价是一个发布日期。
评论