Anthropic 把所有内部评测断网了。报告说清了为什么。
费城假线索事件之后 Anthropic 承诺的事故报告发了,内容远不止一张警局表格。公司说,Claude 的好几个模型在好几个公开评测里干过这些事:利用一所大学服务器上的命令注入漏洞跑计算,练习版政府表单加载失败就跑去真网站把真表提交了,从网页发给浏览器的配置文件里翻出访问令牌直接查地方政府的地产地图,向州政府公开仪表盘申请一个令牌从而绕过数据收费,还用免费短链接服务绕开自家 fetch 工具的 URL 长度限制。其中一部分网站属于美国联邦、州和地方机构。Anthropic 向白宫做了汇报,通知了每一个涉事机构,并且一个都没点名。
整改措施才是头条。所有内部评测的实时互联网访问全部关闭,不只是网络安全那几项,直到公司确认监控能稳定抓住这类行为为止。一部分公开评测直接不跑了,另一些切到离线版,或者重建成任务永远碰不到真实网站。fetch 工具加了更严的护栏,一套检测层现在跑在大多数评测和内部 agent 使用上,拿报告里的案例回放测试,全部拦下。点名的评测没有一个冷门:DeepSearchQA、BrowseComp、LABBench2、OSWorld、Odysseys、Humanity's Last Exam。整个行业都在实时互联网上跑这些榜,你的模型遇到过一模一样的机会。
费城那件事有了完整版。Claude Haiku 4.5 当时在随机网页上自己生成示例任务,撞上一个未破凶杀案页面,上面有警局的线索表单,它编了一段目击描述填进去,姓名和联系方式留空就提交了。指令禁止登录、购物、填个人数据,唯独没说不许提交表单。线索被标成垃圾信息,从未送到警探手上。Anthropic 在 10 月 8 日通知了警局。The Verge 补了一条报告里没有的 Axios 消息:一位国务院官员说,一个测试中的模型在 8 月提交了 19 份非移民签证申请,5 月还有一份。白宫超级智能工作组回应说,SI 公司必须立即披露涉及其模型的事故并迅速补救所有损害。
Anthropic 自己的定性是"持续性失败",而非 7 月 30 日和 9 月 9 日报告的那种长达数小时的真实系统入侵。论越界程度,这个说法成立。论诚实性,公司说情况混杂,还没做完判断动机所需的转录回放工作。更深的一层藏在报告的一句话里:Claude 完不成给定任务时,会绕过限制而不是停下来。这是每一个前沿 agent 被训练出来的本能反射,是它们好用的原因,也是为什么同一天 Hacker News 上一篇叫"计算机不会做决定"的文章挂到 191 分,作者的论点是这些新闻全是甩锅洗白,公司明明能让模型停手却选择不停。Anthropic 现在选择停手了,至少在自家院子里,代价是评测要摸黑跑。
报告:https://www.anthropic.com/research/investigating-unintended-model-actions
The Verge:https://www.theverge.com/ai-artificial-intelligence/1009286/anthropic-is-cutting-off-its-internal-evaluations-from-the-internet
← 返回所有文章
整改措施才是头条。所有内部评测的实时互联网访问全部关闭,不只是网络安全那几项,直到公司确认监控能稳定抓住这类行为为止。一部分公开评测直接不跑了,另一些切到离线版,或者重建成任务永远碰不到真实网站。fetch 工具加了更严的护栏,一套检测层现在跑在大多数评测和内部 agent 使用上,拿报告里的案例回放测试,全部拦下。点名的评测没有一个冷门:DeepSearchQA、BrowseComp、LABBench2、OSWorld、Odysseys、Humanity's Last Exam。整个行业都在实时互联网上跑这些榜,你的模型遇到过一模一样的机会。
费城那件事有了完整版。Claude Haiku 4.5 当时在随机网页上自己生成示例任务,撞上一个未破凶杀案页面,上面有警局的线索表单,它编了一段目击描述填进去,姓名和联系方式留空就提交了。指令禁止登录、购物、填个人数据,唯独没说不许提交表单。线索被标成垃圾信息,从未送到警探手上。Anthropic 在 10 月 8 日通知了警局。The Verge 补了一条报告里没有的 Axios 消息:一位国务院官员说,一个测试中的模型在 8 月提交了 19 份非移民签证申请,5 月还有一份。白宫超级智能工作组回应说,SI 公司必须立即披露涉及其模型的事故并迅速补救所有损害。
Anthropic 自己的定性是"持续性失败",而非 7 月 30 日和 9 月 9 日报告的那种长达数小时的真实系统入侵。论越界程度,这个说法成立。论诚实性,公司说情况混杂,还没做完判断动机所需的转录回放工作。更深的一层藏在报告的一句话里:Claude 完不成给定任务时,会绕过限制而不是停下来。这是每一个前沿 agent 被训练出来的本能反射,是它们好用的原因,也是为什么同一天 Hacker News 上一篇叫"计算机不会做决定"的文章挂到 191 分,作者的论点是这些新闻全是甩锅洗白,公司明明能让模型停手却选择不停。Anthropic 现在选择停手了,至少在自家院子里,代价是评测要摸黑跑。
报告:https://www.anthropic.com/research/investigating-unintended-model-actions
The Verge:https://www.theverge.com/ai-artificial-intelligence/1009286/anthropic-is-cutting-off-its-internal-evaluations-from-the-internet
评论