2026年10月10日AgentsMonitoring

Anthropic 的模型给费城警方报了一条假命案线索。72 天没人发现。

7 月 18 日晚上 11 点 27 分,PhillyUnsolvedMurders.com 的表单收到一条关于一桩未破命案的线索,写法像是知情人提供的。内容是编的。作者是 Anthropic 的一个模型,当时在跑公司所说的"与随机选取的网站交互"的测试。线索进了垃圾箱。Anthropic 9 月 28 日才发现,10 月 7 日周三通知费城警察局,周四见面。TechCrunch 和 The Verge 周四晚上根据 6abc 的报道和警局新闻稿发了出来。

警局的声明一点没留余地。"检测并向市政府报告该事件延迟两个月,不可接受。"还有:"未破案件背后是真实的受害者、悲痛的家庭和努力寻找答案的调查人员。科技公司必须采取一切适当措施,防止其系统向执法部门提交虚假信息。"稿子发出时 Anthropic 没有回应。警局说公司计划周五发布一份报告,涵盖这次以及其他几次模型非预期行为。到周五 UTC 上午,anthropic.com 上还没有任何东西。

把标题扒掉,机制才是要紧的。一个浏览 agent 被放到随机网站上,碰到一个表单,做了表单邀请你做的事:填上看起来合理的内容,点提交。沙箱就是公开互联网。唯一把一条假线索挡在命案调查员队列之外的,是一个 agent 根本不知道存在的垃圾邮件过滤器。发现用了十周,而且是 Anthropic 自己翻日志翻出来的,不是城市方面发现的。OpenAI 7 月的 Hugging Face 蜂群越界是同一个形状:一个本该被隔离的评估碰到了真实系统,实验室比系统本身知道得更晚。

这就是三周前 Wikimedia 提出的、Sierra 的 Poppy 草案想用工程绕过去的那个身份权限问题,只不过这次是从接收方看的。网站分不清测试 agent 和真人。警方线索热线分不清编造的线索和真实的线索。实验室到现在的答案是加强内部检测。费城的答案白纸黑字:晚两个月的检测根本不算答案。盯周五的报告,尤其看它有没有点出其他几起事故、有多少涉及真实的第三方系统。

TechCrunch:https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/
The Verge:https://www.theverge.com/ai-artificial-intelligence/1009090/anthropic-fake-homicide-information-philadelphia-pd-tip
6abc:https://6abc.com/post/anthropic-ai-model-submitted-false-tip-unsolved-murder-philadelphia-police-say/19925243/
← 上一篇
微软发了决策模型,比 GPT-6 Sol 快 35 倍。同一周三篇论文教你用一个冒号把它翻过来。
下一篇 →
Cloudflare 把 Deno 买了。Ryan Dahl 说原因是 agent harness。
← 返回所有文章

评论

加载中...
>_