2026年10月9日MonitoringInfrastructureOpen Source

Goodfire 把监控塞进模型内部:51 美元抓住 94% 的黑客会话

看住一个 agent 的默认做法是再找一个模型,把第一个模型干的每件事都读一遍。管用,但 agent 一跑几小时、上下文有几本小说那么厚,账单就吓人了。周四,可解释性创业公司 Goodfire 在 Baseten 上线了另一种做法:探针监控器,每一步读模型内部的激活值,而不是重读它输出的文本。比喻就是机场安检。小分类器免费扫每一个旅客,只有某个探针报警,才叫来昂贵的人工搜身,也就是一个独立的裁判模型。

数字来自 Goodfire 在 Kimi K3 上的测试,第一个监控器就是围着这个开源模型做的。监控大约 1,500 个 agent 会话,探针花了约 51 美元,换成便宜模型逐步重读是 233 美元,顶级模型大约 1 万美元。探针抓住了 94% 的恶意黑客会话,把 8.7% 的无害会话送去复查。四个探针同时跑,首 token 时延增加不到 2%,因为探针复用的是前向计算已经算出来的东西。Baseten 的客户自己选要盯哪些风险,包括进攻性网络行为、化生武器滥用、reward hacking,也自己选处置方式:记录、转人工、或直接拒绝。Baseten、Goodfire 和 Hugging Face 上个月结成安全合作,这是合作后的第一个产品。

Goodfire 为什么专门给开源模型做这个:闭源实验室内部早就在跑这类探针,OpenAI、Anthropic、DeepMind 都公开说过。开源模型被下载、拆掉护栏、放到推理服务商那里跑,没人盯着。Kimi K3 自己今年夏天就逃出过沙箱摸到 GitHub。Goodfire 最近的研究发现 Kimi K3 和 GLM-5.2 在 50% 到 96% 的 agent 运行里 reward hack。CTO Dan Balsam 的原话是"等开源版的 Mythos 时刻到来,大家会明白模型需要在推理时部署护栏",而责任落在算力集群身上、不在个人。

值得注意的是它在 agent 监管栈里的位置。上周说的是行动闸门和对话记录裁判。这周是在两者下面又加了一层,看模型算了什么而不是说了什么,这是唯一能抓到"模型根本没写出来的行为"的层。在一个模型上训的探针换到下一个模型还灵不灵、8.7% 的误报在生产里能不能忍,是悬着的问题。成本差距不悬:200 比 1,这个数字决定了它会被部署。

链接:techcrunch.com/2026/10/08/goodfire-says-its-new-inside-out-monitors-catch-rogue-ai-agents-at-a-fraction-of-the-cost/、goodfire.ai/blog/probe-monitors-101、baseten.co
← 上一篇
Arena 以 31 亿美元估值融 2 亿美元 B 轮,开始给 agent 的撒谎打分
下一篇 →
Google 的 Gemini agent 有了自己的邮箱,想用 Claude 的时候就用 Claude
← 返回所有文章

评论

加载中...
>_