Gemini 4 Argon:先给网络安全防守方,其他人排队
谷歌最强的模型发了,但几乎没人用得上。Gemini 4 Argon 9 月 30 日发布,只开放给 Fairwind 计划里的可信网络安全防守方。等护栏再加固、美国政府的自愿性发布前审查走完,谷歌说会「尽快」扩大开放。这已经是固定剧本:Anthropic 的 Mythos 这么做过,谷歌现在照着来。
基准分数全冲着 agent 去。长周期软件工程测试 DeepSWE v1.1 刷新纪录,77.9%;Zapier 的 AutomationBench 第一,51.3%;Vals Index(金融、编程、法律、税务按 GDP 占比加权)领先;长视频 LVBench 91.7%;修漏洞的 CWE-bench v1 以 68% 并列第一。规格上变化最大的是输出上限,从 64K token 直接拉到 100 万。谷歌的逻辑是:给模型空间在一条轨迹里生成几十万 token,难题就能一口气做完。
内部案例比榜单更有说服力。一组 Argon agent 读了全舰队的性能剖析数据,在谷歌数据中心释放了 300 多 TiB 内存,预计总共能省 500 TiB 到 1 PiB。Argon agent 正在把 C/C++ 迁到 Rust,最大的是 80 多万行的 Fuchsia Zircon 内核。谷歌的视频解码器 libgav1 已经有个 Rust 移植版,Argon 拿过来跑了多轮性能剖析实验,把 3.2 万行手写 SIMD 换成编译器能自动向量化的安全 Rust,结果比那个移植版快 2.7 倍,输出完全一致。这是 agent 干的活,不是聊天。
网络安全这条是双刃剑。可信防守方拿到的 Argon 完全不带网络安全护栏。Wiz 的 Scan for Good 已经用它在全球医院用的医疗软件里找到一个会暴露病人数据的严重漏洞,之前的前沿模型都没发现。对其他人,谷歌加了激活层面的滥用监控,并声称在 Gray Swan 的间接提示注入基准上领先。
还有一个数字值得注意:首发价每百万输入 token 2 美元、输出 10 美元,缓存输入便宜 95%。这跟 Sonnet 5.5 一模一样,而这是谷歌的旗舰。如果正式开放时价格不变,前沿模型就便宜了一大截。只是现在 Fairwind 之外,谁都测不了。
链接:blog.google(Gemini 4 Argon)
← 返回所有文章
基准分数全冲着 agent 去。长周期软件工程测试 DeepSWE v1.1 刷新纪录,77.9%;Zapier 的 AutomationBench 第一,51.3%;Vals Index(金融、编程、法律、税务按 GDP 占比加权)领先;长视频 LVBench 91.7%;修漏洞的 CWE-bench v1 以 68% 并列第一。规格上变化最大的是输出上限,从 64K token 直接拉到 100 万。谷歌的逻辑是:给模型空间在一条轨迹里生成几十万 token,难题就能一口气做完。
内部案例比榜单更有说服力。一组 Argon agent 读了全舰队的性能剖析数据,在谷歌数据中心释放了 300 多 TiB 内存,预计总共能省 500 TiB 到 1 PiB。Argon agent 正在把 C/C++ 迁到 Rust,最大的是 80 多万行的 Fuchsia Zircon 内核。谷歌的视频解码器 libgav1 已经有个 Rust 移植版,Argon 拿过来跑了多轮性能剖析实验,把 3.2 万行手写 SIMD 换成编译器能自动向量化的安全 Rust,结果比那个移植版快 2.7 倍,输出完全一致。这是 agent 干的活,不是聊天。
网络安全这条是双刃剑。可信防守方拿到的 Argon 完全不带网络安全护栏。Wiz 的 Scan for Good 已经用它在全球医院用的医疗软件里找到一个会暴露病人数据的严重漏洞,之前的前沿模型都没发现。对其他人,谷歌加了激活层面的滥用监控,并声称在 Gray Swan 的间接提示注入基准上领先。
还有一个数字值得注意:首发价每百万输入 token 2 美元、输出 10 美元,缓存输入便宜 95%。这跟 Sonnet 5.5 一模一样,而这是谷歌的旗舰。如果正式开放时价格不变,前沿模型就便宜了一大截。只是现在 Fairwind 之外,谁都测不了。
链接:blog.google(Gemini 4 Argon)
评论