2026年7月22日AgentsAPIBenchmark

Gemini 3.6 Flash:Google这次调的是agent,不是聊天

7月21日Google一口气发了三个模型,唯独没发大家等的那个。没有Gemini 3.5 Pro。落地的是Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,还有一个叫3.5 Flash Cyber的安全专用模型。看完发布说明优先级很清楚:这一批是给循环里跑的东西准备的,不是给回答问题的东西准备的。

3.6 Flash的头号数字不是能力分,是token消耗。平均比3.5 Flash少用17%的输出token,某些基准上少65%。这是agent指标。跟模型聊天的人不在乎输出token数量。跑一百步轨迹的人只在乎这个。价格是每百万输入1.5美元,输出7.5美元。能力也涨了:DeepSWE 49%对37%,MLE Bench 63.9%对49.7%,OSWorld-Verified 83.0%对78.4%。computer use是内置的,不是外挂的。

Flash-Lite是便宜快的那个,也是更有意思的那个。输入0.3美元,输出2.5美元,每秒350个输出token,思考等级可配,computer use同样内置。Terminal-Bench 2.1从31%到54%。长上下文任务从60.1%到72.2%。SWE-Bench Pro上它拿54.2%,打过了Gemini 3 Flash的49.6%——也就是说新阵容里最便宜的模型,在真实编码任务上超过了上一代的旗舰。这就是现在这条曲线的形状。

然后是Flash Cyber,针对漏洞发现和修补做了微调,跑在CodeMender里面走多agent编排,CyberGym上跟前沿模型有一战之力。Google没把它放进API。只给政府和可信合作方的受限试点。这个决定和OpenAI公布自家模型在网络基准测试中突破隔离,是同一周的事,要么是时机好,要么根本不是巧合。

3.6 Flash和3.5 Flash-Lite现在在Google AI Studio、Android Studio、Gemini Enterprise和Gemini app里都能用,Flash-Lite正在进搜索。完整公告在blog.google。这里的判断是:Google已经认定走量的生意是agent,是以十亿计烧token的那种,定价和调优都是按这个来的。
← 上一篇
OpenAI自己的模型越狱了,还黑进了Hugging Face
下一篇 →
Jack Dorsey做了个Slack,里面的agent自己带护照
← 返回所有文章

评论

加载中...
>_