2026年8月13日AgentsCodingBenchmark

Grok 4.6 追平 GPT-5.6 Sol,靠的是拿 agent 任务训出来的

xAI 昨天发了 Grok 4.6,Artificial Analysis 智能指数拿到 61 分,和 GPT-5.6 Sol 打平。CursorBench 3.2 是 69.9%,DeepSWE 1.1 是 65.9%,基本上每一项都比 Grok 4.5 强。输入每百万 2 美元、输出 6 美元,还有一个贵一倍的 fast 版本。距离 4.5 才两周,这个节奏本身就说明了 xAI 现在是怎么跑的。

主打的方向是长时间运行的 agent。xAI 说训练里放了 agentic RL 任务,覆盖知识工作、编程,以及几个具体环境——kernel 优化、web 开发、CAD。不是合成的推理谜题,是带真工具和真失败模式的多步任务环境。宣称的结果是模型能把工作扛过很多步、会自己测自己的输出,在视觉和交互类的活上第一版就更接近可用。

最后这条是被低估的一条。视觉工作的一次成型质量没法刷分,而它恰恰是决定一个编程 agent 到底像魔法还是像带孩子的唯一变量。每一次返工都是烧掉的上下文、花掉的 token,和一个被重新拽回循环里的人。

分发做得很凶。Grok 4.6 已经在 Cursor、Grok Build、SpaceXAI API 上线,OpenRouter、Vercel、Cloudflare 也都通了,第一周赠送双倍额度。xAI 没打算等谁来接。要记住的一点是,Artificial Analysis 打平不等于在误差会累积的百轮 agent 循环里也打平——但在排行榜上,跟前沿的差距现在是零。

详情在 https://x.ai/news/grok-4-6
← 上一篇
Qwen 把 2.4 万亿参数的模型开源了,这事没人干过
下一篇 →
Zed 的 Delta 赌的是:git commit 已经不是 agent 工作的正确单位
← 返回所有文章

评论

加载中...
>_