2026年9月4日BenchmarkAgents

Astra 在 ARC-AGI-3 拿了 98.6%,但星号比数字还大

OpenAI 说 GPT-6 Astra 在 ARC-AGI-3 上拿了 98.6%,六个月前这个数字是 7.8%。在一个专门设计来抵抗记忆背题的基准上,半年涨了九十个点。然后 ARC Prize 公布了自己的测试数据,星号比标题还大。

同一个模型,两套 harness:用 ARC 的标准 harness,Astra 在半私有题集上是 62.7%,花费 2.6 万美元;用 OpenAI 自己的 provider adapter——基于 Responses API,轮次之间保留推理内容、用 compaction 管理长上下文——就是 99.9%,花费 1.9 万美元。差 37 个点,而且更好的那套 harness 还更便宜。ARC 的说法很直接:这个基准测的是 Astra 加上 OpenAI 的 agent 系统,不是模型本身。

说清楚,模型本身确实惊人——96% 的关卡上它的操作效率超过人类中位数,用比人更少的步数解题。但这次双 harness 对照,是"harness 不是管道,harness 就是能力"这个判断迄今最干净的公开证据。权重不动,换个脚手架,涨 37 个点。

留给所有排行榜一个不舒服的问题:榜上的数字,多少是模型,多少是壳?ARC Prize 的分析在 https://arcprize.org/blog/astra,完整结果在 https://arcprize.org/results/openai-gpt-6-astra。
← 上一篇
GPT-6 Astra 来了,OpenAI 直接把 AGI 说出口了
下一篇 →
K2 Horizon:六个模型,零保密
← 返回所有文章

评论

加载中...
>_