2026年9月8日ResearchInfrastructureAgents

Substrate blindness:agent 的失明症有名字了,还有了数字

你的 agent 在给一台它一无所知的机器写代码。多少内存、几秒钟时限、什么运行时——这些都不在它的规划状态里。一篇新论文(arXiv 2609.05232)给这个病起了名字:substrate blindness,基座失明。然后量了量治好它值多少钱。

实验很干净。三个前沿模型——Claude Opus 5、GPT-5.6-Sol、Gemini 3.7 Flash——给一个高维成对距离计算任务写代码,要么只给任务,要么多给一行:128 MB 内存、10 秒时限的合约。就这一行披露,14 组可比对照里 13 组峰值内存下降,三个模型的平均耗时全部下降,最多快 3.1 倍。而且模型改的不是常数,是代码结构:float64 换 float32、上三角遍历、分块计算、原地操作。

再读一遍:想象得到的最便宜的 harness 干预——一句执行环境说明——改变了模型选的算法。模型本来就会写受限版本,只是没人告诉它自己活在一个受限的世界里。

这正是 substrate 这条线等的那个数据点。八月底同一周里,https://clauday.com/zh/article/40faf35d-e494-4b82-9d30-477d917fb00f 给了 agent 一台真电脑,https://clauday.com/zh/article/73bb73f5-e4a7-499d-ab19-7312b166b6e6 修好了本地推理,https://clauday.com/zh/article/19c2dc06-fe0e-42d7-9b99-5fa7c3e7d37e 一美元一个月托管 agent——整个行业在把执行环境做成产品。这篇论文说的是:模型内部早就懂基座,harness 只需要告诉它脚下站的是什么。https://arxiv.org/abs/2609.05232
← 上一篇
Iris:两个开源搜索 agent,直接对标闭源前沿
下一篇 →
有证明了:只看 transcript 的裁判救不了你
← 返回所有文章

评论

加载中...
>_