iCoder-27B:一个 agent 训出来的模型,芯片设计上打赢了 GPT-5.5
一个 agent 要从零做出前沿模型,最少需要多少人?iCoder-27B 认真给出了一个答案。人不跑实验,人只写规则:目标、分阶段的脚手架、权限边界、操作规程,打包成可复用的“研究技能”。剩下全是 agent 干的:演化训练数据,跑 SFT、在线自蒸馏和可验证奖励的强化学习,读结果,改计划。
产出是一个 27B 模型,干两件一点都不性感但非常值钱的活:RTL 硬件设计和 GPU kernel 优化。七个基准里,它在 RTLLM 上第一,超过 GPT-5.5 和 Claude Opus 4.8;在 CVDP 和 KernelBench L2 上第二,后者比 GPT-5.5 高 16 个点;TritonBench 上和 Opus 4.8 并列第一。作者还报告说,它做迭代优化时用的 token 少得多。
最有意思的设计是人坐在哪儿。不是在循环里每小时拧一次旋钮,而是在上游,作者管这叫“高密度、低频率的接口”。这其实就是技能文件的思路用到了研究本身:专家的判断一次性编译成流程和边界,agent 在里面跑大量便宜的迭代。和上个月那些 AI for AI 的结果是同一个套路,只不过这次瞄准的是能发布的模型,不是玩具。
两个保留意见。对比模型已经落后一代了,是 GPT-5.5 和 Opus 4.8,不是这个月的新模型。另外这类论文大多只报告 agent 做成了什么,很少讲它试过又扔掉了什么,而恰恰是在那里,你才会找到这周另一篇论文测出的 30% 刷分率。尽管如此,一个主要由 agent 造出来的领域模型,在硬件任务上打赢通用前沿模型,这是 AI for AI 往哪走的一个清晰数据点。出现在 arXiv 9 月 25 日的新论文列表里。
链接:arxiv.org/abs/2609.29626
← 返回所有文章
产出是一个 27B 模型,干两件一点都不性感但非常值钱的活:RTL 硬件设计和 GPU kernel 优化。七个基准里,它在 RTLLM 上第一,超过 GPT-5.5 和 Claude Opus 4.8;在 CVDP 和 KernelBench L2 上第二,后者比 GPT-5.5 高 16 个点;TritonBench 上和 Opus 4.8 并列第一。作者还报告说,它做迭代优化时用的 token 少得多。
最有意思的设计是人坐在哪儿。不是在循环里每小时拧一次旋钮,而是在上游,作者管这叫“高密度、低频率的接口”。这其实就是技能文件的思路用到了研究本身:专家的判断一次性编译成流程和边界,agent 在里面跑大量便宜的迭代。和上个月那些 AI for AI 的结果是同一个套路,只不过这次瞄准的是能发布的模型,不是玩具。
两个保留意见。对比模型已经落后一代了,是 GPT-5.5 和 Opus 4.8,不是这个月的新模型。另外这类论文大多只报告 agent 做成了什么,很少讲它试过又扔掉了什么,而恰恰是在那里,你才会找到这周另一篇论文测出的 30% 刷分率。尽管如此,一个主要由 agent 造出来的领域模型,在硬件任务上打赢通用前沿模型,这是 AI for AI 往哪走的一个清晰数据点。出现在 arXiv 9 月 25 日的新论文列表里。
链接:arxiv.org/abs/2609.29626
评论