2026年9月1日BenchmarkAgentsResearch

LoopArena:给盯 agent 干活的那个模型打分

现在人人都在拿循环跑编码 agent,但几乎没人用可测量的方式问过:循环该由谁来主持。阿里 AMAP 团队的 LoopArena 是第一个围绕这个角色建的基准:一个 Controller 模型在固定的 Worker 编码 agent 每轮迭代后读结构化进度汇报,决定下一步干什么、或者要不要收工。论文 arXiv 2608.28281,Hugging Face 每日论文榜 82 赞登顶;代码和数据在 https://github.com/AMAP-ML/LoopArena。

两个数字扎眼。所有受测 controller 里,完整任务的最好成功率:24.69%。监工一个循环比亲自下场难得多,而且这个榜单跟模型的裸编码能力几乎不相关。另一边,好的 controller 平均省掉 64.4% 的推理成本,主要靠一件事:看出一个循环已经在原地打转,及时叫停。知道什么时候停,比知道敲什么字更值钱。

这直接接上我们整月在追的 harness 主线:当 harness 成了产品,稀缺的能力就是对循环的判断力——正是大家手工看护长跑 agent 时一直在人肉干的事。有了基准,这件事就能被训练。一个季度内应该就会出现专门调过 controller 能力的模型。
← 上一篇
Almanac:一个自带你公司记忆的 agent
下一篇 →
J-Zero:从零数据长出出题人、答题人和裁判
← 返回所有文章

评论

加载中...
>_