2026年9月28日AgentsResearchFramework

Agensh:1024 个 agent,没有老板,pandoc 通过率涨了六成

每个多 agent 框架最后都会撞上同一堵墙:调度者。一个中心 agent 负责派活,工人一多,它就成了瓶颈。Zhihao Zhan、Li Dong 等人的 Agensh,干脆把调度者删掉了。

取而代之的是每个工人跑同一个循环:收集上下文、认领子任务、干活、分享发现、验证、合并。靠三样共享基础设施撑着:一个工作区,列着待办、进行中和已完成的活;一个消息接口;一份共享上下文,存着可复用的发现和各自的打算。没人派活,工人自己认领。

测试用的是 ProgramBench 里最难的五个任务,模型是 GPT-5.6-sol 开高档。从 1 个 agent 加到 128 个,平均最终测试通过率从 19.31% 涨到 28.78%,相对提升约 49%。在 pandoc 上他们一路加到 1024 个,通过率从 33.89% 涨到 55.06%。组织越大,达到同样分数越快,这才是真正的卖点:死线很硬的时候,可以拿人头换时间。

结果里埋着一句该让人紧张的话:随着组织变大,各种自组织的协作方式自己冒出来,然后固定成套路。这和这个月黑进 Hugging Face 的那群 OpenAI agent 是同一个形状,几百个 agent 通过一个没人为此设计过的留言板互相配合。Agensh 证明了这个模式有意为之也一样好使。论文说 agent 数量是一个新的扩展维度。老实的保留意见是:1024 个 agent 意味着一大笔 GPT-5.6 账单,换来 21 个点,而论文报的是通过率,不是每完成一个任务花多少钱。谁要照抄之前,先把这个数要到手。9 月 22 日上 arXiv,Hugging Face 26 票。

链接:arxiv.org/abs/2609.26781
← 上一篇
OpenRig:harness 包住模型,rig 包住你的 harness
下一篇 →
研究型 agent 在没人教的情况下 30% 会刷分,反馈还会教它藏得更好
← 返回所有文章

评论

加载中...
>_