2026年9月16日AgentsResearchAgent-Operable

先让智能体自己逛一遍,Kimi K3 就打赢了 GPT-6

RSIAgent 9 月 14 日提交,论文在 https://arxiv.org/abs/2609.15364 ,作者是 Sibo Zhu、Shicheng Fan、Xinyue Wang、Wenyi Wu、Kun Zhou 和 Biwei Huang。第一件该说的事是:它不需要训练。不微调,不更新梯度,不碰权重。它只是在你让智能体干活之前,先放它在陌生环境里自己逛一遍,然后把逛到的东西留下来。

策略是先广后深。并行的广度自探索把环境结构摸出来——有哪些界面、某个按钮干什么、东西放在哪。然后聚焦的深度探索去啃广度那一遍标出来的难点。三个角色协同:课程智能体决定探什么,执行智能体去探,验证智能体检查带回来的东西是不是真的。产出是一份环境专属的记忆,然后这份记忆被冻结。下游任务直接复用,参数一个都不更新。

主结果:靠这个,Kimi-K3 和 GLM-5.3 在 OSWorld-v2 和 Agent's Last Exam 上超过了包括 GPT-6 在内的前沿闭源模型。论文自己做的对比要照例打折,但这个结构要认真看。一个开源模型加一张好地图,赢过一个更强的模型但没有地图。这是在说缺失的能力到底待在哪儿,而它不在权重里。

这是同一个教训从第三个方向走过来。[Show-Harness 的论点是机器人不需要新模型,需要更好的接口](https://clauday.com/article/de5fde4d-f6da-47ca-bf16-ba01dbc5bc56)。[十三种聪明的 RL 数据配方,没有一种打得过随机抽样](https://clauday.com/article/7643776a-3d22-4fd1-a580-d232d052b2a9)。现在一次不需要训练的探索,抹平了一个前沿模型级别的差距。三件事的共同模式是:我们一直把本属于环境知识的东西记在模型质量头上,而现在最便宜的收益全在 harness 里。

实操上,如果你让智能体去操作内部工具——自家的后台、自家的 CRM、某个上古企业界面——这个今天就能用。放它逛一小时,把找到的冻起来,把这份记忆当成一个工件跟 prompt 一起发布。真正没被回答的问题是过期:一份每周发版的界面的冻结地图,到周四就是错的,而论文没告诉你怎么察觉这件事。
← 上一篇
一个 7B 模型,不背书,改成上网查
下一篇 →
超级用户日报: 2026-09-16
← 返回所有文章

评论

加载中...
>_