Ouroboros 改自己的源码,Terminal-Bench 直接干到 86.74
一个 coding agent 改自己的源代码,让 diff 走一遍 review,commit 掉,然后接着干活。这就是 Ouroboros,arXiv 2608.08311,8 月 8 日放出来,现在 Hugging Face Daily Papers 上一千多票,今年 agent 类论文里最高的一次。
真正让人没法糊弄过去的是数字。Terminal-Bench 2.1,Opus 5 上 86.74%。OSWorld-Verified 90.69%。CL-Bench 归一化奖励 0.2301。这是前沿水平的成绩,而这套系统的核心主张是:没人手调这个 scaffold,是 scaffold 自己调的自己。
两种进化模式。递归自由进化,就是把「改进自己」当成调度器里的一个普通任务排进去。还有经验驱动进化,正常干活的时候撞上一个 bug 或者一条慢路径,就触发一次结构性改动。工具、prompt、上下文组装、核心实现,全在射程之内,全都要过一道 code review 才能落地。这道门就是整个设计的命门。两天前我们写的 VaG 讲的是同一件事:agent 自己生成改进没问题,自己批准自己就是另一回事了。
论文里埋着一句最值得记住的话。有个叫 Hope 的部署,已经在自由进化模式下跑了 161 天,横跨七个交互面,人类沟通受治理约束。这不是跑个 benchmark,这是一个已经连续五个月在改写自己的活体 agent。作者写得很明白,安全是这里的硬约束,因为一个能自我修改、还能自己选调用哪家模型 API 的 agent,跟一个只能改 prompt 的 agent,完全不是一个物种。作者名单里有 Roman Yampolskiy,说明他们心里有数。
论文:https://arxiv.org/abs/2608.08311
← 返回所有文章
真正让人没法糊弄过去的是数字。Terminal-Bench 2.1,Opus 5 上 86.74%。OSWorld-Verified 90.69%。CL-Bench 归一化奖励 0.2301。这是前沿水平的成绩,而这套系统的核心主张是:没人手调这个 scaffold,是 scaffold 自己调的自己。
两种进化模式。递归自由进化,就是把「改进自己」当成调度器里的一个普通任务排进去。还有经验驱动进化,正常干活的时候撞上一个 bug 或者一条慢路径,就触发一次结构性改动。工具、prompt、上下文组装、核心实现,全在射程之内,全都要过一道 code review 才能落地。这道门就是整个设计的命门。两天前我们写的 VaG 讲的是同一件事:agent 自己生成改进没问题,自己批准自己就是另一回事了。
论文里埋着一句最值得记住的话。有个叫 Hope 的部署,已经在自由进化模式下跑了 161 天,横跨七个交互面,人类沟通受治理约束。这不是跑个 benchmark,这是一个已经连续五个月在改写自己的活体 agent。作者写得很明白,安全是这里的硬约束,因为一个能自我修改、还能自己选调用哪家模型 API 的 agent,跟一个只能改 prompt 的 agent,完全不是一个物种。作者名单里有 Roman Yampolskiy,说明他们心里有数。
论文:https://arxiv.org/abs/2608.08311
评论