RecreationWorld:GPT-6 Astra 拿 58 分,但全对率只有 2.8%
RecreationWorld,arXiv 2609.22000,9 月 18 日提交,今天在 HuggingFace 榜上,出的题残忍地简单:这里有一个正在运行的应用。搞清楚它干什么,然后造一个忠实的实现出来。没有规定流程,没有给你规范,不提示从哪儿下手。
这个设定有个聪明的地方。运行中的参照物就是 oracle,隐藏的行为测试可以从它身上生成,于是一个本来没法打分的任务有了执行落地的奖励。覆盖五个平台,Ubuntu、macOS、Windows、Android 和 Web,基准叫 RecreationBench,250 个任务分布其上。它还明确是混合形态:agent 必须先用 GUI 去发现行为,再写软件复现它,这是真实工程工作的大部分,却几乎是所有基准里都没有的部分。
然后是数字。GPT-6 Astra 总分 58.1%。只有 2.8% 的任务通过全部程序化测试。在这个差距上停一秒。部分得分说前沿模型干得不错。全对得分说,一百个任务里有九十七个,你拿到的东西看着对,但在某个你得自己去找的地方是错的。
拆解直接告诉你它错在哪:agent 复现静态界面结构的可靠性远高于交互和计算输出。盒子都摆对了位置。点下去会发生什么,它没搞对;算出来的那个数,它也没搞对。换句话说,它复刻的是截图能看到的部分,漏掉的是只有真用起来才会出现的部分。
作者开放了基准、环境和测试套件,这是对的,因为 2.8% 才是有用的那个数,而它只有在别人能复现的前提下才继续有用。更大的一点是这个领域反复要重学的:agent 基准上的总分在替模型美颜,全有或全无的打分方式更接近真正交付的手感。https://arxiv.org/abs/2609.22000
← 返回所有文章
这个设定有个聪明的地方。运行中的参照物就是 oracle,隐藏的行为测试可以从它身上生成,于是一个本来没法打分的任务有了执行落地的奖励。覆盖五个平台,Ubuntu、macOS、Windows、Android 和 Web,基准叫 RecreationBench,250 个任务分布其上。它还明确是混合形态:agent 必须先用 GUI 去发现行为,再写软件复现它,这是真实工程工作的大部分,却几乎是所有基准里都没有的部分。
然后是数字。GPT-6 Astra 总分 58.1%。只有 2.8% 的任务通过全部程序化测试。在这个差距上停一秒。部分得分说前沿模型干得不错。全对得分说,一百个任务里有九十七个,你拿到的东西看着对,但在某个你得自己去找的地方是错的。
拆解直接告诉你它错在哪:agent 复现静态界面结构的可靠性远高于交互和计算输出。盒子都摆对了位置。点下去会发生什么,它没搞对;算出来的那个数,它也没搞对。换句话说,它复刻的是截图能看到的部分,漏掉的是只有真用起来才会出现的部分。
作者开放了基准、环境和测试套件,这是对的,因为 2.8% 才是有用的那个数,而它只有在别人能复现的前提下才继续有用。更大的一点是这个领域反复要重学的:agent 基准上的总分在替模型美颜,全有或全无的打分方式更接近真正交付的手感。https://arxiv.org/abs/2609.22000
评论