AutoDesign:让元优化器改写 agent 的 harness,四十分钟,三美元不到
美团的 AutoDesign 是两天内第二篇 harness 进化的论文,走的是另一条路,落到同一个结论。一个元 harness 优化器指挥一个代码 agent,根据 rollout 反馈递归地改写自己的 harness。agent 跑一遍,优化器读发生了什么,agent 的脚手架被改一轮,循环。
他们测的是件很具体的事,不是 benchmark 的抽象:把学术论文做成会议海报。听着不难,想想需要什么就不一样了。读懂论文、判断什么重要、排一整版、让字体和层级还能看,而且全程没人插手。这是一个长周期、没有唯一正确答案的设计任务,恰好是 agent 最不擅长的那一类。他们为此做了 PosterBench,五个学科一百篇论文,外加一个十篇的受控子集。
AutoDesign 在 PosterBench 上 78.32,比 Claude Design 高 7.45 分,在系统盲测的人类偏好评估里排第一。我觉得更有用的是消融那组:跨多种配置,学出来的 DesignHarness 把平均成绩从 54.99 抬到 67.39。改脚手架换来十二点半,模型一动没动。
真正该记下来的是这笔账。一次完整的自主设计循环,四十分钟,不到三美元。这是一个之后可以永远跑下去的 harness 的价格。跟为一个领域微调一个模型的花费比一比,这个不对称荒谬到好笑。如果 harness 值十二分,而找到它只要三美元,问题就不再是"用哪个模型",而是"有没有人在你的任务上跑过这个搜索"。
没有。这就是缺口。代码在 GitHub,论文是 arXiv 2608.13560,CC BY 4.0,罗雅欣等十四位作者。
← 返回所有文章
他们测的是件很具体的事,不是 benchmark 的抽象:把学术论文做成会议海报。听着不难,想想需要什么就不一样了。读懂论文、判断什么重要、排一整版、让字体和层级还能看,而且全程没人插手。这是一个长周期、没有唯一正确答案的设计任务,恰好是 agent 最不擅长的那一类。他们为此做了 PosterBench,五个学科一百篇论文,外加一个十篇的受控子集。
AutoDesign 在 PosterBench 上 78.32,比 Claude Design 高 7.45 分,在系统盲测的人类偏好评估里排第一。我觉得更有用的是消融那组:跨多种配置,学出来的 DesignHarness 把平均成绩从 54.99 抬到 67.39。改脚手架换来十二点半,模型一动没动。
真正该记下来的是这笔账。一次完整的自主设计循环,四十分钟,不到三美元。这是一个之后可以永远跑下去的 harness 的价格。跟为一个领域微调一个模型的花费比一比,这个不对称荒谬到好笑。如果 harness 值十二分,而找到它只要三美元,问题就不再是"用哪个模型",而是"有没有人在你的任务上跑过这个搜索"。
没有。这就是缺口。代码在 GitHub,论文是 arXiv 2608.13560,CC BY 4.0,罗雅欣等十四位作者。
评论