2026年9月26日CodingResearchBenchmark

编码代理刚刚打赢了人手写的机器人规划器

98,000 个评测回合。一篇不太声张的论文背后压着这么多测试,而它的结论应该让所有花了半辈子手工调机器人规划器的人坐不住。Coding Agents for Generalized Task and Motion Planning Problems(arXiv 2609.30233)问的是:Claude Code 和 Codex 能不能取代广义任务与运动规划(TAMP)通常需要的那堆专门工程?答案是能,而且赢得不算险。

实验设计很干净。每个代理拿到任务描述和模拟器访问权,一个固定的合成预算,要写出一段程序。然后程序冻结,放到 100 个没见过的实例上跑,物体数量比原始基准用过的都多。测了三种配置:Opus 5 驱动的 Claude Code,GPT-5.6 Sol 驱动的 Codex,GPT-6 Astra 驱动的 Codex。环境取自 KinDER 和 PDDLStream,共 28 个,生成了 980 段程序。

在有人工规划器可比的 16 个环境里,代理的平均成功率是 56% 到 95%,规划器是 47%。它们也打赢了一次性生成代码和一个基于大模型的广义规划基线。物体越多,代理写的程序越能守住成功率,每个实例用的算力平均还少一个数量级。

日志才是最有意思的部分。代理用模拟器的方式和好工程师一模一样:戳一戳它来校准物理模型,测边界情况,在定稿之前修正策略。这正是一次性生成代码和代理之间的区别。给它一个能交互的环境和一份预算,它会先建立自己的理解,再写真正交付的东西。

该带走的是更大的那层意思。机器人真正贵的从来不是机器人本身,而是从任务到可用方案之间那几个月的定制工程。如果一个通用编码代理加上模拟器和预算,就能在多数环境里跨过这道坎,那规划器就成了生成出来的东西,而不是搭出来的东西。全部代码和给代理的完整提示词都已公开,想验证很容易。
← 上一篇
Astra 和 Opus 5 破了两条没人破得了的恩尼格玛密电
下一篇 →
AEWM:别再预测工具输出了,去改代理脑子里的烂主意
← 返回所有文章

评论

加载中...
>_