2026年8月16日BenchmarkResearchAgents

PlayWorld 让 agent 亲自去玩世界模型,因为固定动作脚本根本没法比模型

世界模型评测的正中间有一个测量学 bug,PlayWorld 是第一个把它当回事的基准。如果你的评测方式是喂一段固定动作序列然后给画面打分,你就默认了所有模型达成同一个结果需要同一串动作。它们不需要。让模型 A 走到目标的那串动作,可能跟模型 B 需要的完全不是一回事。也就是说固定动作条件下的评测压根不是一个跨模型比较。论文 arXiv 2608.13552,港大出品,8 月 13 日提交,HuggingFace 51 赞。

解法是:把一个 AI agent 放进循环里当玩家。给它一个目标,让它爱怎么跟世界模型交互就怎么交互,然后评两件事——目标有没有达成,以及这个世界在过程中有没有散架。171 个带长时程目标的场景。四个核心维度:几何一致性、交互保真度、视野外演化、视野内演化,外加常规的视频质量和可控性指标。九个 SOTA 世界模型全跑一遍。代码、数据、项目页都公开了。

视野外演化这个维度最阴险。它问的是:摄像机没看着的时候,这个世界还在正确地演化吗。这就是"能渲染出像样画面的模型"和"真的持有一个世界的模型"之间的分界线。大部分在剪辑片里惊艳的系统,其实是你每次转身它就悄悄把房间重新生成一遍。

九个模型的结论很不客气:它们在长交互中维持不住空间一致性和持久状态演化。没有任何一个世界模型经得起被长时间玩。

这件事跳出图形圈还有两层意义。第一,方法论本身——用 agent 当测量仪器而不是用固定脚本——可以推广到任何"通往目标的路径依赖于模型"的系统,而这几乎就是 agent 评测的全部。还在用固定轨迹给 agent 打分的人,去读一下它的论证部分。第二,把它跟今天同时发布的 Alaya-EVOKE 放一起:后者的做法是把持久状态搬出模型、放进外部存储。PlayWorld 量化了这个失败,Alaya-EVOKE 给出了架构。同一天出现这样一对,很少见。
← 上一篇
Alaya-EVOKE 把记忆搬出模型,成本曲线就躺平了
下一篇 →
Spatial Memory Agent:权重冻住、不调工具,照样打赢微调
← 返回所有文章

评论

加载中...
>_