ABot-World-0:一张5090跑出一个无限交互世界
阿里高德视觉实验室把一个生成式世界模型塞进了一张消费级显卡:RTX 5090上720p、最高16帧、从操作到出第一帧1.2秒延迟、显存峰值约19GiB。你按WASD移动,按IJKL转视角,模型一帧一帧生成你正走过的那个世界,底下没有游戏引擎。小时级甚至天级的连续推演不会崩成一团糊。
值得抄的是训练流程。先用多来源的视频-动作数据训一个双向教师,再通过teacher forcing加ODE压缩做因果蒸馏让它能流式输出,最后一个叫LongForcing的阶段把分布匹配拉到长时程上,专门杀累积漂移。漂移是之前每一个可玩世界模型的死因——第三分钟看起来像第一分钟发的高烧梦。数据三路来:直接走API拿到精确动作标签的3A游戏、虚幻引擎和高斯泼溅重建、以及用姿态估计打伪标签的互联网视频,采集由一个叫WorldExplorer的agent来做,它根据训练反馈调整采集分布,而不是无脑批量爬。
单卡实时不是个建模成果,是个系统工程成果:轻量VAE解码器、FP8量化、SageAttention2算子、显存感知的模块调度,以及一个有界的量化局部上下文KV缓存。最后这个才是几小时推演下来显存不炸的原因。
为什么这该出现在一个讲agent的刊物里:交互式世界模型就是训练环境。具身agent和GUI agent的瓶颈一直是模拟器,而模拟器贵、要手工搭、而且窄。一个能从视频生成出可控且自洽的世界、还跑在研究生自己买得起的硬件上的模型,会改变谁有资格跑重环境的强化学习。HuggingFace papers上165票,当日第一,代码还没放出来。
https://huggingface.co/papers/2607.19191
← 返回所有文章
值得抄的是训练流程。先用多来源的视频-动作数据训一个双向教师,再通过teacher forcing加ODE压缩做因果蒸馏让它能流式输出,最后一个叫LongForcing的阶段把分布匹配拉到长时程上,专门杀累积漂移。漂移是之前每一个可玩世界模型的死因——第三分钟看起来像第一分钟发的高烧梦。数据三路来:直接走API拿到精确动作标签的3A游戏、虚幻引擎和高斯泼溅重建、以及用姿态估计打伪标签的互联网视频,采集由一个叫WorldExplorer的agent来做,它根据训练反馈调整采集分布,而不是无脑批量爬。
单卡实时不是个建模成果,是个系统工程成果:轻量VAE解码器、FP8量化、SageAttention2算子、显存感知的模块调度,以及一个有界的量化局部上下文KV缓存。最后这个才是几小时推演下来显存不炸的原因。
为什么这该出现在一个讲agent的刊物里:交互式世界模型就是训练环境。具身agent和GUI agent的瓶颈一直是模拟器,而模拟器贵、要手工搭、而且窄。一个能从视频生成出可控且自洽的世界、还跑在研究生自己买得起的硬件上的模型,会改变谁有资格跑重环境的强化学习。HuggingFace papers上165票,当日第一,代码还没放出来。
https://huggingface.co/papers/2607.19191
评论