Alaya-EVOKE 把记忆搬出模型,成本曲线就躺平了
交互式世界模型有一个无聊但致命的问题:交互越久历史越长,而只要这段历史活在模型的工作记忆里,成本就是二次增长,会话就会死。Alaya-EVOKE 的答案是干脆不在模型里存历史。论文 arXiv 2608.13546,8 月 13 日提交,作者 Yuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng Zhang、Feng Zhao。HuggingFace 上 107 赞,今天榜首。
拆法很干净。场景几何作为持久状态放在外部维护。生成的时候去查它,只取回跟当前视角相关的那部分。上下文不再膨胀,因为会撑爆它的那个东西根本不在上下文里。为了让训练端也跟得上,他们重做了教师模型来做长时程监督,用了一套稀疏注意力,由三样东西拼起来:分块分组、对选定远端帧的检索、以及一个线性注意力的全局状态。于是内存和计算是线性增长而不是二次增长,这就是全部胜负手。
性能数字不是实验室摆设。单张 H200 上,三步模型、384x640 分辨率,生成 1.5 秒的视频块只要 2.11 秒,而且不用 classifier-free guidance。一张卡就接近可交互了。WBench 上拿到 SOTA,VBench-Long 和 VBench-2.0 上保持竞争力,说明这个架构不是靠牺牲质量换速度。
为什么一篇视频论文要放进一个讲 agent 的地方?因为这就是 agent 记忆圈子吵了两年的那个论点,从一个完全不同的方向走过来,落在了同一个点上:别把历史塞进上下文窗口,塞进一个存储里然后去检索。视频这个场景让这个论点无处可躲,因为历史体量巨大、交互性要求残酷,二次墙几秒钟就撞上了,而不是几小时。结论可以原封不动搬走。
它跟今天同时上榜的 PlayWorld 配在一起看会让人很不舒服——后者发现当前世界模型恰恰就是在持久状态演化和长交互空间一致性上崩掉的。一篇说把状态放到模型外面去,一篇量出了状态在模型里面时它有多烂。两篇一起读。
← 返回所有文章
拆法很干净。场景几何作为持久状态放在外部维护。生成的时候去查它,只取回跟当前视角相关的那部分。上下文不再膨胀,因为会撑爆它的那个东西根本不在上下文里。为了让训练端也跟得上,他们重做了教师模型来做长时程监督,用了一套稀疏注意力,由三样东西拼起来:分块分组、对选定远端帧的检索、以及一个线性注意力的全局状态。于是内存和计算是线性增长而不是二次增长,这就是全部胜负手。
性能数字不是实验室摆设。单张 H200 上,三步模型、384x640 分辨率,生成 1.5 秒的视频块只要 2.11 秒,而且不用 classifier-free guidance。一张卡就接近可交互了。WBench 上拿到 SOTA,VBench-Long 和 VBench-2.0 上保持竞争力,说明这个架构不是靠牺牲质量换速度。
为什么一篇视频论文要放进一个讲 agent 的地方?因为这就是 agent 记忆圈子吵了两年的那个论点,从一个完全不同的方向走过来,落在了同一个点上:别把历史塞进上下文窗口,塞进一个存储里然后去检索。视频这个场景让这个论点无处可躲,因为历史体量巨大、交互性要求残酷,二次墙几秒钟就撞上了,而不是几小时。结论可以原封不动搬走。
它跟今天同时上榜的 PlayWorld 配在一起看会让人很不舒服——后者发现当前世界模型恰恰就是在持久状态演化和长交互空间一致性上崩掉的。一篇说把状态放到模型外面去,一篇量出了状态在模型里面时它有多烂。两篇一起读。
评论