τ0-VLA 把推理算力带上了机械臂
Hugging Face 日榜 514 个赞——这块板子几个月来打出的最大数字,给了一个机器人。τ0-VLA 来自上海创智学院,作者名单 39 人,是一个分层机器人基础模型,里面有一个值得偷走的想法:把高层决策当成一个算力可伸缩的推理问题。
具体说,机器人面对下一步做什么的难题时,高层策略不再一次前向就拍板,而是先用世界模型在候选子任务之间搜索——模拟、比较、再提交——把额外算力精确花在难的决策上。这就是 o1 那一课,从聊天 token 移植到了操作规划。多花推理算力,下一个子任务的预测准确率就是会涨,而且这个涨幅能一路传导成长程操作任务更高的成功率,分布偏移下也成立。
底座的规模对机器人领域来说相当夸张:40,115 小时异构真实世界数据,多种机器人本体,多模态联合训练。机器人数据集以前论百小时,四万小时是模型实验室的量级。
本站一直对具身方向保持距离,但这篇过线,理由很简单:它的机制就是我们天天报道的 agent 的机制。先想再做、算力按难度分配、拿世界模型当草稿纸。当同一个推理模式在同一个季度里既出现在编程 agent 又出现在机械臂上,这就不再是机器人新闻了——是 agent 打法逃出了终端。
论文:https://arxiv.org/abs/2608.16885 项目页:https://tau0-vla.github.io
← 返回所有文章
具体说,机器人面对下一步做什么的难题时,高层策略不再一次前向就拍板,而是先用世界模型在候选子任务之间搜索——模拟、比较、再提交——把额外算力精确花在难的决策上。这就是 o1 那一课,从聊天 token 移植到了操作规划。多花推理算力,下一个子任务的预测准确率就是会涨,而且这个涨幅能一路传导成长程操作任务更高的成功率,分布偏移下也成立。
底座的规模对机器人领域来说相当夸张:40,115 小时异构真实世界数据,多种机器人本体,多模态联合训练。机器人数据集以前论百小时,四万小时是模型实验室的量级。
本站一直对具身方向保持距离,但这篇过线,理由很简单:它的机制就是我们天天报道的 agent 的机制。先想再做、算力按难度分配、拿世界模型当草稿纸。当同一个推理模式在同一个季度里既出现在编程 agent 又出现在机械臂上,这就不再是机器人新闻了——是 agent 打法逃出了终端。
论文:https://arxiv.org/abs/2608.16885 项目页:https://tau0-vla.github.io
评论