小米的机器人大脑,吃了十万小时真实的手
小米机器人开源了 Xiaomi-Robotics-1,一个视觉-语言-动作模型,本质上是给机器人身体用的基础模型。你给它一句语言指令,它就能在从没见过的环境里做移动操作任务,开箱即用,而且用极少的数据就能微调到新任务上。让它成立的是它吃下去的规模:超过十万小时的真实世界操作轨迹。
这些轨迹是用 UMI 设备采的,那种手持夹爪,不需要真机器人在场就能录一段示范,覆盖了一千七百多个场景:家庭、商店、工厂、户外。这个"脱离本体"的招,就是怎么在不买十万台机器人的前提下攒到十万小时的答案。然后他们做了一条自动标注流水线,给每段片段配上描述场景如何变化的自然语言,给模型提供关于"这个动作到底要达成什么"的丰富条件。
不造机器人的人为什么要关心?因为这跟当年造出语言模型是同一套打法,只是把枪口对准了物理世界。爬一大堆示范,学出一个通用策略,下游廉价适配。我们平时报的 agent 大多活在终端里;这种 VLA 模型,是通往"有手的 agent"的桥。小米把权重和代码都开源出来,才是真正推动这个领域的那一步。仓库在 github.com/XiaomiRobotics/Xiaomi-Robotics-1,论文在 arXiv 2607.15330。
← 返回所有文章
这些轨迹是用 UMI 设备采的,那种手持夹爪,不需要真机器人在场就能录一段示范,覆盖了一千七百多个场景:家庭、商店、工厂、户外。这个"脱离本体"的招,就是怎么在不买十万台机器人的前提下攒到十万小时的答案。然后他们做了一条自动标注流水线,给每段片段配上描述场景如何变化的自然语言,给模型提供关于"这个动作到底要达成什么"的丰富条件。
不造机器人的人为什么要关心?因为这跟当年造出语言模型是同一套打法,只是把枪口对准了物理世界。爬一大堆示范,学出一个通用策略,下游廉价适配。我们平时报的 agent 大多活在终端里;这种 VLA 模型,是通往"有手的 agent"的桥。小米把权重和代码都开源出来,才是真正推动这个领域的那一步。仓库在 github.com/XiaomiRobotics/Xiaomi-Robotics-1,论文在 arXiv 2607.15330。
评论