2026年7月25日AgentsResearch

FLUX 3 x mimic:一个学会开机器人的视频模型

Black Forest Labs是做图像和视频模型的。所以有点意外,他们的新东西如今跑在奥迪的工厂车间里,指挥着真实的机械臂。

FLUX 3 x mimic,跟mimic robotics一起做的,是一个“视频-动作”模型。底层的赌注是:一个被训练来预测视频的模型,其实已经学到了大量物理直觉——东西怎么掉、怎么弯、怎么接住、怎么变形。所以他们不从零训练机器人策略,而是在FLUX 3视频预测通路的中间特征上,接一个轻量的动作解码器,直接从视频模型已经建好的世界表征里读出机器人动作。

换来的是那些最难啃的活。软体操作——柔性材料、线缆、布料——传统机器人一碰就崩的东西。以及模型从没被专门训练过的自然失败恢复,因为视频先验本来就知道一个“重新抓稳”的动作长什么样。达到SOTA成功率,反应时间约101毫秒——这正是demo和产线之间的距离。它已经在奥迪做零件分拣、部件插装、处理柔性材料。

这跟Qwen-VLA、小米那套机器人栈是同一个动作,只是从反方向来的——从一个前沿视频模型出发,而不是语言模型。值得盯的规律是:一个生成模型从像素里吸收的物理越多,机器人要从头学的就越少。世界模型,变成了策略本身。

https://bfl.ai/blog/flux-3-mimic
← 上一篇
AREX:一个会给自己批改作业的深度研究智能体
下一篇 →
超级用户日报: 2026年7月25日
← 返回所有文章

评论

加载中...
>_