Flex-: A Multi-Stream World-Action Model with Compute Flexibility
Flex- 是一个 6B 参数的世界动作模型,它利用一个冻结的视频生成变分自编码器(VAE)来在 RGB 之外隐式地编码 3D 几何结构和物体语义,从而实现一种灵活的多流训练方法,在无需新传感器或预训练的情况下,在现实世界的双臂操作任务中实现了卓越的泛化能力和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人正试图学习如何折叠一件衬衫或修理一个坏掉的玩具。长期以来,科学家们通过向机器人展示成千上万段人类完成任务的视频来教导它们,希望机器人能直接“模仿”这些动作。但这就像是试图通过只观察仪表盘灯光来学习开车;你看到了时速表在上升,但你并不理解道路、弯道或其他车辆。一种被称为“世界-动作模型”(World-Action Models)的更新、更智能的方法试图解决这个问题。这种方法不再仅仅是模仿,而是尝试预测未来会发生什么。它们会问:“如果我这样移动手臂,一秒钟后的世界会是什么样子?”通过预测未来,机器人学习了物理规则以及物体是如何相互作用的,这使得它在处理新任务时表现得更好,而不需要数百万个示例。然而,大多数这类聪明的机器人只能观察平面的、二维的图像(比如标准摄像头拍摄的内容),当试图抓取可能被遮挡在某物背后的三维物体时,这会产生困惑。
于是,FLEX-π 出现了,这是一个用巧妙的技巧解决这一难题的新型机器人大脑。把 FLEX-π 想象成一位名厨,他只需品尝一口汤,就能立刻知道里面究竟有哪些香料、汤有多烫以及有多浓稠,即便他手里只有一勺液体。在过去,为了让机器人理解三维形状(如深度)或物体的含义(如“这是一个杯子,而不是一个球”),科学家们必须给机器人配备昂贵的 3D 摄像头,或者教它全新的感知世界的方式。然而,FLEX-π 却发现了一个“免费的午餐”。它意识到,它用来理解平面图像的大脑,竟然也能几乎完美地理解三维形状和物体含义,而且无需任何额外的训练或新的硬件。
研究人员构建了一个拥有 60 亿参数的模型(一个非常庞大的数字大脑),它学习同时预测三件事:下一帧图像会是什么样子、场景的三维形状是什么,以及场景中的重要物体有哪些。奇迹发生于他们训练机器人同时想象这三件事的过程。如果机器人看到一张杯子的图片,它看到的不仅仅是一张平面图像;它会同时想象出杯子的三维深度,并知道它是一个“杯子”。更棒的是,他们教会了机器人具备灵活性。在训练期间,他们有时会隐藏三维数据或物体名称,迫使机器人仅凭平面图像来猜测它们。这意味着,当机器人实际工作时,它可以利用只有摄像头的“快速模式”(忽略 3D 和物体数据)运行,且依然非常聪明;或者如果它有充足的时间,它也可以使用所有数据进入“超级模式”。
测试结果令人印象深刻。当测试 FLEX-π 在执行复杂任务时的真实表现时——例如使用螺丝刀以毫米级的精度修复自己的夹持器,或者拉上一个柔软、有弹性的笔袋的拉链——FLEX-π 大幅超越了现有的顶尖机器人大脑,性能提升了 2 到 7 倍。它能以极少的演示次数学会这些复杂的技能,这意味着它不需要反复观看人类完成任务数百次。或许最令人惊讶的是,即使当 FLEX-π 被设置为“快速模式”且仅使用摄像头(忽略了它所学到的额外 3D 和物体数据)时,它仍然比其他顶尖机器人更快、更成功。论文表明,通过教机器人去想象具有三维感和物体含义的未来,我们可以让它变得更聪明、更具适应性,而且无需增加新的传感器,也不会降低其运行速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。