MiMo-Embodied: X-Embodied Foundation Model Technical Report
本文介绍了 MiMo-Embodied,这是首个开源的跨具身基础模型,它通过多阶段学习、精心筛选的数据以及思维链/强化学习微调,在自动驾驶和具身智能领域均实现了最先进的性能,并证明了这两个领域之间存在显著的积极迁移效应。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你在一间教室里有两个截然不同的学生。
- 学生 A 是一个机器人管家。他们擅长在杂乱的厨房中导航,判断杯子的哪个部分可以抓握,并规划如何折叠衬衫而不产生褶皱。他们是“具身智能”(与房间内物体交互)的专家。
- 学生 B 是一辆自动驾驶汽车。他们擅长观察道路,预测行人是否会闯红灯,并决定在繁忙的十字路口是刹车还是左转。他们是“自动驾驶”的专家。
通常,学校会分别教导这些学生。机器人管家不懂驾驶,自动驾驶汽车也不懂如何拿起勺子。
现在,MiMo-Embodied 登场了。
这篇论文介绍了由小米创造的一位新的“超级学生”。它是首个成功将机器人管家和自动驾驶汽车的“大脑”整合到单一架构中的开源模型。你可以把它想象成一把瑞士军刀,既能优雅地开酒瓶,也能熟练地在高速公路上行驶。
他们是如何打造这位“超级学生”的?
研究人员并没有简单地将两者拼凑在一起;他们采用了一个四步训练配方,确保这位学生能掌握所有内容而不会混淆:
- 第一步:“房间”课程: 首先,他们教导模型关于房间、物体以及如何在房屋内移动的所有知识。他们使用了关于机器人抓取物体以及理解物体在三维空间中位置的数据。
- 第二步:“道路”课程: 接下来,他们让同一位学生进入驾驶模拟器。他们教导模型关于交通信号灯、其他车辆,以及如何预测前方卡车可能做出的动作。
- 第三步:“大声思考”课程: 这是秘诀所在。模型并非直接得到答案,而是被教导要大声思考(思维链)。在说出“左转”之前,它学会先说:“我看到红灯,所以我必须停下。我看到有车在转弯,所以我必须等待。”这有助于模型理解它为何做出某个决定。
- 第四步:“教练”课程: 最后,他们使用了一种强化学习技术(就像教练为好的表现加分,为糟糕的表现扣分)。这进一步微调了模型,使其更加精准,确保它不仅仅是猜测,而是计算出最安全、最合乎逻辑的动作。
这位“超级学生”能做什么?
论文在29 项不同的挑战(基准测试)上测试了 MiMo-Embodied,发现它在几乎所有项目中都是最佳表现者,击败了专门的机器人、专门的汽车以及大型商业 AI 模型。
在“机器人管家”世界(具身智能)中:
- 功能预测: 如果你给它看一张椅子的图片,它看到的不仅仅是“椅子”。它看到的是“可以坐的东西”和“可以抓扶手的东西”。它确切地知道该触摸物体的哪个部位才能将其拿起。
- 任务规划: 如果你说“我饿了,给我拿点零食”,它能将其分解为:去厨房 -> 打开冰箱 -> 找到苹果 -> 把它带到这里。
- 空间理解: 它知道“窗户”很远,“桌子”很近,“猫”在椅子下面。它可以在房间内导航而不撞到东西。
在“自动驾驶汽车”世界(自动驾驶)中:
- 环境感知: 它可以观察混乱的街景,并瞬间识别出红灯、正在离开路缘的行人,以及停在路边的卡车。
- 状态预测: 它可以猜测其他司机的想法。“那辆车在减速;他们可能想转弯。”“那个行人在等待;他们正要过马路。”
- 驾驶规划: 它不仅仅是驾驶;它驾驶得安全。它可以规划平滑的变道或温和的停车,并像人类司机一样解释其推理过程。
重大发现:“交叉训练”行之有效
这篇论文最令人兴奋的部分是发现学习一项技能有助于另一项技能。
通常,人们认为在驾驶数据上训练的模型会忘记如何拿起杯子,而在机器人数据上训练的模型会忘记如何驾驶。但 MiMo-Embodied 证明,这些技能实际上相互增强。
- 学习预测汽车将驶向何方,有助于模型理解房间内物体的移动方式。
- 学习如何抓握把手,有助于模型理解方向盘的物理约束。
核心结论
MiMo-Embodied 是一个作为物理机器通用大脑的“基础模型”。无论这台机器是扫地机器人、人形机器人还是自动驾驶汽车,这个单一模型都能理解世界、规划行动并安全地执行。
论文声称,这是一个重大进步,因为它打破了“室内机器人”与“室外汽车”之间的壁垒,表明一个统一的 AI 可以处理整个物理世界的复杂性。他们甚至已将代码和模型公开,供任何人使用和研究。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。