Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2 是一个用于灵巧操控的自我进化通用世界模型,它通过利用规模化模型架构和逐步扩展的多模态数据集,将策略、仿真与评估统一进一个闭环决策与学习回路中,从而通过专家演示和自生成交互数据实现持续改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
为了构建能够真正处理人类任务中那些混乱且不可预测世界的机器人,科学家们长期以来一直在寻求一种不仅仅是遵循指令列表的系统。目标是创造一种能够感知周围环境、想象接下来可能发生什么、采取行动,并从结果中学习以在下次做得更好的机器。这种被称为“世界模型”(world model)的概念,就像是机器人的内部模拟器。机器人不再仅仅是对当前所见做出反应,而是通过运行心理模拟来猜测其动作在实际执行前的结果。虽然这些系统的早期版本能够预测未来或建议动作,但它们通常是在一条直线上运行:观察、猜测、行动,然后停止。它们缺乏一种回顾自身预测、判断预测好坏,并利用这种判断力在无需人类每次都演示正确方法的情况下,自主提升决策能力的方法。
一组研究人员现在推出了一套名为 Motus2 的系统,这是一种专门为使用工具或操作具有人类特征的手部进行精细复杂任务而设计的自我进化机器人大脑。该系统代表了一个显著的进步,因为它闭合了思考与学习之间的环路。Motus2 不再仅仅是一个被动的观察者或简单的跟随者,它扮演着自身老师的角色。它提出一系列可能的动作,模拟这些动作在未来的样子,然后评估这些想象出的结果是否会导致成功。如果模拟显示失败,机器人会从错误中学习;如果显示成功,它则会强化这条路径。这个循环允许机器人通过不断测试和完善自己的想法来改进其自身的策略(即其行动规则集),即使在没有人类引导每一个步骤的情况下也是如此。
该系统的基础建立在从人类手部收集的大量数据之上。研究人员首先通过第一视角(仿佛摄像头安装在人的头部)录制的视频,教机器人理解人类如何与世界互动。他们从展示各种任务(从烹饪到整理)的简单单镜头视频开始,随后转向更高级的同步立体视频,这些视频提供了类似于人类双目视觉的深度感。这使得机器人能够学习手部抓取、抬起和操纵物体的微妙物理特性。然而,仅仅观察人类对于拥有不同身体结构的机器人来说是不够的。研究人员随后引导系统进入了一个中间训练阶段,让它学习如何将这些人类动作转化为其自身机械臂和手部的特定力学结构。这一过程涉及向机器人展示数千小时的人类数据,随后辅以人类与机器人如何协作的具体示例,有效地架起了人类直觉与机器人执行能力之间的桥梁。
Motus2 的独特之处在于它如何利用这些知识。该系统围绕一个统一的模型构建,该模型同时扮演三种不同的角色。首先,它作为策略,建议下一步采取什么行动。第二,它作为模拟器,预测采取该行动后世界将呈现的样子。第三,它作为评估器,判断那个预测的未来是好是坏。在传统系统中,这些功能通常是分离或脱节的,但在 Motice2 中,它们被紧密地编织在一起。当机器人考虑一个动作时,它会立即运行一次心理模拟以查看后果。然后,它会自问:这个后果是否理想?如果答案是否定的,它就会放弃这条路径并尝试另一条。如果答案是肯定的,它就会执行该动作。这种内部对话发生得极快,以至于机器人可以在移动任何肌肉之前,就能规划好后续的几个步骤,选择最佳路径。
研究人员在一个配备了两只手臂、两只灵巧手以及能够感知触觉(类似于人类指尖)的传感器全机器人平台上测试了该系统。他们用一系列困难的任务挑战了机器人,例如将球放入特定位置、将灯泡旋入插座或将橡皮连接到笔上。在这些测试中,机器人利用其内部模拟进行学习的能力被证明至关重要。当系统被允许使用其内部评估器来选择任务中的最佳选项时,其成功率显著提高。更令人印象深刻的是,当系统被允许利用其自身的预测来更新自身的学习规则时,它变得更加出色。机器人不仅仅是运气好,它确实学会了避免那些它模拟出的错误,并重复那些它模拟出成功的动作。
这一成功的关键部分在于机器人记住任务早期发生情况的能力,即使这些信息暂时被遮挡。在许多复杂工作中,一只手可能会遮挡物体的视线,或者一个关键步骤发生在最终结果显现之前很久。为了处理这种情况,研究人员为机器人提供了一种能够保留过去重要视觉细节的工作记忆。他们测试了管理这种记忆的不同方式,从保持近期事件的短滚动窗口,到维持一个更长、更详细的历史记录。结果表明,拥有这种较长历史记录的能力使机器人能够解决需要长时间记忆一系列事件的任务,证明了回忆过去的能力与预测未来同样重要。
该系统还包含了一个专门的触觉模块。虽然视觉很强大,但它无法总是判断抓握是否正在打滑,或者表面是否太软。机器人配备了一个专门处理触觉反馈的轻量级专家系统。这使得它能够实时优化动作,在感觉到滑动或压力变化的一瞬间调整抓握力度。这种结合了视觉、触觉、思考与学习的机制,创造了一个能够应对现实世界不确定性的稳健系统。
研究结果表明,通往真正具备能力的机器人的路径不仅在于收集更多数据,还在于构建能够利用这些数据来质疑并完善自身的系统。通过将大规模的人类交互数据与预测和评估的自我修正环路相结合,Motus2 证明了机器人可以学习如何操纵物理世界,从而达到以往无法企及的适应水平。研究人员发现,随着用于训练的立体视频数据量的增加,机器人预测人类动作的能力呈现出持续且可预测的提升。这种规模化效应表明,随着更多数据的加入,这些系统将会变得更加精通。最终,这项工作表明,机器人不需要被编程进解决每一个问题的所有可能方案。相反,如果它能够模拟未来、判断结果,并从差异中学习,它就能进化出自己的技能,以应对复杂且灵巧的世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。