Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning
本文介绍了语义丰富世界模型(Semantically Rich World Model, SR-WM),这是一个任务条件化框架,通过将视觉实体映射到功能角色(夹持器、目标、目标状态、关系和阶段)来预测符合任务一致性的未来,并实现在多种仿真环境下的鲁棒物理交互规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以像人类手部那样以流动的直觉在世界中移动。虽然机器可以被编程为遵循严格的指令,但当环境发生轻微变化,或者任务需要理解不仅是物体的存在,还包括这些物体如何相互关联以实现特定目标时,它们往往会失败。对于机器人来说,要拿起一个杯子并将其放在桌子上,它必须知道哪个物体是杯子,哪个是桌子,并且必须知道杯子应该向桌子移动而不会掉落。传统的预测未来的人工智能模型通常侧重于猜测下一张图像看起来是什么样,或者隐藏的数学模式暗示了什么。这些模型可能非常擅长预测像素,但它们在规划方面通常表现不佳,因为它们并不理解物体在任务“故事”中所扮演的角色。它们看到的是一堆东西,但不知道哪个是行动者,哪个是目标,或者哪个是目的地。
为了解决这个问题,来自北京人工智能研究院和上海交通大学的研究人员开发了一种让机器人理解世界的新方法,称为“语义丰富世界模型”(Semantically Rich World Model)。该系统不再试图预测一张模糊的未来图像,而是提出了一个更简单、更实际的问题:如果机器人执行特定的动作,它能否在保持重要事物安全的同时实现目标?研究人员发现,通过迫使机器人的大脑将它看到的每个物体归类为特定的功能角色——例如执行抓取的“手”、被抓取的“物体”、物体需要去的“地方”、它们之间的“关系”,以及任务的“当前阶段”——机器人会变得更擅长规划。这种方法将混乱的视觉场景转化为结构化的计划,允许机器人模拟不同的动作,并选择能导致成功而非迷失在无关细节中的路径。
这个新系统的核心在于机器人表示世界方式的转变。在旧的方法中,机器人可能会识别出一组物体,比如胡萝卜和一个容器,但它不知道哪一个是应该被移动的,也不知道它应该去哪里。这个建立在1500万个参数的轻量级基础之上的新模型,将这些视觉实体与五个截然不同的角色绑定在一起。第一个角色是“夹持器”(gripper),代表机器人自己的手。第二个是“目标”(target),即机器人需要与之交互的具体物体。第三个是“目标状态”(goal),即目的地或机器人想要实现的最终状态,例如容器被填满。第四个角色追踪这些项目之间的“关系”(relationship),理解目标是在目标状态之内还是与其接触。最后一个角色监控“阶段”(phase),追踪机器人是在接近、抓取、移动还是释放。通过这样组织世界,机器人可以通过计算目标是否会进入目标状态以及它们之间的关系是否会保持,来预测如果它移动手部会发生什么,而不是仅仅靠猜测下一张图片。
这种结构化的理解允许机器人生成多个可能的动作序列,并根据它们的语义意义而非视觉相似性进行评估。系统可以模拟一个机器人抓错物体,或者过早掉落物品的未来,并立即识别出这些都是失败。它利用这些知识对不同的选项进行排序,选择最能满足任务要求的路径。如果选定的路径看起来很有希望但在中间存在缺陷,系统可以只修复那一部分计划,而不需要从头开始。这种理解任务“故事”的能力——正在发生什么、需要发生什么以及必须保留什么——使得机器人显著增强了鲁棒性。在各种模拟环境中的测试表明,这种方法将复杂任务的成功率从大约45%提升到了83%以上,这是一个巨大的可靠性飞跃。
其中一个最引人注目的发现是,该系统并不依赖完美的视觉。许多之前的方法要求机器人拥有每个物体的完美、像素级的轮廓,这些轮廓通常由单独的、沉重的软件生成。新模型即使没有这些完美的轮廓,仅使用来自摄像头的原始视觉数据,也能有效地运行。它将分割掩码(即轮廓)视为可选的提示,而非严格的要求。在没有这些轮廓的情况下进行测试时,机器人仍然实现了很高的成功率,证明了该模型直接从它看到的视觉块中学习了基本的几何形状和关系。这使得该系统在现实世界中使用起来更加实用,因为在现实中,光影变化、阴影和遮挡经常会让简单的视觉系统感到困惑。
研究人员还证明,这种方法可以让机器人更快地学习新任务。因为机器人理解物体的通用角色——知道“目标”是某种被移动的东西,而“目标状态”是它去往的地方——它可以将这种知识应用于从未见过的全新情况。当在一种任务集上进行训练并在完全不同的任务集上进行测试时,机器人保留了大部分成功的能力,而从头开始在这些新任务上训练的模型表现明显较差。这表明该模型学习了一种可以迁移到不同环境中的“物理常识”。该系统不仅仅是在记忆特定的动作;它是在学习交互的底层逻辑。
虽然该系统非常有效,但研究人员也谨慎地指出了其局限性。该模型是为执行目标导向型任务(如拿起并放置物品)的单臂机器人设计的。它目前尚未构建用于处理涉及双手协作、操纵柔软或可变形物体或使用复杂工具的任务。此外,该系统依赖于模拟环境的训练数据,虽然结果令人鼓舞,但向物理机器人的过渡需要仔细的安全检查。研究人员在模拟环境中测试了该系统,在那里它可以安全地失败并从失败中学习,但他们强调,现实世界的部署需要额外的保障措施,以确保机器人不会损坏自身或周围环境。
这项工作的成功在于其概念的简洁性。通过不再认为机器人需要预测未来图像的所有细节,而是专注于对任务至关重要的特定角色和关系,研究人员创建了一个既高效又有效的模型。该系统使用紧凑的架构,可以在标准硬件上运行,使其能够应用于未来的机器人应用。它代表了一种转变:从要求机器人“看见”一切,转变为要求它“理解”手头的任务。通过这样做,它架起了原始视觉数据与智能决策之间的桥梁,为实现能够以先前难以企及的胜任程度在物理世界中导航的机器人提供了一条清晰的路径。研究结果表明,对于机器人要真正与世界互动,它们必须停止将物体仅仅视为像素,而要将其视为一个有开头、中间和结尾的故事中的行动者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。