WorldContact: A Contact-Centric World Model for Scalable Robot Learning
该论文介绍了 WorldContact,一种以接触为中心的世界模型,它能高效地为可变形物体操控生成高质量训练数据,实现了比源模拟器快 10 倍的速度,并显著将现实世界机器人策略的成功率从 65% 提升至 95%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够处理现实世界中混乱且不可预测性质的机器人面临着一个根本性的障碍:它们需要学习物体在被触摸、推动或提起时是如何表现的。与动作模式固定的国际象棋棋子不同,购物袋、衬衫或一块面团会不断改变形状,而这些变化会改变它们与周围一切事物的交互方式。为了安全且快速地学习这些技能,研究人员通常依赖于计算机模拟,让机器人在不损坏任何东西的情况下进行数千次的练习。然而,模拟柔软的可变形物体是非常缓慢且困难的,因为计算机必须实时计算每一个微小的褶皱和拉伸的物理过程,这一过程往往需要将时间分解为极其微小的、甚至可以说是痛苦的细微分数,以避免出错。
一个研究团队开发了一种名为 WorldContact 的新方法,这是一种专门设计的计算机模型,旨在预测软性物体在机器人与其交互时如何移动和变形。该模型并没有计算物理模拟中的每一个微观步骤,而是通过学习一小组高质量的示例,来预测一段较长时间内的动作结果。通过专门关注机器人、物体与环境相互接触的地方,该系统生成训练数据的速度比传统模拟器快了十倍。在对真实机器人进行测试时,这种方法使得机器人在学习一项复杂任务——提起购物袋——时,比仅依赖原始、更慢的模拟数据时要有效得多。
教导机器人操纵软性物体的核心挑战在于其中涉及的物理机制极其复杂。当机器人抓取一个袋子时,织物会折叠、在自身之间滑动并挤压桌面,产生一个每毫秒都在变化的交互网络。传统的模拟器通过在时间轴上采取极小的步长来处理这个问题,在每个瞬间检查碰撞并计算力,以确保袋子不会穿过桌面或机器人的手。虽然这种方法很精确,但计算成本极高,导致生成机器人学习新技能所需的大量实践数据变得非常缓慢。WorldContact 的研究人员意识到,尽管物理过程很复杂,但预测软性物体未来状态的最关键因素是理解接触点:即织物在哪里接触夹持器,在哪里接触桌面,以及织物的不同部分之间在哪里相互接触。
为了解决速度问题,该团队构建了一个跳过传统模拟中微小增量步骤的模型。相反,它学习在较大的时间间隔内(大约是源模拟器所用步长的二十倍)预测物体的整个形状变化。该模型是在一组有限的高质量轨迹(即从精确的物理模拟或现实世界交互中记录下来的运动路径)上进行训练的。它通过分析这些示例,来理解物体上特定点周围的局部几何形状和运动是如何影响整体的。通过专注于这些接触区域,该系统可以预测物体的变形和移动,而无需像标准物理引擎那样解析每一个微观交互。
研究人员使用包含十六种不同购物袋操纵任务的数据集对该方法进行了测试,涵盖了从简单碰撞到复杂的抓取和提起等场景。他们使用一个自动化代理来生成初始训练数据,确保每一次运动在物理上都是有效的,并且没有出现物体穿透彼此等错误。模型训练完成后,它被用于生成大量的额外实践数据。结果显示,WorldContact 生成状态展开(即预测物体如何随时间移动)的速度比原始模拟器快十倍,且未计入渲染图像或保存文件所需的时间。这种加速使得团队能够为训练机器人的控制策略(即机器人决定下一步行动的规则集)创建规模大得多的数据集。
这种方法的真正考验在于研究人员将其应用于现实世界的任务:教机器人提起购物袋。他们首先使用预训练的机器人策略,然后利用模拟数据对其进行微调。当机器人在仅使用二十五条模拟轨迹的原始有限数据集进行训练时,其在第一次尝试中成功提起袋子的概率为 65%。然而,当相同的策略使用由 WorldContact 生成的扩展数据集进行微调后,成功率跃升至 95%。这种显著的提升证明了由新模型高效生成的额外数据,为机器人提供了更丰富的理解,使其在处理袋子时不会掉落或抓取失败。
该系统的工作原理是将物体分解为数千个点(或顶点),并对每个点如何与其邻居及环境相关联的信息进行编码。它特别关注四种类型的接触:物体不同部分之间的空间接触、连接在物体结构上的点之间的拓扑接触、与机器人手臂和夹持器的可控接触,以及与桌面等表面的环境接触。通过将这些局部细节与场景的全局理解相结合,该模型能够高保真地预测整个物体的未来状态。在视觉对比中,其他方法往往无法维持夹持器与袋子之间的连接,导致袋子掉落,或者产生物理上不可能实现的变形。相比之下,WorldContact 在整个提起过程中能保持稳定的接触和真实的运动。
这项工作为可扩展的机器人学习开辟了一条新路径,即瓶颈不再是数据的可用性,而是生成数据的效率。通过使用以接触为中心的模型来放大一小组高质量的经验,研究人员可以快速使机器人的策略适应新的任务和物体。虽然目前的成功是在模拟环境中以及针对特定的提袋任务进行的,但该方法指向了一个未来:机器人可以从有限的现实世界交互中学习复杂的操纵技能,并利用智能模型来填补其中的空白。研究人员指出,挑战依然存在,特别是如何确保模型在现实世界与训练数据存在差异时仍能完美运行,但其结果提供了一个令人信服的证据,证明高效的数据生成可以显著提升机器人在物理世界中行动的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。