DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation
DeformSmith 是一个由物理约束引导的分层框架,它通过文本或图像输入,通过迭代构建和优化几何、材料及交互属性,实现用于机器人操控的高质量、符合物理规律的可变形资产的自动化生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器人学习移动的虚拟世界中,它们与之交互的物体往往过于完美。一个数字苹果是一个永不凹陷的刚性球体;一条数字毛巾是一张永不折叠的平整薄片。为了让机器人在模拟中学习如何抓取、抬起或搬运某物,该物体必须表现得像真实物体一样。它必须在受压时挤压变形,在落下时垂坠,并在被提起时保持形状。从头开始创建这些数字物体非常困难,因为物体的视觉外观——即它看起来的样子——仅仅是故事的一半。另一半是其隐藏的物理本质:它有多重,其材质有多软或多硬,以及它在被触摸时的反应。如果不知道这些不可见的属性,机器人可能会尝试拿起一个数字香蕉,却发现它像玻璃一样破碎,或者像水一样从指缝间滑落,仅仅是因为计算机不知道如何让它发生弯曲。
长期以来,研究人员一直试图使用文本描述或单张照片来生成这些3D物体,但直到现在,结果往往是视觉上令人信服但在物理上却是破碎的。它们可能看起来像个毛绒玩具,但在模拟中,它们会在自身重量下坍塌,或者无法对机器人的抓握做出反应。挑战在于,一张图片或一句话并不包含足够的信息来告诉计算机一个物体应该如何变形。为了解决这个问题,一组研究人员开发了一个名为 DeformSmith 的新系统。这个框架不仅是在猜测物体应该长什么样,它还通过分层构建物体,在每一步都测试其物理行为,并在过程结束前使用模拟机器人尝试操纵该物体。
这种新方法的核心是一个循序渐进的构建过程,模仿了人类工程师构建原型的方式,只不过是由计算机在进行繁重的计算工作。系统首先从简单的描述或单张照片开始,首先构建物体的3D形状。一旦形状存在,系统就会赋予它一个物理身份,决定它的重量以及它如何与地面交互。然后,它会添加材料属性,确定物体是像海绵一样柔软,还是像橡胶球一样坚实。至关重要的是,系统并不仅仅设定这些数值然后听天由命。它会运行一系列物理测试,比如丢下物体或按压物体,以观察其表现是否正确。如果物体坍塌得太容易,或者弹跳方式不对,系统会自动调整其内部设置并重试。
这种方法的独特之处在于它如何将机器人引入循环。在物体通过基础物理测试后,一个模拟机械臂会尝试拿起、搬运并放下它。这正是系统学习最多的地方。机器人尝试抓取物体,系统则密切观察,看物体是否保持形状、是否滑动,或者是否发生了使其无法移动的变形。如果机器人失败了,系统会将这种失败作为线索。它可能会意识到物体太滑了,或者抓握太弱,或者材料对于这项任务来说太软了。系统随后会回到过去,优化物体的属性或改变机器人的动作,不断重复这个循环,直到机器人能够成功完成任务。这创造了一个反馈循环,物体根据其在现实场景中的表现不断得到改进。
研究人员通过使用文本描述和单张图像,创建了从橄榄球到毛绒海豹等数十种不同的物体来测试该系统。他们将结果与尝试实现相同目标的其他先进方法进行了比较。在这些对比中,DeformSmith 创建的物体明显更加逼真。在掉落时,它们能保持形状并以自然的方式弹跳或挤压,而其他系统的物体通常会变成像煎饼一样的扁平状或散架。在人们判断哪个物体看起来和表现得更好的盲测中,新系统赢得了大多数。它在创建能够被机器人成功操纵的物体方面特别成功,当使用机器人引导的优化时,机器人拿起并移动物体的成功率从不到一半提升到了三分之二以上。
该系统通过将问题分解为易于管理的阶段来运作,确保在担心重量之前形状是正确的,在担心材料之前重量是正确的。这防止了计算机因试图同时修复所有问题而产生混乱。一个核心“支架”(harness)充当监督者,记录所有的规则,并确保在一个阶段所做的更改不会破坏前一阶段的工作。例如,如果系统决定让物体变软,它会检查这一变化是否会导致物体变得过重或导致其陷入地板。这种细致的、层级化的方法使得系统能够构建复杂的、可交互的物体,以便用于机器人训练模拟。
虽然该系统功能强大,但研究人员指出,它目前最适用于可以被挤压或拉伸的固体物体,而不是液体或像沙子一样的颗粒状材料。它推断出的物理属性也是基于视觉线索和模拟的估计值,这意味着如果用于实际的物理机器人,仍需要通过现实世界的测量来进行验证。然而,通过简单的输入来生成各种具有物理可信度的物体的能力,为机器人技术开启了一扇新的大门。工程师不再需要手动建模机器人可能遇到的每一种物体,现在他们只需描述一个物体或展示一张照片,系统就会构建一个准备好进行测试、操纵和学习的数字孪生体。这种能力预示着这样一个未来:机器人可以通过练习一个由自动生成的、具有物理准确性的数字资产组成的庞大库,从而更快地学习如何处理日常生活中那些杂乱且易变形的物体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。