ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control
ViBe 是一个参数高效的后训练框架,通过利用低秩适配器植入任务相关的视觉反馈,使运动追踪器能够适配感知型人形机器人全身控制,从而实现跨多种运动与操作任务的鲁棒零样本仿真到现实迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
让机器人像人类一样行走和移动一直是工程学领域的一个长期目标,但教导它们在现实世界中实现这一目标是一个由两个截然不同的部分组成的难题。首先是模仿人类运动的能力,研究人员通过训练机器去复制海量的人类运动数据,已经掌握了这项技能。这些“追踪器”非常擅长遵循剧本,在平坦、可预测的地面上以自然、流畅的方式移动肢体。然而,它们在设计上被刻意设定为对周围环境“盲目”;它们看不见路缘、球或箱子。第二种能力是感知世界并对其做出反应的能力。传统上,工程师通过构建一个作为“规划器”的独立系统来解决这个问题:该系统观察环境,决定机器人应该做什么,然后告诉“盲目”的追踪器去执行该计划。这种分离虽然有效,但也造成了一个差距。追踪器无法进行微小的、即时的调整,比如为了避开一块石头而挪动脚步,或者躲避一个飞来的物体,因为它正在等待上层指令。它缺乏那种让位于人类能够在不经思考的情况下跌倒并恢复平衡的视觉反射能力。
南加州大学的一个研究团队开发了一种新方法来弥补这一差距,允许机器人在移动的同时直接观察并做出反应。他们将这种系统称为 ViBe,这是一种通过赋予已经学会像人类一样行走的机器人根据所见进行动作调整的能力,而无需从头开始重新学习如何走路的方法。他们并没有构建一个新的大脑或一个新的规划器,而是在机器人的眼睛和肌肉之间插入了一个小型且高效的接口。这个接口学会了提取对任务至关重要的特定视觉细节——例如路缘的边缘或球的位置——并将这些信息直接输入到机器人的运动系统中。其结果是,这种机器能够执行现实世界中的复杂动态任务,例如在不平整的地面上进行跑酷、躲避投掷过来的球,或是在手中重新调整立方体的方向,同时仍保留着最初教授给它的自然、类人化的运动方式。
研究人员首先使用了一个已经完美学会平地追踪人类动作的机器人。这个机器人是“盲目”的,因为它并不使用摄像头图像来引导步伐;它只是简单地遵循预设的动作序列。为了赋予它视觉,团队连接了一个预训练的视觉系统,该系统已经通过数百万张图像学习了如何识别物体和场景。然而,仅仅向机器人展示摄像画面是不够的;机器人需要知道图像中哪些部分是重要的。一墙的像素包含的信息过多,且其中大部分对于行走或躲避任务来说是无关紧要的。团队设计了一个名为“提取器”的小型模块,它充当了一个过滤器。它观察机器人的当前身体位置以及它正在尝试执行的任务,然后利用这些上下文来扫描摄像图像,并仅选择最有用的视觉线索。如果机器人试图跳过路缘,提取器就会聚焦于路缘的边缘;如果它试图接住一个球,它就会聚焦于球的轨迹。
这些选定的视觉信息通过一种仅改变机器人极小部分内部设置的技术,被注入到机器人的运动系统中。研究人员保持了原始运动追踪器的“冻结”状态,以保留其自然的类人步态,仅调整了携带新视觉数据的微小路径。这种方法使他们能够通过一种称为“强化学习”的方法来针对特定任务训练机器人,在这种方法中,机器人通过试错来学习,并因成功的动作而获得奖励。他们在四个截然不同的挑战中测试了这个系统。在其中一个挑战中,机器人必须在路缘和不平整的地形上行走或奔跑,实时调整落脚点以避免绊倒。在另一个任务中,它必须进行跑酷,跨越间隙并在狭窄的表面上着陆。第三个任务涉及移动大型物体,机器人必须在搬运行李箱或垃圾桶时调整平衡和抓握。最后一个挑战是躲避球,机器人需要站在原地,观察球向自己飞来,并移动身体以避开球而不摔倒。
结果表明,这种方法效果显著。在现实世界中测试时,机器人表现出了极高的成功率,其表现往往能媲美那些拥有关于环境的“完美特权信息”(而真实机器人无法拥有)的系统。例如,在跑酷任务中,机器人成功通过了障碍物,而同一型号的“盲目版”机器人则会在那里发生碰撞并摔倒。在躲避球的情景中,机器人学会了在躲避球的同时保持平衡,这一成就需要它以一种受控且具有反应性的方式偏离其标准的站立姿势。研究人员还发现,该系统具有很强的鲁棒性;即使在光照从明亮的阳光变为昏暗的室内条件,或者物体颜色发生变化时,它依然运行良好。这表明机器人学会了理解事物的形状和位置,而不仅仅是记忆特定的颜色或纹理。
为了证明机器人确实是在对所见内容做出反应,研究人员将其系统与一个无法看见的系统进行了对比。那个“盲目”的机器人,即便拥有相同的底层运动训练,也无法穿越路缘或避开障碍物,经常会偏离路线或撞到物体。而带有视觉的版本则能对其运动进行精确的局部修正。它调整落脚点以落在路缘上,调整重心以搬运重物,并移动身体以避开球。这些并非大幅度的、预先计划好的动作,而是机器人在移动过程中发生的微小、即时的调整。团队还展示了这种视觉适应可以与简单的、高层级的规划器相结合。在一个机器人需要重新定向一个立方体使其特定颜色的面朝上的任务中,一个非常基础的规划器只需选择一系列动作。随后,机器人的视觉系统便处理了寻找立方体、抓取以及调整抓握力度以确保动作成功的困难工作,即使立方体所处的位置与预期略有偏差。
这项研究凸显了教导机器人与世界交互的一种重要转变。与其为每一个新任务从头开始训练机器人,或者依赖复杂的、独立的规划系统,不如采取一种方法:利用一个已经懂得如何移动的机器人,并赋予它观察和反应的能力。研究人员表明,通过保持核心运动技能完整,并仅训练视觉与动作之间的微小连接,我们可以创造出既具有自然运动感又能处理现实世界不可预测性的机器人。虽然该系统并不完美,有时会被快速移动的物体或异常的视觉干扰所迷惑,但它代表了一个强有力的进步。它证明了机器人不需要从头开始学习一切;它可以通过仅仅学习“该看什么”,来学习如何将现有的技能适应新情况。这种方法为创造能够以人类般的流畅度和适应性在我们的世界中穿行的类人机器人提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。