想象一个机器人不再仅仅是轮子上的笨重机器或固定在墙上的机械臂,而是能够像我们一样外观和动作协调的伙伴的世界。这就是人形机器人(humanoid robotics)的领域,该领域正致力于制造能够走进我们人类创造的空间——如建筑工地、厨房或办公室——并进行重体力劳动,而无需为每一步都配备说明书的机器。最大的挑战在于?人类是多变、灵活且独特的;而机器人是精确、僵硬且按照特定蓝图制造的。如果你试图直接将人类的动作复制到机器人身上,机器人可能会绊倒、摔倒或折断关节,因为它的腿较短或者髋部弯曲方式不同。为了解决这个问题,科学家们使用了动作重定向(motion retargeting)(一种将“人类动作翻译成机器人动作”的高级说法)和强化学习(reinforcement learning)(一种机器人通过试错来学习的方法,通过“保持直立”获得奖励,通过“摔倒”受到惩罚)。目标是让机器人通过观察我们来学习,从而最终能够帮助我们建造世界,像人类工人那样搬运砖块或爬梯子。
现在,这项新研究就像是一个“大师级翻译官”兼“严厉教练”,作用于一台名为 Unitree G1 的机器人。研究人员想要观察人形机器人是否能观察一名建筑工人执行任务,理解他们在做什么,然后自己在不摔倒的情况下完成该任务。他们构建了一个由两部分组成的系统来实现这一目标。首先,他们创建了一个名为 Humanoid-PoseNet 的“翻译器”。把它想象成一个超级聪明的“相机大脑”,它观察一段人类工人的视频。它不仅仅是看到一个人,它还能精确计算出每个关节在三维空间中的位置。但棘手之处在于:人类的身材构造与机器人不同。因此,这个大脑会立即将人类的动作改写成适合机器人特定体型要求的版本,确保机器人不会尝试进行其关节无法实现的扭转。
一旦机器人知道要“移动什么”,它就需要弄清楚如何“移动而不崩溃”。这就是第二部分 Humanoid-ActionNet 发挥作用的地方。这是机器人的内部教练,通过“教师-学生”教学法进行训练。“教师”是一个生活在计算机模拟中的超强版本机器人,它掌握了关于物理世界的全部知识(比如砖块有多重或地面有多滑)。教师学会了保持平衡的最佳移动方式。然后,它教导一个“学生”版本的机器人。学生版是真正要走向现实世界的那个,但它不允许依赖物理学的秘密;它必须仅通过感受自己的关节并观察目标动作来学习,就像真实的机器人一样。这确保了当机器人离开计算机并踏入真实的建筑工地时,不会因为模拟环境与现实之间的差异而感到困惑。
团队通过 30 种不同的建筑任务测试了这个系统,从搬运重型管道和堆叠材料,到挥舞旗帜和在不平整地面行走。他们首先通过动作捕捉工作室记录了五名志愿者执行这些任务的过程。然后,他们让机器人系统从这些记录中学习。结果令人振奋:机器人成功学会了执行其中八项复杂的建筑动作。在计算机模拟中,机器人在各个关节上的平均误差(平均关节位置误差)约为 82.45 毫米。当他们把机器人投入现实世界进行测试时,它成功完成了搬运管道、搬运混凝土块甚至挥舞旗帜的任务,同时保持了平衡,证明了这种“翻译”和“教练”机制是有效的。
然而,论文谨慎地指出这并非完美的解决方案。研究人员指出,虽然机器人可以完成这些任务,但并非无懈可击。在模拟实验中,有些尝试失败了,机器人失去了平衡或踉跄,尤其是当现实世界的物理特性(如摩擦力或重量)与计算机模型不完全匹配时。他们还指出,机器人的手部灵巧度不及人类,因此虽然它可以“拿着”一个块状物,但并不一定能像人类工人那样精细地“抓取”它。这项研究表明,这种方法是让机器人能在建筑工地与我们并肩工作的坚实第一步,但要使它们像人类模仿的对象那样可靠和适应性强,仍有大量工作要做。该系统展示了教会机器人像工人一样运动是可能的,但从“学会走路”到“建造摩天大楼”的旅程才刚刚开始。
技术摘要:用于建筑领域人型机器人任务执行的感知-动作系统
问题陈述
建筑工地是复杂、危险且劳动密集型的环境,随着自动化程度的提高,其对自动化的需求日益增加,以应对安全风险和劳动力短缺。虽然已经部署了一些专用机器人(例如砌砖工、足式巡检机器人),但它们通常是针对单一特定任务的,缺乏在人类设计的空间中与人类工人自然协作的通用性。由于人型机器人具有类人的形态(这使其能够与现有的工具和工作流程相匹配)以及高自由度(DoF)(使其具备多任务适应能力),它们提供了一个极具前景的解决方案。
然而,在建筑领域部署人型机器人面临两个主要的工程技术差距:
- 形态不匹配(Morphological Mismatch): 现有的真人姿态估计方法输出的是以人为中心的数据,由于肢体比例、关节结构和驱动约束的差异,这些数据无法直接应用于人型机器人。
- 物理可行性(Physical Feasibility): 即便将人类动作重定向到人型机器人骨架上,如何将这些运动学参考转化为能够在接触丰富的建筑环境中保持平衡、接触稳定性及动态可行性的物理可执行全身动作,仍然是一个重大挑战。
方法论
作者提出了一种**基于视觉的感知-动作(Vision-based Perception-and-Action, VPA)**系统,旨在使人型机器人能够直接从工人演示中学习建筑任务。该系统由两个深度学习模块组成:Humanoid-PoseNet 和 Humanoid-ActionNet。
1. Humanoid-PoseNet:感知与重定向
该模块旨在弥合视觉工人演示与机器人可执行姿态之间的鸿沟。它包含两个子网络:
- 3D 人体姿态估计: 利用现成的模型(特别选择了表现最优的 PoseNet)从 2D RGB 视频帧中重建 3D 人体关键点。
- 人-机重定向(Human-to-Humanoid Retargeting): 一个具有共享潜空间架构(两个编码器和一个解码器)的深度网络,将估计的人体姿态映射为兼容人型机器人的配置。
- 架构: 使用带有共享潜空间的感知机(MLP)。
- 训练目标: 该网络使用三种损失函数组合进行训练,以确保几何对齐和物理可行性:
- 三元组损失(Triplet Loss, L1): 利用骨骼方向角误差(BAE)在潜空间中将相似的人-机姿态对进行分组。
- 重建损失(Reconstruction Loss, L2): 确保解码器能从机器人编码的输入中准确重建机器人姿态。
- 潜空间一致性损失(Latent-Consistency Loss, L3): 强制要求被解码为人型机器人姿态的人类姿态在重新编码时保持一致,从而促进跨域分布对齐。
2. Humanoid-ActionNet:全身控制
该模块学习控制策略,以在执行重定向姿态的同时保持动态稳定性。它采用了**教师-学生强化学习(Reinforcement Learning, RL)**框架:
- 教师策略(πteacher): 在仿真环境(IsaacGym)中通过**近端策略优化(PPO)**进行训练。它可以使用“特权”观测值(例如精确的关节差异、根部速度)来最大化任务奖励,同时强制执行物理约束。
- 学生策略(πstudent): 从教师策略中蒸馏而来,在没有特权观测值的情况下运行。它仅依赖于本体感受状态(关节位置/速度)和过去状态的短期历史,从而促进鲁棒的仿真-现实迁移(sim-to-real transfer)。
- 奖励设计: 奖励函数是“物理感知”的,整合了以下项:
- 自由度(DoF)和关键点位置追踪。
- 根部线速度和方向。
- 身体旋转和上半身连贯性。
- 足部接触一致性(滑动惩罚)和腾空时间整形。
- 部署: 学生策略输出目标关节角度,并通过比例-微分(PD)控制器在物理机器人上执行。
实验设置
- 数据收集: 五名受试者在运动捕捉环境中完成了 30 种与建筑相关的动作(例如搬运管道、抬起砖块、打手势、爬楼梯)。
- 机器人平台: 使用 Unitree G1 人型机器人(23 个驱动自由度)进行仿真和物理部署。
- 评估协议:
- 重定向精度: 通过在留出的测试集上计算平均每关节位置误差(MPJPE)进行衡量。
- 仿真-仿真迁移(Sim-to-Sim Transfer): 在两种物理引擎(IsaacGym 和 MuJoCo)中进行评估,以测试对动力学建模差异的鲁棒性。
- 仿真-现实迁移(Sim-to-Real Transfer): 在物理 Unitree G1 上部署,执行八种选定的建筑动作。
关键结果
- 姿态重定向: Humanoid-PoseNet 在 14 关节人型机器人表示上实现了 48.46 mm 的平均 MPJPE,成功将多样化的人类姿态转化为可行的机器人配置。
- 任务执行: Humanoid-ActionNet 在仿真环境和物理机器人上均成功执行了八种建筑相关动作(如推独轮车、搬运管道、打手势)。
- 追踪性能: 该系统在八个测试动作中实现了 82.45 mm 的平均运动追踪误差(MPJPE)。
- 对比性能: 在与最先进的全身控制基准(ExBody, OmniH2O, ExBody2)的对比研究中,所提出的 Humanoid-ActionNet 展示了更低的平均 MPJPE,表明其具有更优越的追踪精度,适用于建筑特定动作。
- 失败分析: 研究承认了在仿真-仿真迁移过程中的失败案例(如失去平衡、追踪崩溃),将其归因于对接触丰富动力学的建模难度以及仿真与硬件之间的差距。
重要性与主张
作者将这项工作定位为在建筑领域部署人型协作机器人的初步步骤。论文声称其贡献如下:
- 新颖的流水线: 这是首个使人型机器人能够直接从人类演示中学习并执行建筑任务的方法,解决了建筑领域的特定挑战。
- 弥合差距: VPA 系统有效地弥合了人类与机器人之间的形态差距,以及运动学模仿与物理稳定执行之间的动态差距。
- 实际应用性: 通过展示在物理机器人上执行材料搬运和信号传递等任务的成功仿真-现实迁移,本研究为实现土木工程领域的机器人技术提供了基础性步骤。
- 适应性: 研究表明该系统可以适配不同的机器人形态(在 Unitree G1 和 H1 运动学上进行了测试),表明其具有向其他人型平台扩展的潜力。
作者对当前的局限性保持谦逊,指出目前系统侧重于基于姿态的模仿,尚未对工具/材料交互进行显式建模,且在高度动态、接触丰富的环境中,仍需进一步完善奖励函数和提升仿真真实度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。