HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction
HiPHI 是一个大规模、高精度的基准数据集,包含超过 600 小时的全身人体运动与物体交互数据,旨在通过结合亚毫米级精度与理论指导的多样性,克服现有具身数据集的局限性,从而实现类人机器人策略的可扩展训练与评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
要教机器人像人类一样移动,工程师们必须首先解决一个悖论。他们既需要足够广泛的数据,以涵盖人类可能进行的各种行为,又需要足够精确的数据,以捕捉脚部着地或手部抓握把手的精确物理细节。多年来,该领域一直困于两个不完美的选项之间。一方面是互联网上数百万小时的视频。这些视频展示了极其广泛的人类行为,但它们仅仅是图像;它们缺乏隐藏的物理细节,例如提升物体时的确切重量或迈步时的精确力量。另一方面是利用特殊摄像机记录的实验室录像,这些设备可以追踪身体的每一个关节。这些数据极其准确,但通常只涵盖极窄的行为范围,往往缺失了在现实世界中与真实物体发生的那些混乱且复杂的交互。如果没有连接这两个世界的桥梁,机器人就很难学习如何在物理环境中安全且有效地移动。
一组研究人员利用一个名为 HiPHI 的新数据集搭建了这座桥梁。他们创建了一个庞大的运动库,捕捉了来自 132 个不同人的 600 多小时高保真动作。与以往依赖撰写者手动发明动作列表进行拍摄的尝试不同,该团队使用了一套基于语言组织事件方式的结构化系统。他们从一个将人类动作分解为特定、有意义单元的语言框架入手,然后通过改变速度、方向和所使用的物体等因素,系统地扩展每个单元。其结果是,该数据集不仅包含了人体的运动,还包含了与真实物体(从家具到运动器材)同步的运动。通过以亚毫米级的精度同时记录身体和物体,研究人员确保了数据反映了世界的真实物理约束,例如摩擦力、重量和平衡。
收集过程的设计初衷是详尽而非偶然。该团队并没有让演员表演随机剧本,而是将数据集的创建视为构建一张地图。他们从一组核心动作概念(如“行走”或“搬运”)开始,然后为每个概念生成了数百种变化。例如,“行走”这一单一概念被以不同的速度、不同的方向、不同的步长进行拍摄,并且在携带不同重量的负重时进行拍摄。这种方法使他们能够以逻辑化的方式覆盖人类所有可能的运动空间,确保没有主要的运动类型被遗漏。最终的数据集包含超过 2 亿帧的运动,其中包括近 250 小时与 40 种不同现实世界物体进行交互的序列。每一段剪辑都带有描述动作及其背景的具体标签,使研究人员能够轻松找到他们需要教给机器人的特定类型的运动。
该数据的质量经过了严格测试,以确保其确实可用于训练机器人。研究人员检查了困扰其他数据集的常见错误,例如脚部陷入地板或身体在没有支撑的情况下悬浮在半空中。他们的测量结果显示,HiPHI 比现有的规模化运动库更加洁净且在物理上更具一致性。当他们使用这些数据在计算机模拟中训练人形机器人时,机器人学习行走、坐下和搬运物体的速度和可靠性远高于使用其他数据集时。机器人能够保持平衡并执行复杂任务,例如推一个重箱子或翻转一个行李箱,其稳定性达到了此前难以实现的水平。这些模拟表明,该数据捕捉到了机器理解如何根据周围环境移动自身身体所需的微妙物理线索。
当团队将训练好的机器人从模拟环境带到真实的实验室地面时,该项目的成功得到了进一步证实。尽管面临着现实世界传感器和机械极限的挑战,机器人仍成功完成了从 HiPHI 数据中学习到的多样化行为。它奔跑、坐下、爬行、搬运箱子并拉动行李箱,证明了高精度记录可以转化为实际的物理动作。这证明了该数据集不仅仅是在描述运动,它还为教导机器如何与物理世界互动提供了可靠的基础。虽然目前的数据集侧重于单人运动,尚未包括多人之间的互动或对触觉力的直接测量,但它代表了向前迈出的重要一步。通过提供大规模、具有物理基础的人类运动记录,HiPHI 为开发能够以人类所设计的优雅感和适应性进行移动的机器人树立了新标准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。