← 最新论文
💻 computer science

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

本文介绍了工业灵巧性基准(Industrial Dexterity Benchmark, IDB)以及一种基于多模态扩散模仿学习的框架(AG-iDP3),该框架在复杂的工业线缆操控任务中实现了 78% 的成功率,在仅需极少量演示数据的情况下,显著优于经典方法和单摄像头基准模型。

原作者: Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人就像极其出色但略显笨拙的厨师的世界。如果厨房空无一人且灯光明亮,它们可以极其精准地切菜;但一旦你要求它们在昏暗、拥挤的储藏室里解开一团乱麻般的意大利面,它们就会僵住。这就是目前“灵巧操作”(dexterous manipulation)的现状——即机器人像人类双手一样处理精细、柔软或紧密堆叠物体的能力。几十年来,科学家们一直试图通过编写复杂的规则手册来教会机器人这样做:“如果你看到红色的线,向左移动;如果你感觉到阻力,停止。”但现实生活是混乱的。电缆会扭曲,灯光会闪烁,连接器会被卡在狭小的空间里。核心问题不仅在于“机器人能否做到这一点”,而在于“机器人能否像人类学习系鞋带那样轻松地学会这项技能,而不需要为每一项新任务准备上千页的说明书?”

这篇题为《工业灵巧性基准》(Industrial Dexterity Benchmark)的论文正是针对这一问题展开研究的。研究人员构建了一种全新的测试机器人方式、一种新的学习“大脑”以及一套新的训练练习。他们不再是逐步编写程序,而是让机器人观察人类完成任务几次,然后尝试模仿那种感觉和动作。他们发现,当机器人被允许以多种方式“感知”世界(例如既用眼睛看,又用手去感受)并通过模仿进行学习时,它在处理复杂任务时比传统的基于规则的方法要出色得多。具体而言,他们展示了机器人通过观察人类仅 100 次后,就能以 78% 的成功率学会清理并重新插入拥挤数据中心中的电缆,而传统方法甚至难以起步。

问题所在:现实世界的“乱麻”

把现代数据中心想象成一个巨大的高科技图书馆,只不过里面的“书”其实是电缆。这些电缆排列得极其紧密,彼此之间几乎只有一英寸的间隙。如果人类需要更换电缆或清理连接器,必须极其小心。稍有不慎,就可能碰掉邻近的电缆,导致整个系统崩溃。多年来,机器人在这种场景下表现糟糕。它们擅长从空桌子上拿起一个盒子,却不擅长从拥挤的抽屉里取出特定的袜子而不弄乱其他袜子。

解决这一问题的旧方法是为机器人构建一本“规则手册”。工程师会告诉机器人:“首先,寻找标记;然后,计算角度;接着,将手臂精确移动 5 毫米。”这种方法在完美的实验室环境中有效,但只要光照发生变化或电缆轻微移动,机器人就会陷入困惑并失败。这就像是试图在只有正午阳光直射时才有效的地图上导航城市。

新方法:通过观察进行教学

论文作者决定尝试一种不同的方法。他们没有编写规则手册,而是构建了一个让机器人通过模仿进行学习的系统,就像孩子通过观察父母来学习骑自行车一样。他们引入了三种主要工具来实现这一目标:

  1. “训练馆”(IDB 板): 他们制作了三个不同的物理板作为训练障碍物。一个模拟数据中心拥挤的电缆,另一个模仿汽车内部杂乱的布线,第三个是一个微型齿轮组装体。这些板就是机器人进行练习的“训练馆”。论文主要关注数据中心板,机器人必须在此处拔出电缆,用清洁垫擦拭,然后将其插回,同时不能撞倒其他任何东西。
  2. “学习框架”(DAG-ROS): 这是连接机器人眼睛、双手和大脑的软件。它允许人类接管机器人(遥操作)并执行任务,同时系统会记录人类的每一次动作、每一个摄像视角以及机器人感受到的每一分压力。这就像是一个视频游戏的回放系统,保存了人类完美表现的每一帧,以便机器人稍后进行研究。
  3. “智能大脑”(AG-iDP3): 这是全场的明星。这是一种被称为“扩散策略”(diffusion policy)的人工智能。想象一下,机器人最初对要做什么有一个模糊、随机的猜测,然后通过一步步“去噪”,不断优化这个猜测,直到它变成一个清晰、平滑的动作。这个大脑不仅仅是“看”图像,它还融合了多种感官。它利用安装在腕部的摄像头、广角摄像头和深度传感器(实现 3D 感知)来观察场景,同时感受腕部的压力。它结合所有这些信息来决定如何移动。

实验:六台机器人的竞赛

为了验证这个新的“智能大脑”是否真的有效,研究人员组织了一场竞赛。他们在数据中心电缆任务上测试了六种不同版本的机器人“视觉系统”。有些机器人只有一个摄像头,有些有两个,有些带有深度传感器,有些则是多种传感器的组合。他们为每种设置都进行了 48 次试验。

结果非常明确。依赖单一摄像头的机器人(传统方式)成功率仅为 36%。这就像是蒙住一只眼还要穿针引线。然而,采用“多模态”方法的机器人——结合了腕部摄像头、场景摄像头和 3D 深度数据——成功率达到了 78%。

关键发现是,**3D 上下文(3D context)**至关重要。当机器人能够感知电缆的深度(无论是通过 3D 传感器还是通过两个摄像头从不同角度观察)时,它抓取电缆的成功率几乎接近完美(88–98%)。但真正的魔力发生在“插入”阶段。相比其他模型,多模态机器人能更好地将微小的连接器对准紧凑的端口。有趣的是,使用特定类型 3D 传感器(飞行时间法/Time-of-Flight)的机器人,在这一工业环境下的表现优于标准的立体摄像头,这表明直接感知“深度”比通过两个平面图像进行推测更可靠。

为什么这很重要

论文认为,这种新方法是工业自动化的游戏规则改变者。旧方法需要工程师花费数千小时来标注图像并为每一个新任务调整参数。而有了这个新系统,机器人只需要大约 100 次演示(即观察人类完成任务约 100 次)就能很好地学会这项工作。

研究人员还指出,该系统目前尚未完美。机器人有时表现出“脆弱性”,即如果背景中出现了训练期间未见过的随机物体,它可能会产生困惑。然而,他们展示了通过裁剪摄像机视野,使其仅聚焦于任务区域,就可以解决这个问题。

总结

这篇论文表明,工业机器人的未来不在于编写更好的规则手册,而在于教会它们像人类一样去“感受”和“观察”世界。通过结合多种感官并使用模仿人类的学习方法,机器人可以处理那些长期以来将它们拒之于工厂之外的混乱、拥挤且精细的任务。虽然论文并未声称已经解决了机器人领域的所有问题,但它提供了一个强大且可重复的方案,使机器人具备足够的灵巧性来应对现实世界的挑战,将那个“笨拙的厨师”转变为一个只需稍加练习就能成为胜任的学徒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →