← 最新论文
💻 computer science

Data and Learning Where it Matters for Contact-Rich Manipulation

本文提出了一种结合了用于自由空间运动的传统规划与针对关键接触密集型片段的小规模目标数据集进行的自动化离线深度强化学习的混合方法,在具有挑战性的现实世界任务中实现了 96% 的成功率,同时克服了纯端到端学习策略的脆弱性和泛化问题。

原作者: Oliver Hausdörfer, Linus Schwarz, Gabor Marko, Christian Dietz, Timo Class, Luka Hofer, Jim Yun-Jin Li, Johannes Hechtl, Ralf Römer, Angela P. Schoellig

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Oliver Hausdörfer, Linus Schwarz, Gabor Marko, Christian Dietz, Timo Class, Luka Hofer, Jim Yun-Jin Li, Johannes Hechtl, Ralf Römer, Angela P. Schoellig

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人就像蹒跚学步的幼儿,试图学习如何搭建一座复杂的乐高城堡的世界。它们可以轻松地拿起一块积木并走过房间(这是简单的部分),但一旦尝试将两个部件卡在一起时,它们往往会手忙脚乱,掉落零件,或者用力过猛导致零件损坏。这就是“接触密集型操控”(contact-rich manipulation)在机器人技术中的核心:让机器人能够像人类的手一样,精准地触摸、推动并组装物体。多年来,科学家们一直试图通过向机器人喂入海量的视频数据来解决这个问题,希望机器人能像孩子通过试错学习一样,通过观察成千上万个范例来学习。但问题在于:机器人很昂贵,时间就是金钱,而仅仅向这个问题投入更多的数据一直没能奏效。机器人在处理那些棘手的、高精度的瞬间时仍然表现挣扎,并且当场景发生微小变化时就会感到困惑。

这篇论文通过提出一个简单到近乎显而易见的疑问,解决了这个确切的问题:我们为什么要用最笨的方法去教机器人那些简单的部分? 作者建议,与其试图利用一大堆杂乱的数据从头开始学习整个任务,不如将工作拆分。我们应该使用传统的、可靠的数学方法来处理“走动”等简单部分,而只将昂贵的、依赖大量数据的学习用于机器人真正需要将部件推在一起的那一瞬间。通过将学习精力集中在真正关键的地方,他们发现了一种方法,可以在不需要多年练习的情况下,显著提高机器人的可靠性。

“聚焦终点线”策略

研究人员与来自慕尼黑工业大学和西门子的团队合作,发现大多数机器人失败都发生在某一个特定的时刻:“关键阶段”。把它想象成一个电子游戏关卡:你可以在开放世界中自由奔跑,但如果你错过了一个极其微小的跳跃,游戏就会结束。在机器人任务中,“开放世界”是移动机械臂去抓取物体,而“微小的跳跃”则是接触的瞬间——比如将盐盒滑入一个狭窄的架子,或将乐高积木卡在底座上。

论文指出,目前的“端到端”(end-to-end)学习方法(即机器人试图同时学习整个过程)就像是为了学会那一个跳跃动作,而去试图背诵整张游戏地图。这种方式既低效又脆弱。相反,作者提出了一种混合方法:使用标准的、预设好的规划程序来处理简单的移动,仅在棘手的接触部分切换到“学习型”大脑。

他们是如何做到的:

  1. 设置: 他们从单个人类演示任务开始(就像老师向学生演示一次如何完成任务)。
  2. “智能”练习: 他们没有让机器人在每次操作时都由人类引导,而是让机器人重复播放那个演示,直到它到达棘手的环节。然后,机器人开始自主进行“探索”。它尝试结合随机动作和聪明的猜测,以弄清楚究竟该如何推动物体到位。这个过程是自动完成的,不需要人类牵着机器人的手。
  3. 学习: 他们使用了一种称为“离线深度强化学习”(offline Deep Reinforcement Learning)的技术。想象一下,机器人正在观看一个巨大的、由它自己练习尝试组成的图书馆(包括成功和失败的尝试),并在收集完数据之后学习如何移动的最佳方式,而不是在移动过程中边动边学。这种方式更安全也更快。
  4. 切换: 当机器人部署时,它使用标准规划器来抓取物体。一旦感觉到“碰撞”(接触),它就会切换到它新学习到的“专家大脑”来完成工作。它通过检查一个“置信度分数”(称为 Q 函数)来判断任务是否成功完成。

结果:速度、精度与超高可靠性

结果非常有效。在仅有的 2 到 2.5 小时 自主数据采集(即机器人自主练习的时间)中,该系统在四个困难的现实任务中实现了平均 96% 的成功率。这些任务包括:

  • 货架补货: 将一个纸质盐盒放入狭窄拥挤的架子中。
  • 乐高堆叠: 精准地将一块积木放在另一块上面。
  • 风扇罩组装: 将塑料盖扣在底座上,这涉及对可变形部件进行弯曲和按压。

相比之下,现有的最强方法(即“基准方法”)仅能达到 55% 的成功率。旧方法通常能让机器人到达正确的位置,但无法将物体完全推入,或者因为推力过大而损坏物体。

作者还在“分布外”(out-of-distribution)场景中测试了机器人——即机器人从未见过的场景,例如不同的背景物体或略微偏移的位置。虽然端到端学习的机器人会完全陷入混乱并失败,但作者的方法却保持冷静,维持了极高的成功率。这表明,通过专注于接触的具体力学特性,机器人学习到了一种更鲁棒的技能,而不依赖于对整个场景的记忆。

为什么这很重要

论文明确反对“数据越多越好”的观点。他们证明了,如果数据是分散且缺乏针对性的,仅仅扩大数据规模并不能解决问题。相反,他们证明了结构化才是关键。通过将任务中的简单部分视为“已解决”的部分,并仅将重度学习应用于困难部分,他们节省了时间和资源。

他们还发现,该方法对物体的动作更加温柔。因为机器人学习了接触时所需的精确力量,它施加的平均力量比基准方法减少了 49%。这对于像纸质盒子或塑料零件这类容易被压坏的脆弱物品至关重要。

简而言之,这篇论文表明,机器人学习的未来不在于构建一个无所不知的“巨型大脑”,而在于构建一个更聪明的团队:由一个可靠的规划器负责“行走”,而由一个专门的、经过高度训练的专家负责处理棘手的“握手”。这是一种从“学习一切”到“学习重点”的转变,并且看来是让机器人以媲美人类的精度完成现实世界工作的制胜策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →