← 最新论文
💻 computer science

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

GuidedAttention 是一个可解释的模仿学习框架,它通过允许用户在展开初始化阶段检查并修正与任务相关的视觉注意力关键点,进而将这些关键点自动传播至整个执行过程以引导基于扩散的动作策略,从而增强了机器人操控中的分布外鲁棒性。

原作者: Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教一个机器人完成一项任务,比如拿起一个杯子或折叠一条毛巾。在过去,工程师必须编写数千行代码,精确地告诉机器人如何移动它的手臂、看向哪里以及抓取什么。这就像是给一个孩子一份僵化的剧本;如果剧本与现实世界不完全匹配,孩子就会愣在那里。今天,我们使用一种更聪明的方法,叫做“模仿学习”(Imitation Learning)。我们不再编写规则,而是向机器人展示一段人类执行该任务的视频,机器人通过观察来尝试学习其中的模式。这就像一个孩子通过模仿哥哥姐姐来学习骑自行车。

然而,这里有一个问题。当机器人以这种方式学习时,它构建了一个“黑盒”大脑。它通过摄像头观察世界,但我们完全不知道它到底在看什么。如果机器人失败了,我们很难说:“嘿,你刚才看错地方了!”因为机器人的注意力隐藏在复杂的数学运算之中。当情况发生变化时,这就会变成一个大问题。如果你把杯子移到一个新位置,或者在桌子上放一个色彩鲜艳的图案,机器人可能会感到困惑并失败,因为它是在特定的设置下接受的训练。这就像一个学生背下了考试答案,但当老师改变题目顺序时就陷入了恐慌。我们需要一种方法来窥视机器人的内心,并告诉它:“不,看杯子,不要看背景!”

这就是名为 GuidedAttention 的新框架发挥作用的地方。把它想象成给了机器人一副“神奇眼镜”,这副眼镜能让我们准确看到它在关注哪里。这项工作的研究者 Murooka Masaki 及其团队创造了一个系统,它不仅仅是猜测该做什么,它首先会指出图像中的重要部分,就像学生在课本中高亮显示关键词一样。如果机器人标错了地方,人类可以介入,点击正确的位置并说:“看这里!”机器人随后会将这个修正后的位置作为余下任务的引导,并在移动过程中自动追踪它。

论文通过两种方式测试了这个想法:一种是在计算机模拟中,另一种是在使用真实机器人手臂的现实世界中。他们发现,当机器人在熟悉的设置中时,它自己表现得相当不错。但当情况变得奇怪时——比如将目标移动到新位置或在桌子上添加干扰性的彩色方块——机器人通常会迷失方向。这时,“神奇眼镜”就展现了它的光芒。当人类在任务开始时给予一个微小的引导来纠正机器人的焦点时,机器人的成功率大幅提升。在一些棘手的现实测试中,在开始阶段修正注意力帮助机器人的成功率比它独自应对时提高了约 80%。事实证明,给机器人一个关于“看哪里”的简单且可纠正的提示,是让它在混乱多变的世界中保持鲁棒性的秘诀。

问题所在:机器人的“黑盒”大脑

想象一下你正在教一个机器人系鞋带。你展示一段视频,机器人学习模仿你的动作。但问题在于:机器人看鞋子的方式与你不同。它看到的是一堆像素。在现代机器人学习中,我们使用一种叫做**端到端策略(End-to-End policies)**的技术。这意味着机器人将图像作为输入,直接输出动作,跳过了人类解释过程的所有中间步骤。

问题在于这个过程是一个“黑盒”。我们不知道机器人正在关注什么。如果机器人没能系好鞋带,我们无法轻易判断它是盯着鞋带看,还是盯着地板或影子看。这就像试图在看不见引擎盖内部的情况下修理汽车发动机。更糟糕的是,如果你把鞋子移到桌子的另一个位置(这种情况被称为分布外/OOD,Out-of-Distribution),机器人可能会完全陷入混乱,因为它训练时的鞋子是在特定位置的。这就像一个学生记住了数学题的答案是“5”,但当数字改变时就失败了,因为他并没有理解“概念”,只是记住了特定的例子。

解决方案:GuidedAttention(“神奇眼镜”)

作者提出了一种名为 GuidedAttention 的解决方案。与其让机器人猜测该看哪里,不如强制它预测一组关键点(keypoints)——即标记图像重要部分的微小点。把这些关键点想象成一张藏宝图。机器人必须在它需要抓取的地方(如绳头)画一个“X”,并在目标处(如它需要穿过的孔洞)画另一个“X”。

酷的地方在于:这些“X”对我们是可见的。它们是一种可解释的中间表示(interpretable intermediate representation)。这意味着我们可以清楚地看到机器人认为什么是重要的。如果机器人把“X”画在了错误的位置,人类可以介入并将“X”移到正确的地方。这就是**可纠正性(correctable)**的部分。

一旦人类在任务开始时修正了“X”,机器人就不再需要帮助了。它使用一个追踪模块(tracking module)(类似于一个智能摄像头,可以跟随移动物体)来确保在机器人移动时,这些“X”始终锁定在正确的地点。这就像给机器人贴了一张便签纸,上面写着“看这里!”,然后让一个朋友用激光笔跟着这张便签进行接下来的游戏。

它是如何工作的:机器人的新大脑

该系统使用一种叫做**扩散策略(Diffusion Policy)**的 AI 类型。你可以把它理解为一种通过“去噪(denoising)”来学习的机器人。想象一张被静态噪声覆盖的照片,机器人的任务就是慢慢去除噪声,从而显现出正确的动作。通常,机器人尝试根据整个模糊的画面来猜测动作。

在这个新系统中,机器人首先预测关键点(即那些“X”)。然后,它利用这些“X”来引导去噪过程。这就像是在告诉机器人:“忽略杂乱的背景;只关注这两个点周围的区域。”

论文引入了一个巧妙的技巧,叫做关键点覆盖机制(Keypoint Override Mechanism):

  1. 训练: 机器人通过观察人类执行任务来学习预测这些点。人类仅在视频的第一帧中标记这些点,然后由程序在整个视频过程中进行追踪。
  2. 执行(实际任务): 当机器人尝试独立执行任务时,它会预测这些点。如果机器人做得很好,那就太棒了!但如果机器人感到困惑(例如因为桌面看起来不一样),人类可以在开始时点击一次来修正这些点。
  3. 魔法之处: 系统包含一个特殊的数学技巧,确保“修正后”的点仍然符合机器人的大脑逻辑。它不仅仅是替换了点,而是替换了点的“含义”,使得机器人能完美理解这一修正。

结果:它真的有效吗?

团队在两个地方测试了它:计算机模拟(虚拟世界)和使用物理机器人手臂(Universal Robots UR5e)的现实世界。

在模拟中:
他们测试了三个棘手的任务:

  • 线缆(Cable): 将柔性线缆引导通过狭窄的缝隙。
  • 圆环(Ring): 将圆环套在杆子上。
  • 颗粒(Particle): 将细小颗粒舀入盒子中。

他们通过将目标移动到新位置(位置 OOD)或用彩色图案改变桌面纹理(外观 OOD)使任务变得更难。

  • 没有帮助时: 标准机器人(基准模型)在情况变化时失败率很高。例如,在“外观 OOD”测试(彩色图案)中,标准机器人的成功率仅为 28.9%。
  • 使用 GuidedAttention(自主模式): 机器人表现更好,成功率约为 45.6%。
  • 使用 GuidedAttention(人工修正): 当人类在开始时修正点位时,成功率跃升至 67.8%。这是一个巨大的进步!

在现实世界中:
他们使用真实的机器人完成了诸如将杯子放入另一个杯子、捡起链条和折叠毛巾等任务。

  • 位置 OOD(移动目标): 标准机器人表现挣扎,DP 基准模型的成功率仅为 35.6%。GuidedAttention 即使在没有帮助的情况下也表现更好。但在经过人类在开始阶段的一次修正后,成功率飙升至 71.1%。
  • 外观 OOD(杂乱的桌面): 这是最难的测试。标准机器人在毛巾任务中表现极差,成功率为 0%。没有帮助的 GuidedAttention 也表现挣扎,成功率仅为 13.3%。但在人工修正后,机器人的成功率达到了 90%!

为什么这很重要

这篇论文表明,我们不需要构建一个无所不知的机器人。相反,我们可以构建一个知道“如何观察”的机器人,并在它感到困惑时给予一点帮助。

作者发现,最大的收益来自于机器人处于新环境或混乱环境时。在熟悉的设置中,机器人本身就已经表现不错。但当世界发生变化时,人类能够说“不,看杯子,不要看背景”的能力拯救了局面。

论文还排除了其他一些想法。他们尝试过仅仅在屏幕上放置一个框或一个点来告诉机器人看哪里(称为“标记叠加提示”),但效果并不理想。机器人需要能够预测这些点,以便学习模式,同时又能在出错时能够被纠正。

局限性

作者坦诚地说明了其系统的局限性:

  • 简单的关键点: 系统假设几个点足以描述整个任务。如果任务极其复杂(比如杂耍十个球),几个点可能不够用。
  • 仅限 2D: 这些点只是在平面图像上的。如果机器人需要知道深度信息,或者点被物体遮挡了,系统可能会产生困惑。
  • 追踪问题: 系统依赖于追踪器来跟随这些点。如果机器人移动过快或物体被长时间遮挡,追踪器可能会丢失目标。

结论

GuidedAttention 就像是给了机器人一副能显示其思考内容的眼镜。它弥合了机器人的“黑盒”大脑与人类引导能力之间的鸿沟。通过允许我们在开始阶段仅进行一次修正,机器人能够比以前更好地处理混乱、多变的各种环境。它虽然不是解决一切问题的魔杖,但它是迈向更智能、更具灵活性且能在遇到困难时听从人类指挥的机器人的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →