← 最新论文
🤖 AI

Missing Bridges: Composition-Aware Active Imitation Learning

本文介绍了 AALT,一种具备组合感知能力的主动模仿学习框架,该框架通过策略性地请求“桥接”演示以最大化多任务领域的任务连通性,从而最大限度地减少专家工作量,在 72 个机器人任务上实现了 100% 的成功率,且所需的演示和转换次数显著低于现有基准方法。

原作者: Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人正变得越来越能够执行复杂的任务,从组装汽车零件到整理货架。然而,教机器人学习新技能通常需要人类专家演示整个动作序列,这个过程缓慢、耗费人力且难以规模化。如果一个机器人需要学习如何从杂乱的桌子上拿起一个红色的杯子,人类可能必须向它展示完成该特定任务的具体方式。如果桌子的布局稍有变化,或者机器人需要拿起一个蓝色的杯子,人类往往需要重新开始演示过程。这造成了一个瓶颈:机器人需要学习的任务越多,专家就需要花更多时间来教导它。研究人员现在正在探索一种更聪明的教机器人的方法,即让机器人自己决定下一步需要学习什么。与其被动地接受指令,一个主动学习者会请求进行特定的演示,从而以最小的努力解决最多的问题。

普渡大学的一个研究小组开发了一种名为 AALT 的新方法,全称是“通过潜在拓扑结构的自适应智能体”(Adaptive Agents via Latent Topologies),用以解决这一问题。他们的工作聚焦于机器人领域的一个特定挑战:如何在只有少量初始示例的情况下,教机器人处理大量不同的场景。想象一下,一个机械臂的任务是从架子上按特定顺序取回三个特定颜色的罐子。架子的排列方式可能有许多种,罐子的顺序也可能随着每一次新的工作指令而改变。虽然可能存在数十种起始位置和目标的组合,但研究人员发现,机器人并不需要针对每一种情况都进行独特的演示。相反,许多这些任务都拥有共同的中间步骤。例如,一个清除左侧路径的动作,无论是在取回红色、蓝色还是绿色罐子时,都可能非常有用,这取决于该动作之前或之后的步骤。

研究人员构建了一个将这些共享动作视为“构建模块”的系统。他们首先教机器人一小组演示,系统会将这些演示组织成一张“枢纽”(hub)状态图。这些枢纽就像城市中的主要交通枢纽,不同的路径在此汇聚或分叉。例如,一个枢纽可能代表一个架子已被部分清空的某种状态,而在这种状态下,可以触及多种不同的物品。随后,系统会寻找这些枢纽之间缺失的连接,即“桥梁”(bridges)。如果机器人知道如何到达清空的架子,也知道如何从清空的架子上取物,但它不知道最初该如何清空架子,那么系统就会识别出这个缺失的环节是下一步最有价值的学习内容。它会请求人类专家仅演示这个特定的“桥梁”,而不是要求进行一个完整的、从头到尾的完整任务演示。

这种方法与旧方法形成了对比,旧方法是根据演示对机器人理解专家行为的整体提升程度来请求演示。那些旧方法通常请求冗长的、完整的演示,虽然解决了某个特定问题,但即便机器人只需学习一个简短的连接动作就能解决许多其他问题,它们也会要求完整的演示。新方法 AALT 则专门寻找那些能解锁最多新可能性的短演示。在利用 UR5e 机械臂进行的模拟环境中,研究人员通过一个涉及 72 种不同“起始点与目标”组合的任务测试了这一想法。机器人最初拥有包含 24 次演示的数据集,仅覆盖了部分任务。使用这种新方法,机器人仅请求了三次额外的演示,总共只有五个短动作。这三次请求足以连接现有的知识块,使机器人能够成功解决全部 72 个任务。

相比之下,在同一模拟中测试的最强现有方法需要 20 次演示,总计近 100 次动作,才能达到约 89% 的成功率。旧方法之所以经常失败,是因为它们请求的演示过于冗长或过于具体,导致机器人在组合行为方面留下了空白。新方法之所以成功,是因为它关注问题的结构,识别出那些能够让机器人自行组合方案的精确缺失环节。研究人员发现,机器人请求的那三个“桥梁”在许多不同的最终解决方案中都被重复使用了,这证明了一次短小的演示就能赋能广泛的未来任务。这表明,通过提出正确的问题,机器人可以比以往认为的更高效地学习如何应对复杂的世界。

这项研究完全是在模拟环境中进行的,这意味着结果是在计算机模型上的机器人和货架上观察到的,而非物理硬件。虽然模拟过程非常严谨,且结果在多次试验中保持一致,但研究人员也承认,现实世界的条件(如物理摩擦或意外障碍物)可能会带来新的挑战。他们还指出,该方法在任务具有有意义的中间步骤时效果最好;如果一组任务之间没有共同点,这种方法可能不会如此有效。尽管如此,这些发现为提高机器人学习效率提供了一条清晰的路径。通过将重点从记忆整个任务转向理解如何连接行为,这项工作表明,机器人可以通过显著减少的训练数据变得更加适应环境,将几次简单的演示转化为庞大的能力库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →