✨ 要点🔬 技术摘要
想象一下正在教一个机器人做一项新工作。通常情况下,你必须一步步地向它展示具体要做什么。如果你想让机器人开门,你就展示如何开门;如果你想让它推杯子,你就展示如何推杯子。但当你要求机器人去做一件它从未见过的事情时,比如推一个形状奇特的瓶子,会发生什么?旧的方法往往会产生混乱,试图将新物体强行套入旧有的“推”的规则中,或者因为没见过这个完全相同的瓶子而陷入停滞。这就是“泛化鸿沟”:机器人擅长记忆技巧,却不擅长理解新情境下的“逻辑”。
为了解决这个问题,科学家们正在探索一个领域——模仿学习 (Imitation Learning),即机器人通过观察演示来学习;以及元学习 (Meta-Learning),这就像是教学生“如何学习”,而不仅仅是给他们一堆事实清单。把元学习想象成在教机器人“抓取”或“推动”的概念,这样它就能将这个概念应用到香蕉、锤子或神秘物体上,而不是仅仅死记硬背某个特定锤子的形状。核心问题在于:我们能否构建一个机器人,让它仅通过极少数的示例就能理解任务背后的“物理特性”和“意图”,从而使其能够瞬间适应现实世界,而不需要庞大的训练视频库?
本文介绍了一个名为 DAMI (动力学感知元模仿,Dynamics-Aware Meta-Imitation)的新框架来回答这个问题。研究人员提出,机器人不应仅仅记忆自己在执行任务时的“外观”,而是需要理解动作背后的“故事”——即因果关系或“动力学”。他们构建了一个系统,其作用就像一个超级聪明的学徒。当面对新任务时,DAMI 不仅仅是复制动作,它还会分析动作的“逻辑”(例如:“我需要把这个物体推开”),并结合语言指令和一个参考视频进行处理。
其核心方法包含三个巧妙的技巧。首先,他们使用了一个名为 VMT (视觉-运动轨迹,Visual-Motor Trajectory)的模块,它像是一个翻译官,在观看机器人运动视频的同时,同步倾听机器人的电机指令。这有助于人工智能理解机器人“为什么”那样移动,而不只是“去了哪里”。其次,他们使用了一个 U2T 模块,将机器人的当前视角、文本指令(如“开门”)以及那个参考视频融合在一起,即使视频内容与当前视角并不完全匹配。最后,他们使用了一种名为 TCFM 的机制来微调机器人的“底层”特征,确保机器人能专注于当前任务所需的物理细节。
在计算机模拟和真实机器人手臂上的测试结果显示,DAMI 的表现相当出色。在包含 45 种不同任务的模拟实验中,DAMI 在处理已知任务时的成功率约为 79% ,而在仅看几个示例后处理全新任务的成功率达到了 56.8% 。这显著优于以往的方法,后者在适应新物体或新情境时往往表现挣扎。在真实机器人的物理测试中,DAMI 将成功率从旧方法的约 56% 提升到了 83% 。作者指出,虽然该系统学习新任务的速度更快,但仍需要少量的微调时间(对于现实世界的任务约为 74.73 秒 ),并且在有清晰参考视频的情况下表现最佳。他们认为,这种方法有助于机器人超越简单的记忆,开始理解如何操作周围世界的“故事”。
技术摘要:面向未知机器人操控任务的动力学感知元模仿学习
问题陈述 模仿学习(Imitation Learning, IL)使机器人能够从演示中获取复杂的操控技能,但在数据稀缺性和对分布外(未知)任务的泛化方面面临重大挑战。现有方法往往过度拟合特定领域内的任务,或依赖密集的演示数据,导致在遇到新颖任务或分布偏移时表现不佳。虽然最近的方法(如上下文模仿学习 ICIL 和 3D 扩散策略)展现了潜力,但它们在从稀疏数据中推断任务动力学方面仍存在困难,或者过度依赖视觉相似性而非语义动作理解。此外,直接在少样本数据上微调高容量 3D 扩散策略往往会导致对支持轨迹的过拟合,而非学习可迁移的任务逻辑。
方法论:DAMI 框架 作者提出了**动力学感知元模仿(Dynamics-Aware Meta-Imitation, DAMI)**框架,旨在通过将元学习与表达能力强的 3D 扩散策略相结合来弥合泛化差距。DAMI 根据三个输入对策略进行调节:当前观测(3D 点云和机器人状态)、语言指令以及完整的参考演示。其核心架构由以下组件组成:
元学习目标: DAMI 采用模型无关元学习(MAML)来学习共享的策略初始化。该初始化经过优化,旨在仅通过少量演示(少样本微调)即可快速适应新任务,而不是从头开始学习每个任务。
视觉-运动轨迹(VMT)模块: 为了捕捉内在的任务动力学而非静态视觉线索,VMT 联合编码来自参考演示的视觉特征和运动动作序列。它使用带有位置嵌入的 Transformer 编码器来建模时空依赖关系,从而创建一个以运动为中心的上下文,用以表示“在何种动作下会发生何种变化”。
非配对统一任务(U2T)模块: 该模块解决了融合非时间对齐的非结构化多模态输入(文本指令、参考演示和当前观测)的挑战。U2T 利用基于 Transformer 的融合机制,将演示和文本 Token 与扩散 U-Net 第一个下采样块中的观测-时间步条件进行对齐。
任务调节特征调制(TCFM): 为了有效地将融合后的多模态条件注入策略,TCFM 对 U-Net 的低层 3D 特征应用特征线性调制(FiLM)。这使得网络能够根据源自演示和文本的具体任务上下文,对早期的几何定位层进行调制。
训练过程包括一个内循环,用于将策略适配到特定任务的支持集,以及一个外循环,根据跨批次任务的查询集性能来更新共享的初始化。
核心贡献
DAMI 框架: 一种新型元模仿框架,通过构建共享技能空间来实现快速的少样本适配和跨任务泛化。
VMT 模块: 一种在紧凑的潜在空间中捕捉复杂时空动力学的机制,使策略能够建模任务逻辑而非记忆静态外观。
U2T 和 TCFM: 一个统一的任务编码器和特征调制机制,旨在有效融合非结构化多模态观测并调制低层 3D 特征。
全面评估: 通过广泛的实验证明,该方法在直接推理已知任务和适配未知任务方面均优于现有的先进基准方法。
实验结果 作者在 Meta-World (ML10 和 ML45 基准测试)、RLBench (FS25 设置)以及使用 UR10e 机械臂的真实世界 机器人操控任务上对 DAMI 进行了评估。
仿真(Meta-World): 在基础任务上,DAMI 在 ML10 上达到了 87.23% 的平均成功率,在 ML45 上达到了 79.05% ,显著优于 DP3、Mamba 和 FlowPolicy 等基准方法。至关重要的是,在处理新颖(未知)任务时,DAMI 在 ML10 上达到了 56.80% ,在 ML45 上达到了 37.53% ,在保持卓越的基础任务熟练度的同时,达到或超过了最佳基准水平。
仿真(RLBench): 在 FS25 新任务设置下,DAMI 取得了最高的平均成功率 10.80% 。
真实世界: 在涉及七项任务(五项基础任务,两项新颖任务)的物理实验中,DAMI 达到了 82.86% 的平均成功率,而 DP3 基准方法为 55.71% 。值得注意的是,DAMI 对不规则物体几何形状(例如扫过不规则圆柱体)和未知物体类型(例如魔方)表现出了强大的泛化能力,而基准方法则会出现“动作误解”(例如执行按压动作而非扫过动作)。
效率: 真实世界任务的适配过程耗时不到两分钟(500 步约需 74.73 秒),由于增加了融合模块,与基准方法相比,计算延迟仅有轻微增加。
意义与主张 论文声称 DAMI 成功解决了机器人模仿学习中数据稀缺和泛化能力有限的关键挑战。通过从随机的完整参考演示中学习底层任务逻辑而非记忆静态线索,该框架确保了对未知任务的有效泛化。作者断言,当具备完整的参考演示、可靠的 3D 观测以及少量的特定任务演示集时,该方法最为适用。虽然该方法需要针对特定任务进行微调,且比某些基准方法具有略高的计算成本,但任务成功率的大幅提升和语义一致性证明了这些额外开销的合理性。这项工作强调了将 3D 扩散策略与元学习及动力学感知表示相结合,以创建更具适应性和鲁棒性的通用机器人智能体的潜力。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。