想象一下,你正试图教一个机器人做你的家务。你并不想写上百万行代码,去精确告诉它在面对家里每件物品时手指该如何移动。相反,你希望向它展示该怎么做,就像父母教孩子如何堆叠积木或把勺子放入杯中一样。这就是**机器人模仿学习(robot imitation learning)**的世界。它是科学的一个分支,机器人通过观察并模仿人类的演示来进行学习。巨大的挑战在于?机器人虽然擅长移动手臂,但它们往往在第一步——即如何以正确的方式抓取物体——表现得很糟糕。如果机器人抓杯子时抓住了杯沿而不是手柄,或者在毫米级的误差下错过了插孔,整个任务就会失败,而且机器人可能不知道如何修复它。科学家们正不断尝试为机器人构建“大脑”,使其能够看清凌乱的房间,弄清楚抓取物体的最佳方式,然后完美地移动物体而不撞到任何东西。
现在,来认识一下 GPA-RAM,这是一种旨在解决这种“抓取并移动”问题的全新机器人大脑。这项研究背后的研究人员意识到,许多机器人之所以失败,是因为在开始移动之前,它们没有给予足够的注意力去关注自己是如何握住物体的。他们构建了一个结合了两个聪明技巧的系统。首先,他们让机器人对如何抓取进行了一次“预训练”,使用了与学习其他任务相同的视频。这就像是在要求学生写文章之前,先给他们进行一次关于如何握铅笔的小测验;机器人在尝试解决谜题之前,先学会了抓握技巧。其次,他们将机器人原本缓慢、沉重的思考引擎更换为一个名为 RAM(Robcian Attention Mamba,机器人注意力 Mamba)的新型、极速引擎。把 RAM 想象成一位超级高效的图书管理员,他可以瞬间扫描庞大的视觉信息库并找到那本正确的书,而旧系统则会因为信息过载而变得迟钝。
团队在四种不同的机器人设置(包括真实的物理机器人和模拟机器人)上测试了这个新大脑。他们发现,通过加入“抓取预训练”,机器人变得更擅长处理棘手的任务,比如堆叠杯子、将木栓插入孔中以及在两只手臂之间移动物体。在名为 RLBench 的标准测试中,这个新系统成功率达到了 87.5%,击败了以往最优秀的方法。更令人印象深刻的是,在涉及移动立方体的双臂机器人任务中,它的成功率达到了 98%;而在一项困难的双手法插入任务中,成功率从 16% 大幅跃升至 56%。最棒的部分在于,它在运行速度约为每秒 71 帧的同时完成了这一切,这意味着它思考得足够快,可以实时做出反应而不会卡顿。研究人员认为,这种“先抓取,后行动”的教学方法可以让机器人成为更可靠的助手,处理那些此前会导致它们失败的精细任务。
技术摘要:GPA-RAM:用于空间任务学习的抓取预训练增强机器人注意力 Mamba
问题陈述
精细化的机器人操控往往会因为不准确的初始抓取导致误差传播而失败,这需要复杂的姿态校正,而对于有限的演示数据和平行夹爪而言,这类校正难以实现。虽然近期的模仿学习(IL)方法(如 RVT2, ACT)在处理高维动作建模方面取得了进展,但它们的策略表示通常将抓取姿态先验视为隐式,导致系统对初始抓取质量非常敏感。此外,现有的基于 Transformer 的方法在计算成本上随序列长度呈二次方增长,这为多视图 RGB-D 观测下的实时部署带来了延迟问题。核心挑战在于如何在不收集单独抓取数据集或产生过高计算开销的情况下,强化抓取敏感型表示。
方法论:GPA-RAM 框架
作者提出了 GPA-RAM,这是一个由两个互补模块组成的统一框架:抓取预训练增强(GPA)和机器人注意力 Mamba(RAM)。
抓取预训练增强 (GPA):
- 机制: GPA 直接从专家任务演示中引入抓取姿态先验,无需额外的资料收集或人工抓取姿态标注。
- 流程: 首先在专家演示中所包含的抓取配置上预训练一个抓取姿态检测器。在主策略训练期间,移除检测器的输出头,并保留其冻结的特征骨干网络。这些具有抓取敏感性的特征通过“预训练位置融合”(PLoFusion)模块进行空间对齐并与任务策略特征进行融合。
- 集成: 这种设计引入了显式的操控先验,使策略能够利用学习到的抓取几何结构来完成诸如堆叠或插入等下游任务。
机器人注意力 Mamba (RAM):
- 架构: 为了解决 Transformer 中全局自注意力机制的计算低效问题,RAM 采用了一种结合注意力机制与线性时间状态空间模型(Mamba)的混合架构。
- 功能: 多视图 RGB-D 观测被渲染为虚拟视角。RAM 使用注意力机制进行视图特定的特征交互,并使用 Mamba 模块高效地建模长程空间依赖关系,其复杂度相对于序列长度呈线性缩放。
- 变体:
- 离散策略: 采用粗到精(coarse-to-fine)的 RAM 架构。粗略阶段预测一个 3D 位置以定义局部区域,随后通过重新渲染进入精细阶段,以生成用于关键帧预测的精确空间表示。
- 连续策略: 使用单阶段 RAM,并集成动作分块解码器(改编自 ACT),以生成高频率(例如 50 Hz)的连续动作序列。
核心贡献
- GPA 框架: 一种模块化增强方案,能将抓取姿态先验从演示中迁移到操控策略中,在无需额外标注的情况下提高精确抓取能力。
- RAM 架构: 一种结合了注意力机制和状态空间模型的混合网络,能够实现高效的空间特征提取和实时动作生成,减少了对计算昂贵的全局自注意力的依赖。
- 全面验证: 该框架在四个平台(模拟 Franka Panda、模拟 ALOHA、物理 UR5 和物理 ARX R5)上进行了验证,涵盖了从离散关键帧预测到连续双臂操控的任务。
实验结果
论文报告了在多个基准测试中的显著性能提升:
- RLBench(离散任务): GPA-RAM 在 18 个任务中实现了 87.5% 的平均成功率。这超过了之前的 SOTA 模型 ARP+(84.9%)2.6 个百分点,并超过 RVT2(79.3%)8.2 个百分点。该模型还取得了最佳平均排名(2.28),表明其具有卓越的一致性。
- 具体增益: 在“插入插销”(Insert Peg)任务中,GPA-RAM 的成功率达到 95.0%,而 ARP+ 为 78.4%。在“堆叠杯子”(Stack Cups)任务中,它达到了 84.8%,而 ARP+ 为 80.0%。
- ALOHA(连续双臂任务):
- 方块转移(Cube Transfer): 成功率为 98%(比 ACT 提升了 12%)。
- 双臂插入(Bimanual Insertion): 成功率为 56%(比 ACT 提升了 40%,ACT 仅为 16%)。
- 效率: 系统运行速度约为 71 帧每秒 (FPS),超过了 ACT 基准(约 61 FPS)和 RT-1(约 30 FPS)。
- 现实世界部署: 在物理 UR5 和 ARX R5 机器人上,GPA-RAM 在方块入抽屉(成功率 90–100%)和托盘传输(成功率 100%)等任务中表现出了鲁棒性,在处理富接触插入和受限环境任务时优于基准模型。
意义与主张
论文声称 GPA-RAM 成功弥合了精确操控与高效实时执行之间的差距。通过通过 GPA 显式建模抓取先验,该系统减轻了由不准确初始抓取引起的误差传播,而这是以往模仿学习策略中常见的失效模式。同时,RAM 架构解决了与基于 Transformer 的方法相关的延迟瓶颈,从而实现了适用于动态环境的高频控制。
作者强调,他们的方法是模块化的:GPA 可以增强现有架构(已在 RVT2 和 ACT 上得到验证),而 RAM 为空间推理提供了一种可扩展的全局注意力替代方案。结果表明,将显式抓取先验与高效的状态空间模型相结合,是实现稳健、泛化机器人操控的有效途径,且无需大量的专门抓取数据集。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。