← 最新论文
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

该论文提出了 GPA-RAM,这是一个通过集成抓取预训练增强(Grasp-Pretraining Augmentation)来提高操控成功率,并采用机器人注意力 Mamba 架构进行高效、实时动作生成的创新框架,在多个机器人平台上实现了最先进的性能。

原作者: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人做你的家务。你并不想写上百万行代码,去精确告诉它在面对家里每件物品时手指该如何移动。相反,你希望向它展示该怎么做,就像父母教孩子如何堆叠积木或把勺子放入杯中一样。这就是**机器人模仿学习(robot imitation learning)**的世界。它是科学的一个分支,机器人通过观察并模仿人类的演示来进行学习。巨大的挑战在于?机器人虽然擅长移动手臂,但它们往往在第一步——即如何以正确的方式抓取物体——表现得很糟糕。如果机器人抓杯子时抓住了杯沿而不是手柄,或者在毫米级的误差下错过了插孔,整个任务就会失败,而且机器人可能不知道如何修复它。科学家们正不断尝试为机器人构建“大脑”,使其能够看清凌乱的房间,弄清楚抓取物体的最佳方式,然后完美地移动物体而不撞到任何东西。

现在,来认识一下 GPA-RAM,这是一种旨在解决这种“抓取并移动”问题的全新机器人大脑。这项研究背后的研究人员意识到,许多机器人之所以失败,是因为在开始移动之前,它们没有给予足够的注意力去关注自己是如何握住物体的。他们构建了一个结合了两个聪明技巧的系统。首先,他们让机器人对如何抓取进行了一次“预训练”,使用了与学习其他任务相同的视频。这就像是在要求学生写文章之前,先给他们进行一次关于如何握铅笔的小测验;机器人在尝试解决谜题之前,先学会了抓握技巧。其次,他们将机器人原本缓慢、沉重的思考引擎更换为一个名为 RAM(Robcian Attention Mamba,机器人注意力 Mamba)的新型、极速引擎。把 RAM 想象成一位超级高效的图书管理员,他可以瞬间扫描庞大的视觉信息库并找到那本正确的书,而旧系统则会因为信息过载而变得迟钝。

团队在四种不同的机器人设置(包括真实的物理机器人和模拟机器人)上测试了这个新大脑。他们发现,通过加入“抓取预训练”,机器人变得更擅长处理棘手的任务,比如堆叠杯子、将木栓插入孔中以及在两只手臂之间移动物体。在名为 RLBench 的标准测试中,这个新系统成功率达到了 87.5%,击败了以往最优秀的方法。更令人印象深刻的是,在涉及移动立方体的双臂机器人任务中,它的成功率达到了 98%;而在一项困难的双手法插入任务中,成功率从 16% 大幅跃升至 56%。最棒的部分在于,它在运行速度约为每秒 71 帧的同时完成了这一切,这意味着它思考得足够快,可以实时做出反应而不会卡顿。研究人员认为,这种“先抓取,后行动”的教学方法可以让机器人成为更可靠的助手,处理那些此前会导致它们失败的精细任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →