← 最新论文
🤖 AI

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT 是一个大规模强化学习框架,它通过在通用任务上进行预训练,并采用一种稳定的后训练方案,使机器人能够通过原始的视触觉感知来解决复杂的长程操作任务,从而加速开发具有人类水平灵巧性的高自由度机器人,并实现零样本从模拟到现实的迁移。

原作者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是工厂车间的专家,以僵硬的精准度进行汽车组装或堆叠箱子。然而,当被要求执行日常生活中流畅且细腻的任务时——比如拿起一个脆弱的鸡蛋,将其翻转,然后轻轻地放入碗中——大多数机器都会失败。这就是灵巧性的挑战。它要求机器人同时协调数十个运动部件,并实时对触觉和视觉做出反应,以应对物体滑动、滚动或碰撞所带来的混乱物理现象。多年来,研究人员一直试图通过编写僵硬的规则或展示人类演示来教机器人这些技能,但这些方法在环境发生哪怕微小变化时往往也会失效。然而,一种新的方法表明,机器人灵巧性的秘诀不在于从头开始教授机器人每一项特定任务,而在于首先赋予它对物理世界的广泛基础性经验。

一个研究团队开发了一种名为 ADEPT 的新框架,该框架通过首先掌握一个通用的“重新定位”物体的游戏,来教机器人学习复杂的操控技能。想象一下,一只机器手在虚拟世界中度过了数月时间,仅仅是在拿起各种随机形状——圆柱体、立方体、球体——并将它们移动到桌子的不同位置。它学习伸手、抓取、抬起和转动这些物体,除了成功移动物体之外,没有任何特定的目标。这个阶段建立了一种深刻的直觉理解,即物体是如何行为的,以及机器人的手指应该如何移动才能控制它们。一旦奠定了这个基础,研究人员就会引入一个特定的新任务,例如将插销插入孔中,或将盘子放入碗架中。机器人不再从头开始,而是利用其先前的经验作为引导。研究人员发现,这种方法可以让机器人跳过最初笨拙的学习阶段,直接将其通用技能应用于新的特定挑战。

当机器人面对从未见过的任务时,这种方法的威力便显露无疑。在实验中,研究人员在两个配备了多指手的机器人手臂上测试了该系统:一个拥有二十三个运动关节,另一个拥有二十九个。他们在高保真模拟环境中训练机器人,使其能够同时进行数千次试验。机器人首先学习重新定位各种简单形状。当研究人员随后要求机器人执行一项困难的任务——将插销插入板中(这是一个需要精确对齐和处理接触力的挑战)时,机器人并没有从零开始。它们立即识别出需要伸手、抓取和抬起插销,这些都是它们已经掌握的技能。它们唯一需要学习的部分是最后的精细插入动作。

然而,仅仅让一个在某项任务上训练过的机器人去执行另一项任务,往往会导致它忘记所学到的知识。研究人员发现,如果他们尝试直接对机器人的行为进行微调,新的指令会覆盖旧有的技能,导致机器人失去正确抓取或抬起物体的能力。为了解决这个问题,他们开发了一套精心的训练方案。首先,他们使用一种技术,轻轻引导机器人的新行为趋向于旧有的成功行为,确保核心技能保持完好。接着,他们缓慢调整机器人对新任务中“优秀”动作的理解,使其能够在不失去平衡的情况下进行适应。最后,他们训练了第二个更简单的机器人版本,该版本只能依靠摄像头看到的图像和指尖感受到的触觉,剥离了训练期间机器人使用的内部数据。这个“学生”机器人随后被送往现实世界。

结果令人瞩目。在现实世界中,这些机器人可以成功拿起一个插销,在手中重新定向,并将其插入孔中,同时仅依靠视觉和触觉反馈。它们可以处理对称的星形插销,以及难度大得多的非对称方圆结合插销(后者需要单一且精确的定向才能嵌入)。该系统还学会了抓取一个平盘,将其翻转,然后放入碗架中,而这一系列动作在初始训练中从未被明确展示过。机器人完成这些任务仅需五到十秒,其速度与人类相当,而以往使用更简单的夹持器和外部固定装置的方法则需要二十到七十秒。

至关重要的是,研究人员发现机器人发展出了自然且类似人类的持物方式。在没有被告知如何握持插销的情况下,机器人学会了用手指环绕插销,形成一种稳定的多点抓握,就像人类的手一样。相比之下,那些在没有经过初始重新定位阶段训练的机器人,往往会产生笨拙且不稳定的持物方式,这种方式虽然在瞬间有效,但在压力下会失败。这项研究表明,通过首先给予机器人广泛的、通用的物体物理经验,它能比尝试一次性学习所有内容更快、更可靠地掌握新的特定技能。这种方法不仅让机器人变得更快,还让它们变得更稳健,能够以一种此前难以企及的灵巧程度,应对现实世界中不可预测的性质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →