← 最新论文
💻 computer science

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA 通过引入一个以原语为中心(primitive-centric)的框架,将演示拆解为通过共享多模态表示的可重用运动原语,并在推理过程中将其重新组装,从而通过实现更高效的学习和在复杂任务中稳健的零样本泛化,解决了视觉-语言-动作模型的数据低效和泛化能力差的问题。

原作者: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再是那些笨拙的、只能执行昨天预设程序的机器,而不再是只能照本宣科的机械装置,而是能够成为聪明的助手——它们可以弄明白如何打开一种新型的罐子,或者如何堆叠一个形状奇特的积木,而不需要为每件物品都准备一份说明书。这就是“具身智能”(Embodied AI)的梦想——赋予机器人一个能够结合视觉、听觉和运动能力的“大脑”。目前,科学家们正试图利用一种被称为“视觉-语言-动作”(Vision-Language-Action, VLA)的模型来构建这些大脑。你可以把这些模型想象成机器人的“大脑”,它观察一张图片,阅读像“把杯子放在桌子上”这样的句子,然后决定哪些肌肉该如何抽动以实现这一目标。目前面临的大问题是,这些机器人学习新事物的速度非常慢。它们就像是那些死记硬背特定考试答案的学生,一旦老师改变了题目中的数字,就会彻底失败。它们试图一次性记住整个复杂任务的完整路径,这使得它们学习缓慢,且在世界发生变化时极易产生混乱。

这正是名为“PrimitiveVLA”的新论文所要解决的问题。研究人员认为,机器人之所以难以进行泛化,是因为它们试图将庞大且复杂的任务作为一个整体进行学习。相反,他们提出了一种更聪明的方法:教机器人学习“原语”(primitives)。想象一下你在学习烹饪。你不是把“培根蛋奶面”的完整食谱当作一个巨大且令人困惑的步骤列表来死记硬背,而是学习基础动作:切、煮、搅拌和煎。一旦你掌握了这些可重复使用的基本动作,你就可以通过组合它们来制作几乎任何菜肴,即使是以前从未见过的菜肴。作者建议,机器人也应该这样做。他们构建了一个系统,在训练过程中将复杂的机器人任务分解为这些小的、可重复使用的“运动原语”(例如抓取、推动或抬起)。这样,当机器人面对一项新的、棘手的任务时,它不会试图去记忆整个过程,而只是组装出正确的动作序列来解决问题。

论文表明,这种“拆解与组装”的方法效果极其出色。在测试中,使用这种方法训练的机器人学习速度更快,仅需一半的练习数据就能达到与使用完整数据集训练的机器人相当的表现。但真正的奇迹发生在测试机器人处理从未见过的物体时。例如,在一组长而复杂的任务中,标准的顶尖机器人模型的成功率仅为30%左右。然而,使用PrimitiveVLA的机器人成功率跃升到了80%。更令人印象深刻的是,当面对机器人从未遇到过的全新任务时,这种新方法比旧方法将成功率提高了六倍。研究人员在计算机模拟和真实的物理机械臂上都进行了测试,证明了先让机器人掌握基础知识,而不是死记硬背全貌,才是让它们成为真正聪明且适应力强的助手的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →