← 最新论文
💻 computer science

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

本文介绍了 VLAct,这是一种以表示为中心的视觉-语言-动作模型持续预训练方法,它利用异构多具身数据,即使在计算预算有限且下游数据较少的情况下,也能在多样化任务和未见机器人之间实现卓越的迁移能力与性能。

原作者: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, J
发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像人类那样通过经验学习。虽然一个孩子可以观察父母倒水的动作并理解其中的运动,但机器人通常需要成千上万条特定的、手工编写的指令才能完成同样的任务。多年来,科学家们一直试图通过向机器人喂入海量数据来解决这个问题,希望单纯依靠数据的规模就能教会它们如何移动。这种方法依赖于视觉-语言-动作(Vision-Language-Action)模型,这是一种能够看见图像、理解句子并决定物理动作的计算机系统。普遍的观点一直是,只要收集足够的机器人运动数据,系统自然就会变得足够聪明,从而能够处理任何情况。然而,收集机器人数据极其困难且昂贵;与互联网上的照片或文本不同,机器人的运动必须在真实的物理世界中记录,通常是由人类引导机器完成。这种稀缺性意味着,即使是最大的机器人数据集,与广袤的物理世界相比也显得微不足道且稀疏。

现在,一组研究人员提出了一条不同的前进路径,他们认为机器人学习内容的质量比其看到的数据数量更重要。他们认为,机器人不应仅仅是死记硬背特定的动作,其“大脑”需要学习物体与动作之间如何相互关联的深层、灵活的理解。通过专注于这种“表示”(即机器人构建的世界内部地图),他们创造了一种新的训练方法,使机器人能够更好地进行泛化。他们的工作证明,通过以一种更聪明的方式来教导机器人的核心大脑,系统可以学会控制它从未见过的机器人,而仅需使用此前认为必要的极小部分数据。

研究人员以 VLAct 为名开展工作,从一个基本问题开始:为什么机器人无法实现泛化?当一个机器人在特定的运动集上进行训练时,它往往会变得过于专业化,只会模仿它看到的精确模式,而不是理解任务背后的底层物理原理。为了调查这一点,团队研究了不同的教学方式如何影响机器人的内部理解。他们发现,如果一个机器人被训练为仅使用一种特定的方法来预测动作,它就会被“锁定”在该方法中。这就像一个学生只学会了用一种特定的公式来解数学题;如果考试改变了问题的形式,学生就会失败,因为他们从未理解过概念本身。研究人员发现,当机器人的大脑被迫在训练期间将其知识拟合进一个单一、僵化的结构时,就会发生这种“锁定”现象。

为了解决这个问题,团队开发了一种新的训练方案,使机器人的大脑保持灵活性。他们首先使用了一个强大的视觉-语言模型,这是一种已经在海量互联网图像和文本上经过训练的人工智能,赋予了它对世界的广泛理解。他们没有让机器人训练覆盖这种广泛的知识,而是保护了处理基础视觉识别的脑部底层。随后,他们引入了一种独特的训练技术,要求机器人同时使用三种不同的数学方法来预测相同的物理运动。通过迫使机器人同时满足这三种方法,研究人员防止了它仅仅专业化于其中一种。这种方法确保了机器人学习到的是一种通用的动作理解,而不是一种与单一计算运动方式绑定的狭隘技能。

此外,团队还解决了不同机器人身体的问题。拥有两个手臂的机器人移动方式与拥有一个手臂的机器人不同,拥有抓取器的机器人与拥有手的机器人移动方式也不同。以往的方法通常将这些差异视为独立的问题,为每种机器人类型训练一个独特的“大脑”。VLAct 团队则创建了一种共享的运动语言。他们教会机器人,在一台机器上打开抓取器与在另一台机器上打开抓取器是同一个概念,即使它们的物理机制有所不同。他们通过对齐物理特性相似的部分(如手部的开合)来实现这一点,同时将每个机器人身体的独特部分分开处理。这使得机器人能够将其在一种类型机器上学到的知识,迁移到一种它从未遇到过的完全不同类型的机器上。

这种方法的实验结果令人瞩目。在广泛的任务测试中,新系统始终优于现有模型,包括那些在更大规模数据集上训练的模型。在名为 LIBERO-Plus 的模拟基准测试中(该测试评估机器人处理光照、摄像机角度和物体放置变化的表现),新系统的成功率达到了 82.6%。这显著高于其他领先系统,证明了机器人已经学习到了任务的稳健理解,而非仅仅是记忆特定的场景。在涉及两个机械臂协同工作的另一个基准测试 RoboTwin 2.0 中,该系统达到了 92.5% 的成功率,超越了依赖专有数据和大规模计算能力的工业级系统。

该方法最引人注目的证据来自一项涉及全新人形机器人的测试。研究人员在标准机械臂的数据上训练其系统,然后要求它控制一个带有腿部和躯干的人形机器人——这是一种它从未见过的机器。仅使用通常训练此类特定身体所需数据的 20%,该系统的表现就优于使用 100% 数据训练的基准模型。这表明,机器人已经学习到了关于“如何移动”的基础概念,并能将其应用于任何身体,而不仅仅是死记硬背它所训练的机械臂的具体动作。

研究人员还在现实世界中测试了他们的系统,使用物理机械臂执行诸如堆叠积木、清洁桌面和折叠衣服等任务。在这些现实世界的实验中,该系统继续表现优于基准模型,展现出更高的稳定性和精确度。它成功处理了从未见过的陌生物体,例如拿起辣椒而不是胡萝卜,并能处理复杂的、多步骤的任务,如舀取豆子并将其倒入碗中,且没有跳过步骤。该系统在协调双臂协作方面也表现出色,例如一边握住插座一边拔掉插头,展示了以往模型难以实现的同步水平。

这项工作的特别意义在于,它是利用开源数据和适度的计算能力(具体为 16 个图形处理器/GPU 的配置)实现的。这与该领域许多顶尖系统形成了鲜明对比,后者依赖于专有数据集和大规模工业级计算资源。研究人员表明,通过专注于机器人如何在其内部表示世界,而非仅仅扩大数据规模,可以构建出更强大且更具适应性的机器人。他们的发现表明,机器人学习的未来不在于收集无止境的数据流,而在于设计有助于机器人建立对物理世界更深层、更灵活理解的训练方法。

研究结论指出,教导机器人的方式与教导的内容同样重要。通过保留预训练大脑的广泛知识,并鼓励机器人以一种不与单一方法或身体类型绑定的方式学习动作,研究人员可以创造出能够更好地应对现实世界不可预测性的系统。这种方法为开发通用型机器人提供了一条充满前景的路径,使其能够快速学习新任务并在新环境中进行适应,而无需大量的全新数据。这项工作已向公众开放,允许其他科学家基于这些发现进行深入研究,进一步探索如何教导机器像生物一样灵活且富有理解力地运动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →