← 最新论文
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

GE-Act 2.0 是一种从操控数据中从头训练的新型世界-动作模型,它集成了一个面向控制的自编码器、一个单步视觉规划器以及一个具有知识对齐选择性优化的逆动力学模型,通过大规模扩展和跨具身迁移,在多种任务和具身形态中实现了显著的零样本成功。

原作者: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是工厂车间的专家,能够毫无误差地重复成千上万次相同的精确动作。但一旦将它们置于厨房、客厅或杂乱的工作室中,它们往往会陷入停滞。挑战不仅在于移动一只手,而在于理解当那只手接触物体时,世界是如何变化的。为了应对这一挑战,新一代人工智能正在学习如何想象未来。这些系统不再仅仅是对当下所见做出反应,而是尝试预测如果采取特定行动,接下来会发生什么。这种被称为“世界-动作模型”(world-action model)的方法,允许机器人在移动任何一寸肌肉之前,先在脑海中模拟一系列事件,检查结果是否符合其目标。多年来,研究人员一直试图通过将现有的视频生成器(即被训练用来创建虚假电影的程序)强行转化为理解机器人运动的模型来构建这些系统。然而,这种方法往往会让机器人对物理规律的理解变得模糊,因为视频生成器的设计初衷并非为了控制物理实体。

来自 AgiBot 的一个团队现在推出了一种不同的方法,他们仅利用真实的物理交互数据,从底层开始构建机器人的想象力。他们开发了一个名为 GE-Act 2.0 的系统,该系统学习预测未来并同时决定动作,但有一个关键的转折:系统的每一个部分都是从头开始,利用机器人和人类操纵物体的真实数据进行训练的。研究人员并没有依赖预制的视频模型,而是教会了系统一种“运动的压缩语言”——这是一种看待世界的方式,它剥离了不必要的细节,专注于控制所必需的关键信息。这使得机器人能够从庞大且多样化的数据库中学习,其中包括数小时的成功演示、失败尝试,甚至包括人类在没有任何指令记录下的工作视频。通过结合这些不同类型的学习,该系统学会了泛化能力,这意味着它可以将学到的知识应用到从未见过的全新情境中。

这项成就的核心在于研究人员如何处理物理世界的复杂现实。当机器人尝试学习时,经常面临一个令人困惑的问题:同一个指令可以通过许多不同的方式来完成。例如,机器人可能会被要求“拿起红色的杯子”,它可以从左侧接近,也可以从右侧接近,或者通过把手或杯缘抓取。如果训练数据只展示了一种方式,而机器人的想象却预测了另一种方式,系统的这两个部分就会出现不同步。研究人员将这种不匹配识别为“有效性差距”(validity gap),即机器人的未来预测与其应当执行的动作之间不一致。为了解决这个问题,他们开发了一种类似于“过滤器”的选择机制。在机器人从预测的未来中学习之前,它会检查该未来是否与它需要执行的动作相兼容。它会生成几种可能的未来,测试它们是否与要求的动作相符,并且只从那些逻辑一致的预测中进行学习。这确保了机器人不会模糊理解不同动作如何导致不同的结果。

这种训练的结果非常显著,尤其是在测试机器人从未练习过的任务时。研究人员在一百个不同的操纵任务上评估了该系统,范围涵盖堆叠积木、倾倒液体到折叠毛巾和插入插头。这些测试是在真实的机器人上进行的,环境中的光照、背景和物体排列与训练时使用的环境各不相同。当系统在 300 小时的小规模数据集上进行训练时,在一个机器人模型上的任务成功率仅为 17.1%。然而,随着研究人员将训练数据规模扩大到 30,000 小时,成功率稳步攀升至 44.1%。这种提升是在没有针对单个任务进行任何特定微调的情况下实现的;机器人只是将其学到的通用技能应用于新的挑战。更令人惊讶的是,该系统在第二个不同的机器人模型上也表现出了强大的能力,而该模型在训练数据中所占比例不足 2%,这表明从大型数据集中学到的技能可以有效地迁移到新的物理形态上。

该系统遵循指令的能力也在困难条件下接受了测试。在许多实验中,机器人被要求执行一个与其基于场景或既有习惯所预期的动作相冲突的指令。例如,如果机器人在动作过程中,它仍然可以停下来并遵循一个新的明确指令来改变路径。在超过 90% 的此类实验中,即使细节非常微妙或语境混乱,机器人也能正确识别指令中提到的特定物体、颜色、形状或位置。研究人员发现,机器人学习到的技能多样性与其在新任务上的成功率之间存在着强关联。机器人学习的技能越多样,它处理新情况的可能性就越高。这表明,通往更强大机器人的路径不仅在于更好的算法,还在于它们所消耗的数据的规模和多样性。

这项工作标志着向着能够从人类理解世界所使用的丰富、非结构化数据中学习的机器人迈出了重要一步。通过构建一个能以统一方式预测未来并规划动作的系统,并教会它从多种可能性中选择正确的预测,研究人员创造了一个既鲁棒又具适应性的模型。研究结果表明,凭借足够的多元化经验,机器人可以发展出对物体行为及其交互方式的深刻、直觉式的理解,从而超越僵化的编程,走向一种更灵活的智能形式。这种方法在真实硬件上的成功,且无需为每项新工作重新训练,指向了一个未来:机器人可以在动态、不可预测的环境中部署,并能在其中茁壮成长。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →