← 最新论文
💻 computer science

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

本文介绍了 OpenWAM,这是一个开放且模块化的研究栈,通过受控实验系统地研究世界-动作模型(World-Action Model)预训练,以推导出关键设计原则,并最终发布了在 6,400 小时多样化具身数据上训练的高性能模型 OpenWAM-α\alpha

原作者: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu
发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

智能不仅仅在于观察世界,更在于知道如何改变世界。几十年来,科学家们一直在构建能够识别照片中的物体或描述句子中场景的计算机系统。最近,他们又创造了能够想象场景随时间演变的模型,即根据前一帧视频预测下一帧的内容。这些系统通过观看大量的视频,学习世界的物理规律——例如杯子是如何掉落的,门是如何摆动的。然而,在“观察世界”与“在其中行动”之间存在着一道鸿沟。机器人需要的不仅仅是对未来可能发生情况的预测;它需要知道哪些具体的动作能让那个预测成为现实。这就是具身学习(embodied learning)的挑战:弥合理解视觉未来与生成实现该未来的物理动作之间的差距。

一个研究团队引入了一种名为 OpenWAM 的新方法来解决这个问题。他们没有构建一个难以更改或理解的单一、僵化的机器人大脑,而是创建了一个开放的、模块化的系统,将机器人控制器的设计视为一组可互换的部件。他们将“教机器人如何行动”这一复杂任务分解为三个截然不同的问题:机器人应该从视频观看中继承哪些知识?机器人的世界理解能力与其运动能力应如何协同工作?以及如何将这种学习扩展到不同类型的机器人和环境中?通过实验回答这些问题,他们提炼出一套原则,并据此创建了 OpenWAM-α——一个强大的新模型,它能够在模拟环境和真实世界设置中学习操纵物体。

研究人员首先探讨了机器人应该具备什么样的“世界知识”。他们测试了机器人应该向一个看过数百万小时视频的海量视频生成器学习,还是应该依赖一个更简单的视觉编码器。他们发现,最好的结果来自于使用一个经过大规模预训练的视频生成器作为基础。这个模型已经理解了物体是如何移动和相互作用的,从而提供了一个丰富的起点。然而,仅仅将机械臂连接到这个视频模型上是不够的。研究人员发现,机器人还需要一种紧凑、高效的方式来表示它所看到的内容。他们测试了各种将视觉信息压缩成更小、更易管理形式的方法,发现一种能在保留世界本质细节的同时丢弃噪声的特定压缩方式效果最好。这使得机器人能够专注于场景的重要部分,而不至于被过量的数据淹没。

接下来,团队研究了机器人的“大脑”应如何构建,以将其对世界的理解与运动能力联系起来。他们比较了不同的架构设计,范围从视频部分与动作部分完全分离的模型,到两者深度交织的模型。他们的实验表明,最有效的设计是一种双系统方法。在这种设置下,模型的一部分专注于预测世界的未来视觉状态,而专门的另一部分则专注于生成动作序列。至关重要的是,这两个部分被允许不断地进行交流。动作生成器可以通过观察预测的未来来决定做什么,而世界预测器则可以利用计划中的动作来完善其对即将发生情况的视觉构想。这种持续的双向对话使模型能够学到视觉与行动之间的真正协同,而不仅仅是让两者并列学习。

研究人员还探索了如何使用不同类型的数据来训练这些模型。他们拥有两个主要的来源:一是人类执行任务的第一视角视频,提供了极其多样化的视觉场景,但缺乏机器人动作数据;二是实际机器人执行任务的记录,提供了精确的运动指令,但覆盖的场景类型较少。他们测试了仅在机器人数据上训练、仅在人类数据上训练,或者将两者结合在一起进行训练的效果。他们发现,在单次训练过程中结合这两个来源是最强大的策略。人类视频教会了模型关于世界的广泛多样性,而机器人数据则将这种知识锚定在物理现实中。这种结合使得模型在面对未见过的全新情况时,比仅使用单一类型数据训练的模型具有更好的泛化能力。

利用这些原则,团队构建了 OpenWAM-α,这是一个在超过 5 亿帧视频和机器人数据上训练的模型。他们在八个不同的模拟基准测试以及配备单臂、双臂甚至灵巧手的真实机器人上对其进行了测试。结果一致且令人印象深刻。在模拟环境中,该模型在从堆叠积木到操纵复杂物体的一系列任务中都表现出了顶尖水平。当转移到现实世界时,它保持了这种高性能,在它从未见过的物理机器人上成功完成了任务。该模型展现出了特别强的适应能力,这表明基于视频的世界知识与基于动作的落地能力的结合,创造了一个稳健的基础,通向通用智能。

其中一个最重要的发现是这种方法与其他流行方法的对比。一些系统过度依赖语言和视觉理解,但并未显式地对未来进行建模;而另一些系统则纯粹关注运动机制。研究人员发现,他们的基于视频的方法在拟合训练数据和在熟悉场景中表现出色,而其他方法有时在面对全新的、混乱的环境时泛化能力更好。然而,他们得出结论,没有任何一种方法是完美的。未来的关键在于结合两者的优势:利用视频生成的丰富视觉和物理先验来引导动作,同时确保系统接受涵盖现实世界全方位挑战的多样化、高质量数据的训练。

OpenWAM 项目不仅仅是展示了一个新的机器人控制器;它还提供了一套完整的工具包。通过发布基础设施、训练数据和评估协议,研究人员将世界-动作模型的开发转变为一门透明、可重复的科学。这使得其他科学家可以测试特定的想法、更换组件,并准确理解为什么某些设计效果更好。这项工作表明,通往更强大的机器人的路径并非通过构建更大、更不透明的系统,而是通过仔细理解不同知识与学习是如何相互作用的。通过将机器人的思维视为可组合部件的集合,研究人员为人工智能的系统性探索开启了一个新时代,在这个时代,每一个设计选择都可以被测试、衡量和改进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →