← 最新论文
💻 computer science

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM是一个因果视频动作模型,它通过利用作为任务规范的上下文人类视频,并辅以一个包含7.42万个“人-机器人”对的合成数据集以及一个用于强化对视觉提示依赖性的未来分块预测目标,实现了机器人操控中的零样本跨任务泛化。

原作者: Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直面临着一个根本性的局限:它们擅长重复被明确教授的内容,但在面对从未练习过的新情况时却会表现不佳。如果一个机器人学会了堆叠红色的积木,它往往无法弄明白如何堆叠蓝色的积木,或者如何打开微波炉,除非人类程序员为其针对该特定任务重写代码。这种无法泛化的能力是构建能在我们的家庭或工作场所提供帮助的机器的主要障碍。多年来,研究人员一直试图通过语言来教机器人,给它们像“拿起杯子”这样的口头指令。然而,语言往往过于模糊,无法捕捉任务中复杂的物理细节,例如究竟要用多大的力气挤压物体,或者解开绳结所需的精确动作序列。人类向机器人展示如何操作的一种更自然的方式是直接演示,但让机器人通过观看人类视频来学习已被证明非常困难,因为机器人和人类的运动方式不同,观察世界的角度也不同。

一个研究小组开发了一种新方法,允许机器人通过观看一段人类执行任务的短视频来学习全新的任务,而无需针对该特定任务进行任何预先训练,也不需要更改机器人的内部软件。他们将这一系统称为 Zero-WAM。其核心思想是将人类视频不仅视为参考,而是将其视为直接指令。当机器人需要执行一项新工作时,它会观看一段人类执行类似工作的视频,并利用该视觉指南来确定自己的下一步动作。为了实现这一点,研究人员必须解决一个庞大的数据问题。他们需要数千个示例,其中人类展示任务的视频与机器人执行该任务时的自身动作完美匹配。由于手工收集此类配对既缓慢又昂贵,他们构建了一个自动化系统,该系统可以利用现有的机器人工作录像,并使用人工智能生成与之匹配的人类视频。这一过程创建了一个包含近 9,000 种不同任务的、拥有 74,200 个配对示例的海量库,涵盖了从简单的拾取和放置动作到复杂的、多步骤的操作。

研究人员在这个多样化的库上训练了他们的模型,教它根据自身的运动历史和正在观看的人类视频来预测机器人下一步应该做什么。他们的方法中一个关键部分是确保模型确实在关注人类视频,而不是仅仅根据以前见过的内容进行猜测。他们增加了一个特殊的训练步骤,要求模型不仅要预测紧接着的下一刻,还要预测未来好几步。这迫使系统理解视频中展示的长期目标,而不仅仅是对即时过去做出反应。当他们在模拟环境中测试该系统处理七个在训练期间从未见过的全新任务时,它在近一半的尝试中取得了成功。这比以往的方法有了显著提升,后者成功率不足五分之一。该系统成功处理了诸如打开微波炉、堆叠积木和移动订书机等具有挑战性的任务,而这一切仅仅是通过观看一段人类演示视频实现的。

成功并未止步于模拟环境。团队将训练好的模型应用到了一个带有物理机械臂的真实世界设置中,并在涉及将物体放入容器、按特定顺序移动多个物品以及高精度地将桌腿插入孔洞的任务上进行了测试。在这些现实世界的测试中,机器人再次利用人类视频指令来应对未见的配置,例如使用不同颜色的物体或与训练期间看到的不同的桌面设置。虽然由于现实世界的物理难度导致成功率低于模拟环境,但机器人仍然能够完成标准语言系统完全无法解决的任务。例如,当被要求根据视频指南将桌腿插入特定孔洞时,机器人在相当比例的试验中取得了成功,而仅靠语言的系统则完全失败了。

研究结果表明,阻碍机器人变得更具适应性的瓶颈并不一定是机器人的运动能力,而是我们向其传达指令的方式。通过从基于文本的命令转向基于视频的演示,并利用一个自动生成的庞大数据集来教机器人如何将人类动作转化为自身的运动,研究人员展示了一条通往更灵活机器的可行路径。该系统不需要机器人为每一项新工作学习一项新技能;相反,它学习的是一种解释视觉演示的通用能力。这意味着在未来,机器人可能会被递给一段人类修理漏水水龙头或整理架子的视频,然后它就能尝试独立完成这项任务,将其物理动作调整到适合自身的身体以及面前的具体物体。这项工作表明,通过正确的数据和训练方法,机器人可以开始弥合人类直觉与机器执行之间的鸿沟,向实现真正的通用型助手这一目标迈进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →