← 最新论文
🤖 AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA 是一个统一的机器人策略框架,它利用大规模指令视频预训练来学习连续与离散表示的结合,从而在模拟环境和真实世界分布外任务中,相较于现有的视觉语言和生成式方法展现出更优越的性能。

原作者: Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人做家务。这篇论文介绍了一种名为UniJEPA(统一联合嵌入预测与动作)的新方法,旨在让机器人变得更聪明、更灵活,并更好地处理它们从未见过的事物。

以下是其工作原理的分解,使用了简单的类比:

问题:“双头”机器人

目前,机器人的“大脑”通常分为两派,且两者都有弱点:

  1. “说话者”(视觉 - 语言模型): 这些机器人非常擅长理解语言和图像。如果你说“拿起红色的杯子”,它们知道什么是杯子,也知道“红色”是什么意思。但它们不擅长预测物理规律。它们无法直观地知道如果抓得太紧杯子会如何摇晃,或者它会在桌子上如何滚动。
  2. “预测者”(生成式模型): 这些机器人非常擅长猜测接下来会发生什么。如果它们看到一个球在滚动,就能预测一秒钟后它会在哪里。但它们往往缺乏“常识”或语言理解能力。它们可能知道如何移动,但不知道为什么要移动,或者人类实际上要求它们做什么。

大多数机器人试图只使用其中一种,或者试图将两者生硬地拼凑在一起,结果却丢失了两者最出色的部分。

解决方案:“双语梦想家”(UniJEPA)

UniJEPA 就像一个能够同时掌握两种语言并**以两种方式进行“做梦”**的机器人。它将“说话者”和“预测者”融合进了一个大脑中。

把它想象成一个正在学习开车的学生:

  • 离散学习(“说话者”): 这就像学习交通规则和词汇。“停车标志意味着停车”,“绿灯意味着通行”。机器人学习理解复杂的指令,并用语言描述它所看到的内容。
  • 连续学习(“梦想家”): 这就像学习汽车的手感。这不仅仅是关于规则,而是关于预测运动的流畅过程。如果你稍微转动方向盘,汽车会如何漂移?UniJEPA 学习预测未来的视觉场景,但不是将其预测为模糊的视频,而是预测为一种高层次的“感觉”或关于接下来会发生什么的“地图”。

它们是如何训练它的(两阶段过程)

第一阶段:“图书馆与电影院”阶段(预训练)
在机器人真正接触任何实物之前,研究人员让它“阅读”和“观看”海量数据。

  • 它们向机器人输入了超过100 万段视频,内容是人类和机器人执行任务(如打开抽屉或捡起玩具)。
  • 技巧: 它们要求机器人同时做两件事:
    1. 回答问题: “机器人正在做什么?”(这 sharpen 了它的语言和认知能力)。
    2. 预测未来: “如果机器人这样移动手臂,1 秒后的画面会是什么样?”(这 sharpen 了它对物理和运动的理解)。
  • 通过同时做这两件事,机器人建立了一个心理模型,其中语言与物理运动完美地联系在一起。

第二阶段:“驾驶学校”阶段(微调)
一旦机器人拥有了这些通用知识,研究人员就教它如何具体移动它自己的身体。

  • 它们向它展示来自实际机器人手臂或手的数据。
  • 机器人学习将其“梦想”(对未来情况的预测)和“理解”(语言指令)直接转化为动作令牌(控制电机移动的具体命令)。
  • 它使用一个特殊的“专家”系统(就像一个专家团队)来处理移动真实手臂而不发生碰撞的复杂数学计算。

结果:为什么它更好

研究人员通过两种方式测试了这个机器人:

  1. 在电子游戏中(模拟环境): 它们给它布置了从未见过的任务,比如以特定方式移动特定物体。UniJEPA 以显著优势(约高出 9-12%)击败了所有其他顶级机器人。
  2. 在现实世界中: 它们将其安装在一个真实的机械臂和一个拥有 12 根手指的高级机械手上。
    • 神奇之处: 当给机器人布置涉及全新物体的任务时(例如,它从未见过的玩具,或一种奇怪的颜色),UniJEPA 并没有感到困惑。因为它学习的是“抓取”和“移动”的概念,而不仅仅是死记硬背特定的图像,所以它比竞争对手更能处理这些“分布外”(陌生)的情况。

总结

UniJEPA 是一个机器人大脑,它既不只是死记硬背指令,也不只是猜测物理规律。它学会了通过语言理解世界,同时通过运动模拟未来。这种双重方法使其成为一个“通才”——一个能够适应新任务和新物体的机器人,而无需每次都从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →