← 最新论文
💻 computer science

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

World-VLA-Loop 引入了一种闭环框架,该框架利用精心策划的成功与近成功轨迹数据集,迭代地协同训练一个具备状态感知能力的视频世界模型与一个视觉 - 语言 - 动作(VLA)策略,从而在虚拟环境中实现高效的强化学习,同时最大限度地减少对昂贵现实世界交互的依赖。

原作者: Xiaokang Liu, Zechen Bai, Hai Ci, Kevin Yuchen Ma, Mike Zheng Shou

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaokang Liu, Zechen Bai, Hai Ci, Kevin Yuchen Ma, Mike Zheng Shou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机械臂拿起杯子并将其移动到桌子上。旧的方法是雇佣人类反复进行数千次物理演示,或者让机器人在现实世界中尝试,打碎杯子,然后重新开始。这种方法昂贵、缓慢且危险。

本文介绍了一种名为World-VLA-Loop的新系统。它就像一个“梦境模拟器”,与机器人共同学习,创建一个完美的训练环境,在这里犯错不会造成任何代价。

以下是其工作原理,分解为简单的概念:

1. 问题:“白日做梦”的模拟器

科学家们曾尝试构建类似电子游戏的模拟器,让机器人进行练习。然而,目前的模拟器就像糟糕的白日做梦者。如果你告诉机器人“将杯子稍微向左移动”,即使机器人实际上有微小的偏差,模拟器也可能想象杯子完美地移动了。

  • 类比:想象一款电子游戏,如果你跳空了,游戏仍然显示你安全落地。如果你在那样的游戏中训练你的角色,他们在现实世界中会失败,因为他们从未学会“失误”实际上是什么样子的。
  • 论文发现:现有的模拟器过于乐观。即使机器人犯了一个小错误,它们也会“幻觉”出成功,这使得它们无法用于教导机器人如何从错误中恢复。

2. 解决方案 A:“险些成功”的训练手册(SANS)

为了修复模拟器,作者意识到他们需要向它展示“险些成功”的样子。他们创建了一个名为SANS(成功与近成功)的特殊数据集。

  • 类比:与其只向学生展示完美的考试答案,不如也展示那些答案几乎正确但因微小计算错误而失分的例子。这教会学生辨别“完美”与“几乎”之间的区别。
  • 他们做了什么:他们收集了机器人成功抓取物体的视频,同时也收集了机器人几乎抓到但仅差一毫米而失败的视频。他们将这种“险些成功”的数据输入模拟器,使其学会准确预测失败。

3. 解决方案 B:“二合一”的大脑

通常,模拟器只预测下一帧视频会是什么样子,而另一个独立的计算机程序则猜测机器人是否成功。作者将这两者结合成了一个大脑。

  • 类比:想象一位电影导演,他不仅执导场景,还在拍摄的同时立即写下评论(“这个场景成功了”或“这个场景失败了”)。因为导演在制作电影同时也在评判它,所以电影变得更加逼真,评判也变得更加准确。
  • 他们做了什么:他们构建了一个模型,能够同时预测未来的视频帧和“奖励分数”(成功/失败)。这有助于模拟器更好地理解机器人动作的物理因果关系。

4. 魔法循环:协同进化

这是最重要的部分。通常,你先训练一次模拟器,然后训练机器人,之后它们不再互相交流。本文创建了一个闭环。

  • 类比:想象一位舞蹈教练和一名学生。
    1. 教练(模拟器)在虚拟房间里教学生(机器人)跳舞。
    2. 学生练习并变得更好,但犯了一些以前从未犯过的新类型的错误。
    3. 学生记录下这些新错误并将其发回给教练。
    4. 教练更新教学计划,将这些新错误纳入其中。
    5. 现在教练变得更好了,他们再次教学生。
    6. 他们重复这个循环,共同变得越来越好。
  • 他们做了什么:机器人在模拟器中练习。当机器人进步时,它会生成关于其运动方式的新数据。这些新数据用于更新模拟器,使其在下一轮训练中更加准确。

结果

论文在计算机模拟和真实物理机器人上测试了该系统。

  • 在虚拟世界中:由于模拟器诚实地对待失败,机器人学习执行任务的速度更快、更准确。
  • 在现实世界中:当他们把训练好的机器人放入真实实验室时,与未通过此循环训练的机器人相比,它在某项任务上的成功率提高了36.7%,在另一项任务上提高了26.6%。

简而言之:本文构建了一个“智能模拟器”,它从自身的错误和机器人的错误中学习,创造了一个模拟器和机器人共同变得更聪明的循环,通过减少昂贵的现实世界试错需求,节省了时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →