← 最新论文
💬 NLP

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

本文介绍了世界评论家模型(World Critic Model, WCM),这是一种利用轻量级 LeJEPA 架构来共同预测未来潜状态并估计价值的新颖视觉-语言-动作强化学习方法,旨在克服单帧评论家的局限性,并在多种机器人操控任务中实现了最先进的性能和泛化能力。

原作者: Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做三明治。你给它看一张食材的照片,并说:“做一个三明治。”一个简单的机器人可能会盯着这张单张照片,猜测该做什么,然后尝试去抓面包。但问题在于:机器人看不见未来。它不知道面包是否正从桌子上滑落,也不知道刀具是否即将打滑,或者烤面包机是否即将弹出。在现实世界中,机器人就像是在雾气弥漫的房间里行走的人;它们只能看到当下这一瞬间的微小切片。这是一个被称为“部分可观测性”(partial observability)的问题。为了做出正确的决策,机器人需要记住一秒钟前发生了什么,并预测一秒钟后会发生什么。

长期以来,科学家们一直试图使用一种称为强化学习(Reinforcement Learning, RL)的方法来教导机器人。你可以把它想象成一个电子游戏,机器人在其中尝试不同的动作,做得好就得分,失败了就扣分。为了快速学习,机器人需要一个“教练”(称为评论家/critic)来观察游戏状态并说:“嘿,那步走得好!”或者“坏主意!”问题的关键在于,大多数这类教练仅仅是在观察游戏的一个静止帧。它们就像是一个只通过看一张球员照片就进行指导的教练,忽略了奔跑的惯性或球的速度。这篇题为《WCM:用于视觉-语言-动作强化学习的世界评论家模型》(WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning)的论文,正是针对这一问题展开研究的。它提出了一种新型的教练,这个教练不仅观察现在,还会通过想象未来来理解过去。

问题所在:患有失忆症的教练

在机器人学习领域,存在着一种被称为视觉-语言-动作(Vision-Language-Action, VLA)的模型。这些是机器人的大脑,让它们能看到图像,理解像“拿起杯子”这样的句子,然后移动手臂。为了让这些大脑变得更出色,研究人员使用强化学习来对其进行微调。但为了进行有效的训练,他们需要一个“评论家”(critic)模型。这个评论家充当计分员的角色,评估当前情况的好坏。

旧的方法是只给评论家输入一张图像(或一叠几张图像的堆叠),然后问它:“这个情况有多好?”论文指出,这是一种根本性的错误。这就像是通过看一张球员的快照来评判一场足球赛。你会错过球的速度、风向,以及一名球员是否即将绊倒。因为机器人无法看到一切(比如桌子的摩擦力或移动物体的精确动量),单张快照往往具有误导性。

作者发现,仅仅给评论家提供更多的历史信息——比如给它看一段包含最后五帧视频的过程——效果也并不理想。如果你只是给一个标准的评论家一段长视频,并要求它预测分数,它往往会将这段视频视为一大堆静态像素,而不是一个正在展开的故事。它无法学会世界是如何随时间变化的。论文认为其根源在于,评论家并没有试图理解情境中的“物理学”;它只是在通过记忆模式来猜测一个数字。

解决方案:“世界”评论家

于是,**世界评论家模型(World Critic Model, WCM)**应运而生。作者构建了一种新型教练,它能同时完成两件事,而不是仅仅做一件:

  1. 它预测分数: 像普通的评论家一样,它评估当前情况的好坏。
  2. 它预测未来: 它还会尝试预测机器人的“内部地图”(潜状态)在下一时刻会变成什么样。

你可以把 WCM 想象成一名棋手,他不仅看着棋盘说:“我正在领先。”相反,他会不断进行心理模拟:“如果我走这里,对手就会走那里,然后我会处于这个新位置。”通过迫使模型预测接下来会发生什么,它被迫学习游戏的规则——即世界的动力学。它会学习到,如果一个杯子正在滑动,那么它很快就会从边缘掉下去。这种“未来预测”起到了超级教练的作用,帮助模型理解机器人运动背后的故事,而不仅仅是当前的帧。

该论文使用了一种名为 LeJEPA 的轻量级架构来实现这一点。它足够高效,可以从头开始训练,并能无缝融入现有的机器人训练流程中。

研究发现:从“零”到“英雄”

研究人员在大规模范围内测试了这个新的世界评论家。他们在四个不同的模拟基准测试中进行了 149 项不同任务 的实验。这些任务涵盖了从简单的“拾取与放置”游戏到复杂的、长时程挑战,如折叠毛巾或清理灶台。

结果令人瞩目。在模拟环境中,WCM 始终优于以往所有的模型,包括那些现有的最佳“教练”。

  • 分布内(In-Distribution, IND): 当机器人面对曾经处理过的任务时,WCM 显著提高了成功率。例如,在使用某个特定机器人模型(OpenVLA-OFT)时,经过 WCM 训练后,成功率从微不足道的 0.78%(基本上每次都失败)跃升至 98.7%。这是一个巨大的飞跃。
  • 分布外(Out-of-Distribution, OOD): 这是真正的考验。机器人能否处理一张新桌子、不同的光照条件或略有不同的物体?WCM 在这方面的泛化能力比旧方法强得多。它不仅仅是记住了训练数据,而是学会了物体如何移动和交互的底层规则。

论文还将这一技术应用到了现实世界。他们使用物理机械臂(WidowX-250S)在 七个现实任务 中测试了 WCM。这些任务包括一些棘手的活计,如从旋转传送带上抓取寿司、折叠毛巾以及清洁灶台。

  • 在现实世界中,由于环境混乱且不可预测,WCM 依然胜出。它帮助机器人比标准方法更平稳、更成功地完成任务。
  • 例如,在“旋转寿司”任务中,标准方法很难在寿司移开之前抓到它。WCM 帮助机器人完美地把握了抓取时机,实现了 50 次尝试中 22 次成功,而基准方法的成功率要低得多。

为什么这很重要

论文认为,提升机器人水平的关键不在于仅仅给它们更多的数据或更大的大脑,而在于给它们一种更好的理解时间的方式。通过教导机器人的“教练”去预测未来,机器人学会了将世界视为一个流动的、连续的故事,而不是一系列断开的相片。

作者谨慎地指出,虽然研究结果令人印象深刻,但它们是基于特定的模拟和有限的现实任务。他们并未声称解决了所有的机器人问题,但他们确实证明了,在评论家中加入一个“世界模型”是让机器人变得更聪明、更快、更具适应性的强大途径。无论是折叠衣物还是捡起寿司,机器人学习的未来可能正取决于它们如何去想象接下来会发生什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →