想象一下,你正试图教一个机械臂如何折叠毛巾、倾倒咖啡豆或堆叠碗具。传统的方法是让机器人进行尝试、失败、撞到物体,然后再重试,如此循环。这既缓慢、昂贵,有时甚至很危险。
这篇论文介绍了一个名为 WEAVER 的新系统。你可以把 WEAVER 想象成一个机器人的**“超级强力梦境机”**。机器人不再通过在现实世界中撞击物体来学习,而是通过在 WEAVER 创建的高度逼真的模拟环境中进行“做梦”来进行学习。
以下是它的工作原理,分为几个简单的概念:
1. 三大难题(“设计准则”)
对于机器人的梦境机来说,它必须同时擅长三件事。以往的大多数尝试都失败了,因为它们只能做到其中一两点:
- 保真度(“真实感”测试): 梦境必须看起来和感觉起来都与现实完全一致。如果机器人在梦中看到杯子掉落,梦中的杯子必须像真实的杯子一样破碎。
- 一致性(“长电影”测试): 梦境在长时间内必须符合逻辑。如果机器人在梦中拿起一条毛巾,毛巾不应该在五秒钟后神奇地消失或变成一块石头。它需要在一个漫长的“电影”过程中保持连贯。
- 效率(“速度”测试): 梦境必须发生得很快。如果机器人需要用 10 秒钟的“做梦”时间来换取 1 秒钟的动作,那么它就太慢了,无法用于实时规划。
WEAVER 的主张: 它是第一个同时实现真实、长期一致且快速的系统。
2. WEAVER 是如何构建的(“秘密配方”)
作者并没有从零开始发明一种新的大脑,而是从 AI 世界中不同的“厨师”那里汲取了最好的食材,并将它们混合成了一份完美的食谱:
- 借鉴自视频生成器: 他们借鉴了让电影看起来真实且运动平滑的技术。这有助于实现保真度和一致性。
- 借鉴自“潜空间”(Latent)模型: 与其尝试重新绘制视频的每一个像素(这很慢),WEAVER 预测的是下一个瞬间的“本质”或“灵魂”(称为 latents)。这就像导演在绘制分镜脚本而不是拍摄每一帧画面一样,这使得它具有极高的效率。
- 借鉴自记忆专家: 机器人的视野经常会被自己的手遮挡(遮挡现象)。WEAVER 拥有一个特殊的“记忆库”,可以记住机器人手部背后的内容,这样当物体重新出现时,梦境就不会产生混乱。
3. WEAVER 究竟能做什么?
论文测试了 WEAVER 在机器人执行五项复杂任务(如倾倒豆类和折叠毛巾)时的表现。以下是它取得的成果:
“模拟器”(策略评估):
- 类比: 想象一位教练在虚拟健身房观察选手练习,以判断其是否已准备好参加正式比赛。
- 结果: WEAVER 可以预测机器人计划的成功率,与现实世界的对比准确率达 87%。它能在机器人实际移动之前,通过告诉工程师:“不要尝试那个计划,它会失败”来节省时间。
“教练”(策略改进):
- 类比: 机器人在梦境世界中进行数千次练习。教练(WEAVER)会挑选出最好的尝试并说:“像这样去做。”
- 结果: 仅通过在梦境中练习,机器人在现实世界的成功率提升了 38%。它学会了做得更好,而无需在训练阶段接触任何真实物体。
“策略家”(测试时规划):
- 类比: 在下棋走子之前,你会思考:“如果我走这里,他就会走那里……”WEAVER 让机器人在行动前能够瞬间思考许多“如果……会怎样”的情景。
- 结果: 它比之前的系统快 5 到 10 倍。这使得机器人能够做出瞬时的实时决策,例如接住掉落的物体或在移动时调整抓握。
4. 核心结论
论文声称 WEAVER 解决了机器人领域的一个主要瓶颈。以前,你必须在“真实的但缓慢的模拟”或“快速的但虚假的模拟”之间做出选择。WEAVER 打破了这种权衡。
它允许机器人通过先“想象”结果来学习复杂的精细任务(如处理柔软的毛巾或倾倒液体)。这意味着机器人可以变得更聪明、更安全、更高效,而无需在学习过程中在现实世界中撞击数千次。
简而言之: WEAVER 是一个快速、真实且持久的梦境机,它让机器人在动手尝试之前,先在脑海中练习技能。
技术摘要:WEAVER —— 一种有效的机器人操控世界模型
问题陈述
世界模型(World Models, WMs),或称为学习到的模拟器,通过在有限的现实世界交互下实现策略评估、改进和测试时规划,为机器人技术带来了巨大的前景。然而,为了释放这些下游能力,机器人的世界模型必须同时满足三个往往相互冲突的设计需求:
- 保真度(Fidelity): 生成与现实世界结果相关的物理准确预测。
- 一致性(Consistency): 在长预测时界内生成连贯的轨迹,特别是在存在遮挡和多阶段交互的情况下。
- 效率(Efficiency): 生成足够快的预测,以支持实时规划和迭代策略改进。
现有的方法无法同时满足这三个标准。视频生成模型通常缺乏效率;潜在空间模型(例如 JEPA 式模型)可能缺乏用于任意视觉运动策略评估的可解码性;而先前的操控世界模型(如 Ctrl-World)运行速度过慢,无法支持测试时规划。此外,机器人操控引入了独特的复杂性,例如多视角观测、遮挡物体推理,以及对高保真状态预测(而非仅仅是视觉美感)的需求。
方法论:WEAVER 架构
作者提出了 WEIVER(用于具身推理的多视角世界估计),这是一种旨在实现保真度、一致性和效率“三位一体”的多视角世界模型。该架构集成了来自视频生成、潜在世界模型和 JEPA 式架构的设计决策。
核心架构
- 多视角编码: WEAVER 处理多个摄像头视角(例如手腕相机和外部相机)以及本体感受状态。它使用预训练的 Stable Diffusion 3 VAE 编码器将图像补丁(patches)和本体感受标记(tokens)映射到潜在空间。
- 潜在动力学模型: 核心预测器是一个 2D Transformer,它根据以下条件预测未来的潜在状态 (z^t):
- 稀疏记忆(Sparse Memory): 由每隔 k 个先前的潜在状态组成的长期上下文 (zmem)。
- 短期历史(Short-Term History): 捕捉即时动作后果的近期潜在状态 (zhist)。
- 动作计划(Action Plan): 未来动作的一个块(chunk)(at)。
- 预测目标:
- 潜在预测: 通过 流匹配(Flow Matching) 进行训练以预测未来的潜在状态。为了增强长时界一致性,该模型采用了 扩散强迫(Diffusion Forcing),即在未来的不同时间步独立采样噪声水平。
- 本体感受预测: 与以往的一些工作不同,WEAVER 显式地预测未来的本体感受状态(关节位置和夹持器宽度),这对于可变形物体操控至关重要。
- 奖励与评论家头(Reward & Critic Heads): 一个轻量级的奖励头 (R) 和评论家网络 (V) 直接作用于潜在状态和语言指令。这使得无需解码图像或查询外部视觉语言模型(VLM)即可对动作块进行高效评分。
训练与推理优化
- 训练: 模型在 DROID 数据集上进行预训练,并在特定任务数据上进行微调。它利用 SPRINT 模块 激进地丢弃补丁标记,从而提高效率。
- 推理加速:
- KV 缓存(KV Caching): 应用于去噪步骤中的记忆和历史标记,以降低前向传播成本。
- 整流流(Rectified Flow): 模型通过整流流目标进行后训练,以实现仅需少量函数评估次数(低 NFE)的高质量生成。
- 渐进式噪声(Progressive Noise): 使用余弦噪声调度将更多预算分配给低噪声区域,从而增强保真度。
下游应用
WEAVER 被设计用于支持三个特定的下游任务:
- 策略评估: 在世界模型内开环执行记录的真实世界轨迹,以预测成功率。
- 策略改进: 采样动作块,在世界模型中进行模拟,并筛选出具有高优势(high-advantage)的轨迹,将其蒸馏到基础策略 (π0.5) 中。
- 测试时规划: 使用“Best-of-N”方法,采样多个动作块,在其中进行想象,并通过潜在奖励/评论家头进行评估,以选择执行的最佳动作。
关键结果
作者在五个机器人操控任务(叠碗、插袋、插记号笔、插毛巾、倒豆子)上使用 Franka Emika Panda 机器人对 WEAVER 进行了评估。
- 保真度 vs. 效率: WEAVER 帕累托支配(Pareto-dominates) 了领先的基准模型 Ctrl-World。它实现了更低的 FID 和 FVD 分数(表明更高的视觉保真度),同时显著减少了推理时间(例如,对于 10 秒的展开,WEAVER 为 10–30 秒,而 Ctrl-World 为 30–50 秒)。即使在低 NFE(8–16)下,WEAVER 仍能保持高质量,而 Ctrl-World 的质量会随 NFE 降低而显著下降。
- 长时界一致性: WEIVER 在长时界展开(长达 10 秒)中表现出卓越的性能,保持了较低的误差率,特别是在涉及遮挡和可变形物体的任务中。
- 策略评估: 当用于评估策略时,WEAVER-FT(微调版)与现实世界成功率之间的皮尔逊相关系数达到 ρ=0.870,显著优于预训练的基准模型。
- 策略改进: 使用由 WEAVER 生成的合成数据(无需任何现实世界交互)对 π0.5 基础模型进行微调,使现实世界的成功率提高了 38%。结合合成数据和现实数据进行微调,比仅使用现实数据进行微调又提升了 11%。
- 测试时规划: WEAVER 实现的测试时规划比 Ctrl-World 快 5–10 倍。这种规划方法通过选择高优势动作块,将基础策略的现实世界成功率提高了 14%(在特定任务上高达 20%)。
- 分布外(OOD)鲁棒性: 得益于使用预训练编码器而非从头学习,WEAVER 在 OOD 任务数据集上保持了强大的性能。
重要性与主张
论文声称,WEAVER 通过成功地将高保真度、长时界一致性和推理效率统一在单一的机器人操控世界模型中,代表了向前迈出的重要一步。
- 解锁下游能力: 作者认为,以往的世界模型受限于权衡(例如,高保真度但推理慢),阻碍了其在实时规划或高效策略改进中的应用。WEAVER 能够同时满足这三个需求,从而解锁了这些此前难以实现的领域。
- 数据效率: 结果表明,高保真度的世界模型生成的合成数据在策略改进方面几乎可以与昂贵的现实世界数据相媲美,这可能减少对大规模现实世界交互的依赖。
- 实用性: 通过实现与实时约束兼容的推理速度(通过整流流和 KV 缓存),WEAVER 使基于世界模型的测试时规划成为物理机器人的现实可能,而不仅仅是一个理论概念。
作者承认了一些局限性,包括部分可观测性(缺乏触觉感知)、复杂可变形动力学的挑战,以及目前由于延迟导致的短时界规划限制。然而,他们认为 WEAVER 为可扩展、高效且有效的机器人世界建模建立了新的基准。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。