想象一下,你正在教一个机器人完成一项复杂的任务,比如拿起杯子并将水倒入玻璃杯。在过去,机器人通常必须逐一思考每一个微小的动作(举起、移动、倾斜、倾倒),这既缓慢又耗费计算资源。
为了提高速度,现代机器人使用了一种技巧,叫做**“动作分块”(Action Chunking)**。机器人不再是一步一步地规划,而是同时规划一整个“块”的动作——比如,将接下来的 10 秒钟运动作为一个整体进行思考。这就像人类决定“我要走到厨房,打开冰箱,然后拿起牛奶盒”,这是一个大的思维模块,而不是去计算每一步的肌肉抽动。
问题:“开环”(Open-Loop)陷阱
论文指出这种方法的一个缺陷。一旦机器人致力于执行这个 10 秒钟的“块”,它通常就会盲目地执行,就像在轨道上行驶的火车一样。它不会观察周围是否发生了变化。
- 类比: 想象你在开车时戴着眼罩,仅仅信任你的 GPS 告诉你“5 英里后左转”。如果一块巨石突然挡在你面前,或者道路发生了偏移,你会因为困在自己的“块”中而继续盲目地驶向那块巨石。在机器人领域,这被称为随机动力学(stochastic dynamics)——即不可预测的变化,例如湿滑的地板、摇晃的机器人手臂或物体移动速度超出预期。
解决方案:DREAM-Chunk
作者提出了一种名为 DREAM-Chunk 的新方法。它不需要重新训练机器人的主脑。相反,它添加了一个轻量级的“梦想家”(dreamer)模块,与主脑协同工作。
以下是它的工作原理,使用了一个创意类比:
“做梦”类比
想象你是船长,你的主脑(VLA 策略)给了你一份未来一小时航行的地图。但大海风暴肆虐,变幻莫测。
- 主脑: 你的主脑说:“好的,这是计划:先左转,然后直行,最后右转。”
- 梦想家: 你并不只是盲目地遵循这一个计划,你的“梦想家”(轻量级世界模型)会基于这一个计划快速模拟多种可能的未来。
- 梦境 A: “如果我们左转,但波浪把我们推向了右边,我们会到达这里。”
- 梦境 B: “如果我们左转,但风力更强,我们会到达那里。”
- 梦境 C: “如果我们左转,但洋流很奇怪,我们会到达那边。”
- 现实检查: 当船实际移动时,你会看向窗外(机器人的摄像头)来观察自己实际所处的位置。
- 切换: 你将你的实际位置与这些“梦境”进行比较。
- 如果你实际处于梦境 B 所预测的位置,你会立即切换路径,开始遵循梦境 B 剩余的部分。
- 如果船被波浪推离了航道,你不会等到下一个小时才制定新计划。你会立即切换到那个与当前现实相匹配的“梦境”中。
论文核心要点
- 无需重新训练: 机器人的主脑保持完全不变。DREAM-Chunk 就像是一个“智能叠加层”,在测试阶段(即机器人实际工作时)运行。
- 速度极快: “做梦”部分非常轻量化。主脑很重且缓慢(像超级计算机),但梦想家就像一个快速的素描画家。它可以在毫秒内模拟出未来。
- 需要高质量的训练数据: 该方法在专家做出错误并进行纠正的示例数据下表现最好。如果训练数据只展示完美的直线运动,那么当事情出错时,机器人将没有任何“备份梦境”可以切换。
- 现实世界的成功应用: 作者在真实机器人(如 Franka Panda 手臂和 SO-101 手臂)上测试了该方法,执行的任务包括:
- 插上 USB 线(接口位置可能略有偏差)。
- 接住滚动的球(球的速度是不可预测的)。
- 将罐子放入一个正在摇晃的箱子里。
- 结果: 在一次测试中,当环境发生剧烈晃动时,一个原本成功率仅为 10%(失败 90%)的机器人,在使用 DREAM-Chunk 后,成功率跃升至 65%。
总结
DREAM-Chunk 就像是给了机器人一个“水晶球”,让它能够快速想象出其当前计划可能演变的几种不同方式。当现实世界变得混乱时,机器人会立即切换到与现实相匹配的“梦境”中,这使得它在无需从头开始重新训练的情况下,变得更加鲁棒且具有反应能力。
技术摘要:DREAM-Chunk
问题陈述
动作分块(Action chunking)已成为视觉-语言-动作(VLA)模型的标准接口,允许低频策略推理驱动高频机器人执行。然而,一旦提交一个动作块,机器人基本上是以开环方式执行该块。这种方法在随机动力学(stochastic dynamics)、硬件执行误差以及部分可观测状态下是非常脆弱的。由于策略在下一次推理步骤之前无法对偏差做出反应,误差会在执行过程中累积。虽然最近的研究尝试通过频繁重规划、轻量级架构修改或自适应时界来提高反应能力,但这些方法往往面临计算成本高昂、浪费长程计划或限制大型模型扩展潜力的问题。
方法论:DREAM-Chunk
作者提出了 DREAM-Chunk(基于梦境状态的反应式动作匹配动作分块技术),这是一种测试时缩放(test-time scaling)框架,旨在增强现有动作分块策略的反应性,而无需修改或微调基础 VLA 模型。
核心机制
DREAM-Chunk 通过一个**轻量级的辅助潜空间世界模型(auxiliary latent world model)**来增强固定的分块 VLA 策略。其过程如下:
- 批量推理: 在每个重规划步骤 t,固定策略 π 从当前观测 ot 中采样 N 个候选动作块(A(1),…,A(N))。
- 并行潜空间展开(Parallel Latent Rollouts): 一个轻量级世界模型(由编码器 e 和潜空间动力学模型 f 组成)并行地预测所有 N 个候选动作块的未来潜状态。编码器将观测映射到潜空间 st=e(ot),动力学模型预测 st+τ=f(st+τ−1,at+τ−1)。
- 反应式匹配: 在执行期间,随着机器人在每个阶段 τ 接收到新的观测 ot+τ,这些观测被编码到潜空间中。DREAM-Chunk 将观测到的潜状态与所有候选动作块的**相位对齐梦境状态(phase-aligned dreamed states)**进行比较。
- 选择: 系统选择与观测状态匹配度最高(即最小化潜空间中的欧几里得距离)的候选动作块中的动作。这使得机器人在当前轨迹因随机性而发生偏差时,能够切换到另一个候选动作块,从而有效地在执行时界内实现反应式修正。
关键设计特性
- 策略无关性: 基础 VLA 保持冻结;该方法仅需要采样多个动作块并运行一个轻量级世界模型。
- 潜空间匹配: 该方法并非在每一步都重新进行 VLA 推理(这在计算上非常昂贵),而是利用世界模型来“梦见”未来并将其与现实进行匹配。
- 异步支持: 该方法支持异步推理,允许在执行当前批次动作块的同时,采样下一批次的动作块。
核心贡献
- 框架提出: 引入了 DREAM-Chunk,这是一种测试时缩放方法,能够在不微调基础策略的情况下,提高在随机动力学下的反应性。
- 仿真分析: 在 Kinetix 基准测试上的实证验证表明:
- 性能随候选样本量(N)的增大而提升。
- 其有效性高度依赖于演示数据中是否存在纠错行为(即策略必须能够采样到有用的恢复选项)。
- 潜空间表示的选择(例如 RSSM、LEWM、EB-JEPA)显著影响性能,支持可靠相位对齐匹配的模型表现更优。
- 硬件验证: 在两个机器人平台(SO-101 和 Franka Panda)和两种 VLA 策略(SmolVLA 和 π0.5)上,针对四个真实世界的操纵任务进行了部署。该方法成功缓解了硬件执行误差、部分可观测性和外部扰动。
实验结果
仿真 (Kinetix)
- 随机性: 随着动作噪声增加,DREAM-Chunk 的表现优于基线模型(Naive Asynchronous, BID, RTC, Adaptive Chunking)。虽然基线模型侧重于跨块一致性,但在轨迹偏离标称展开时,DREAM-Chunk 的块内反应性变得至关重要。
- 样本缩放: 增加采样的动作块数量(N)会减小预测潜状态与实际状态之间的距离,从而提高对可能未来的覆盖范围。
- 纠错数据: 只有当底层策略是在包含纠错行为(例如使用更高动作噪声训练的专家)的演示数据上训练时,该方法才能实现有效的缩放。
硬件部署
- 任务: 插拔 USB、捕捉移动物体、捡取/插入玩具、以及在扰动下插入罐头。
- 性能增益:
- SmolVLA (SO-101): 在所有任务中提高了成功率(例如,USB 任务:75% → 95%;抓取移动物体:60% → 80%)。
- π0.5 (Franka): 在存在外部扰动的精确插入任务中,DREAM-Chunk 将开环策略的成功率从 10% 提高到了 65%(当 N=5 时)。
- 延迟: 世界模型的开销极小(毫秒级)。对于 N=20,世界模型组件(编码器、预测器、匹配)带来的额外延迟约为 4.8 毫秒,而策略推理占据了总耗时的主要部分。
意义与主张
论文声称 DREAM-Chunk 通过整合 VLA 和世界模型研究,为实际可部署的具身智能提供了一条模块化路径。其主要意义在于:
- 无需重训即可实现反应性: 它使长程分块执行能够对随机动力学做出反应,而无需承担频繁进行 VLA 重推理的计算成本,也无需进行复杂的模型微调。
- 利用现有数据: 它强调了生成式策略的鲁棒性通常取决于能否采样到训练分布中存在的局部纠错变体,而不是在测试时学习全新的高层策略。
- 可扩展性: 通过将“规划”备选方案的任务交给轻量级世界模型,该方法使大型 VLA 在保持实时控制实用性的同时,获得了基于模型的规划所具备的鲁棒性。
作者总结道,轻量级预测模型可以作为实用的反应式模块,显著提高动作分块策略在存在执行噪声、部分可观测性和外部扰动的环境中的成功率。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。