NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models
该论文提出了 NoiseGate,这是一种面向世界动作模型的新颖框架,它用可学习的潜在变量门控策略取代了共享的时间步调度,以动态调节用于动作生成的未来观测潜在变量的可靠性,从而提升在多样化机器人操作任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人执行一项任务,比如拿起一个杯子并将其放在桌子上。为此,机器人使用“世界动作模型”(WAM)。将这个模型想象成一位电影导演,他同时编写剧本(机器人的动作)并逐帧构想未来的场景(世界将呈现的样子)。
在传统机器人导演中,有一条严格的规则:电影中的每一帧未来画面必须以完全相同的速度被清晰化。
如果机器人即将抓取杯子,它会构想接下来 10 秒的视频。在旧方法中,模型试图让“手接触杯子”(2 秒后)和“手将杯子放在桌子上”(8 秒后)的图像在同一时刻达到同等清晰度。这就像试图用单个固定焦距旋钮,同时对焦一朵花的特写和远处的山峰。论文指出,这种做法效率低下,因为未来的某些部分对当下的决策比其他部分更为重要。
问题:“一刀切”的时间表
作者将旧方法称为“共享标量时间表”。这就像一个交通信号灯,无论车辆是缓慢行驶的卡车还是快速的跑车,所有汽车都在完全相同的时刻变绿灯。
在机器人的大脑中,这意味着每一个构想的未来时刻都被视为同等可靠。但在现实中,如果机器人对某个棘手动作(例如抓取一个滑腻的物体)感到不确定,那么最好让该特定未来时刻保持“模糊”(不确定)稍长一段时间,同时先清晰化接下来的即时步骤。旧系统强制所有事物要么同时清晰,要么同时模糊,这可能导致机器人做出过度自信、过早的错误决策。
解决方案:NoiseGate
论文引入了NoiseGate,这是一个新系统,充当机器人想象力的智能、自适应编辑器。
NoiseGate 不再使用单一固定时间表,而是学会为每一帧未来画面单独分配独特的“噪声水平”(或模糊水平)。其工作原理如下,使用一个简单的类比:
“信息门”类比:
想象机器人的决策过程是一个挤满人(“动作令牌”)的房间,他们试图决定该做什么。他们正看着一面显示未来可能性的屏幕墙(“视频潜在变量”)。
- 旧方法: 所有屏幕同时被清晰化。如果某块屏幕显示了一幅令人困惑、模糊的未来灾难图像,房间里的人可能会因为被迫过早地看到那幅模糊图像而恐慌,从而做出糟糕的决策。
- NoiseGate 方法: 系统拥有一个守门人(门控策略网络)。这位守门人观察情况并决定:“嘿,显示 2 秒后抓取杯子的屏幕超级重要;让我们立即将其清晰化。但显示 5 秒后放置桌子的屏幕仍然朦胧且不确定;让我们暂时保持其模糊,以免分散我们的注意力。”
通过让那些不太重要或不确定的未来帧保持“噪声”(被屏蔽),守门人防止机器人过度依赖不可靠的预测。只有当信息准备好时,它才允许“可靠”的信息通过大门。
如何训练它
研究人员并没有硬编码这些规则。他们使用了一个三步训练过程:
- 基底: 首先,他们教导机器人的大脑,它可以处理不同帧的不同模糊级别(借鉴了称为“扩散强制”的技术技巧)。
- 守门人: 他们添加了一个小型、轻量级的 AI(门控策略网络),其唯一的工作是决定在每一步多少未来帧需要被清晰化。
- 奖励: 他们没有告诉守门人如何去做。相反,他们让机器人在模拟器中尝试任务。如果机器人成功了(例如,成功放置了杯子),守门人就会获得奖励。如果失败,则没有奖励。随着时间的推移,守门人学会了:“哦,对于这项特定任务,我需要让‘抓取’帧保持模糊更长时间,但对于那个任务,我需要快速将其清晰化。”
结果
在名为RoboTwin的基准测试中(机器人需要在随机、杂乱的环境中操作物体),NoiseGate 的表现优于旧方法。
- 它不仅仅是让机器人在所有方面都略有提升;它特别帮助了那些机器人需要谨慎处理的棘手情况。
- 在一项视觉测试中,旧机器人因为对其模糊的未来预测“过度自信”而过早尝试抓取杯子。NoiseGate 将该预测保持轻微模糊(不确定),直到机器人真正准备好,从而实现了成功的抓取。
总结
NoiseGate 是一种让机器人“想象力”变得灵活的方法。它不再强制每一个未来想法在同一时间变得清晰,而是学会对信息进行门控,将不确定的未来保持模糊直到需要它们,并提前清晰化关键时刻。这防止了机器人基于对未来的过早或不可靠猜测而犯下错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。