← 最新论文
💻 computer science

Do Better Imagined Rollouts Mean Better Robot Control? A Controlled Study of World-Model Evaluation Under Feedback

本文表明,对于依赖反馈的机器人应用而言,使用开环展开(open-loop rollouts)进行的离线预测模型评估,其可靠性低于轨迹重放(trajectory replay)或闭环测试,因为除非评估调度明确地镜像了系统的测量-更新模式,否则这些评估往往无法与实际控制性能相关联。

原作者: Dharini Raghavan, Amritpal Singh

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Dharini Raghavan, Amritpal Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现实世界中移动的机器人依赖于其眼睛、轮子和大脑之间持续且无形的对话。为了导航,机器人必须首先猜测自己在哪里,然后决定如何移动,最后检查周围环境以确认这个猜测是否正确。这个循环周而复始地发生,每小时数千次。如果机器人的内部猜测稍有偏差,它所做的修正可能会使其偏离航线。如果猜测的方式不同,机器人可能会完美地自我修正。多年来,工程师们一直试图通过在安静、受控的环境中测试机器人来判断其“大脑”的好坏,在这种环境下,机器人会在没有任何新信息的情况下预测未来。他们要求模型想象一条前进的路径,并观察其偏差有多远。但本文提出了一个简单而关键的问题:在一个真空中擅长想象未来的能力,是否真的意味着机器人在传感器不断更新视野时,能够很好地驾驶汽车或穿行于森林之中?

佐治亚理工学院和埃默里大学的研究人员通过构建一个带有小型轮式机器人的受控实验来回答这个问题。他们给机器人设定了一条特定的路径,轮子有时会打滑,陀螺仪也会发生轻微的漂移。为了帮助机器人了解自己的位置,他们在房间里放置了已知的地标,机器人可以偶尔看到这些地标,但无法持续观察。机器人必须利用其轮式传感器在这些观测点之间猜测自己的位置。团队测试了六种不同的机器人位置估计方法。其中一些纯粹依赖数学和轮式数据,另一些则利用学习到的模式来修正这些数学模型的误差。随后,他们对比了三种不同的测试方式。首先,他们回放了一段记录过的旅程,其中机器人按照过去发生的情况看到了每一个地标。第二,他们要求机器人不看任何地标,仅依靠其内部猜测,去想象一段包含二十个步骤的未来旅程。第三,他们让机器人在实时状态下行驶,此时机器人的猜测直接控制轮子的移动,并且每当有地标更新可用时,它就会接收到更新。

结果揭示了一个令人惊讶的脱节。当研究人员观察机器人在实时驾驶测试中的表现时,最能预测胜者的指标是那种让机器人回放包含所有地标更新的过去旅程的方法。这种方法在大多数情况下都能正确识别出表现最好的机器人。然而,流行的测试方法——即要求机器人进行一段没有新信息的长达二十步的“想象旅程”——在预测现实世界的获胜者方面表现得很差。事实上,这种“想象展开”(imagined rollout)的方法在二十四个不同的测试场景中,有十八次都选错了表现最好的机器人。论文表明,如果一个模型在从未受到纠正的情况下,能够非常出色地预测机器人的位置,但这并不意味着该技能可以转化为一个在不断被新传感器数据修正的机器人。在真空中精准漂移的能力,并不等同于在有帮助的情况下进行导航的能力。

研究深入探讨了发生这种情况的原因。研究人员意识到,问题不仅仅在于想象旅程的长度,还在于在旅程期间缺乏更新。当他们用一段长距离的想象路径进行测试,但允许机器人在每一步都接收到一个传感器更新时,测试结果再次变得准确。只有当他们将长时预测与完全缺乏更新相结合时,测试才会失效。这表明,对于运行在反馈回路中的机器人(即行动、感知并修正的机器人),我们测试它们的方式必须模拟它们的实际工作方式。如果机器人在现实世界中频繁获得更新,那么通过要求它在没有任何帮助的情况下猜测很长时间来进行测试,是具有误导性的。

团队还探索了是否可以通过训练让机器人更好地进行这些长时间、无修正的猜测。他们训练了一些基于学习的机器人,使其能够处理更长时间的无地标观测。在某些情况下,这确实有所帮助。对于那些拥有强大数学基础作为起点的机器人,通过训练来处理长间隔显著降低了它们的误差,将其偏离路径的距离从超过一点五米缩减到了仅略高于一米。然而,这种进步并非普遍现象。对于那些起始数学基础较弱的机器人,训练它们处理长间隔不仅没有帮助,在某些情况下甚至使它们变得更糟。这一发现表明,仅仅让机器人接触更困难的训练条件并不保证它会变得更鲁棒。机器人“大脑”的底层结构与它接受的训练同样重要。

最终,论文指出,我们需要改变评估机器人预测模型的方式。我们不能仅仅测量一个模型在没有数据的情况下经过长时间运行后会产生多大的偏差。相反,我们必须测量模型在它现实世界中将面临的具体更新频率下的表现。如果一个机器人每秒钟都会收到一张摄像图像或一个传感器读数,那么它的评估应当包含每秒一次的这些更新。如果我们通过要求它在没有任何帮助的情况下猜测一分钟来测试它,我们测试的是一种完全不同的技能。最有效的基准应该是反映机器人实际生活节奏的基准:移动的行为、新信息的到达以及路径的修正。通过将我们的测试与机器人的实际运作方式对齐,我们可以选择合适的工具,并制造出真正理解其所处运动世界的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →