← 最新论文
💻 computer science

Sandwich-Residuals: Parameter-Efficient Test-time Adaptation of World Models

该论文介绍了 Sandwich-Residuals,一种针对潜在世界模型(latent world models)的参数高效型测试时自适应方法,该方法通过冻结预训练权重并仅在线学习基于自监督预测误差的小型残差修正,在分布偏移下显著提高了成功率,同时比现有方法减少了 97%–99% 的参数量。

原作者: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够自主规划动作的机器人通常依赖于一个关于世界运作方式的内部地图。想象一下,一个机械臂正试图将一个方块推过桌面。智能机器人并不仅仅是即时反应它所看到的一切,而是构建一个心理模型,预测如果它以某种方式移动手臂会发生什么。它学会了说:“如果我在这里推,方块就会向那里滑动。”这种心理模型通常被称为“世界模型”(world model),它允许机器人在实际移动之前,在脑海中模拟未来的动作,从而帮助它避免错误并高效地达成目标。这些模型通常是在受控环境中训练的,例如物理规律一致、光照完美的计算机模拟环境。然而,现实世界是混乱的。当一个在模拟器中训练出的机器人被置于一个光照不同或桌面变得湿滑的新房间时,机器人的内部地图可能会出错。它所做的预测不再符合现实,导致机器人无法完成任务。多年来,解决这一问题的标准方案是让机器人在工作时重新训练其大脑的一部分,调整数百万个内部设置以适应新环境。这个过程沉重、缓慢,且要求机器人不断重写它对事物运动方式的理解。

一组研究人员发现了一种更轻量化的修复方法。他们发现,与其要求机器人重写其整个内部地图,不如仅仅调整机器人读取输入和写入输出的边缘部分。在一项新的研究中,研究人员引入了一种名为“三明治残差”(Sandwich-Residuals)的方法。他们采用了一个已经学会如何在模拟环境中移动的机器人,并完全冻结了它的内部大脑,防止其数百万个已学习的设置发生任何变化。然后,他们在上面添加了两个非常小的、具有灵活性的软件层:一个用于微调进入机器人大脑的信息,另一个用于微调输出的预测。这两个小层就像三明治的馅料一样,包裹在冻结的核心周围。当机器人尝试移动并犯错时,这些小层会学习如何实时纠正错误,而无需触碰内部沉重的预训练大脑。机器人学会了说:“我的大脑认为方块会去这里,但我的新修正层知道地板很滑,所以我会调整计划,将其发送到那里。”

研究人员在各种具有挑战性的任务上测试了这个想法,包括在迷宫中导航以及推动不同形状的物体。他们将这种方法与标准方法(即更新机器人内部大脑的方法)以及不做任何调整的机器人进行了对比。在二十一个不同的测试场景中,使用这种新“三明治”方法的机器人成功达成目标的概率为65%。这比未进行调整的机器人(成功率仅为49%)有了显著提升。更重要的是,新方法的效果几乎与通过重写大脑进行更新的标准方法(成功率约为68%)不相上下。关键区别在于效率。标准方法必须更新近一千万个设置来适应新环境,而新方法仅需调整约十万个设置。这意味着新方法仅使用旧方法所需计算能力的不到3%,却能达到几乎相同的成功水平。

研究还观察了当机器人面临多个问题同时出现时的情况,例如光照变化与物体重量变化的结合。在这些困难的“复合型”情境中,新方法的表现更为出色。它比未调整的机器人成功率高出1.9倍,同时与那种沉重的大脑更新法同样有效。研究人员发现,所需的修正类型取决于具体的问题。当机器人在迷宫中导航且运动物理特性发生变化时,负责在预测做出后进行修正的层承担了大部分工作;而当机器人在推动物体且控制器变得更加灵敏时,调整机器人输入指令的层则更为重要。通过保留这两个层,该系统可以处理各种意想不到的变化,而无需预先知道会遇到哪种麻烦。

为了证明这个想法不仅适用于简单的迷宫游戏,研究人员还将其应用于一个更复杂的任务,即涉及在三维空间内移动立方体的现实风格机械臂。他们为此使用了不同类型的机器人大脑,这种大脑依赖视觉模式而非之前的设计。即使采用了不同的架构,同样的“三明治”原则依然奏效。机器人能够适应光照变化、相机角度变化以及自身电机的强度变化。在每一个环境条件发生变化的测试案例中,新方法都比不做任何调整表现得更好,而其他方法有时甚至会让机器人的表现变差。这表明,适应能力并不一定需要机器人从根本上改变它对世界的理解。有时,仅仅添加一个灵活的过滤器,帮助机器人正确解读当前情况就足够了。

这些发现表明,我们未来构建机器人的方式可能会发生转变。长期以来,人们一直假设如果机器人的环境发生了变化,它的物理模型必须被重写以匹配新环境。本文表明,这种假设并不总是必要的。如果机器人的核心世界观仍然基本正确,它只需学习如何调整其输入和输出以适应新的现实即可。这种方法不仅更快、更便宜,而且更稳定,因为它避免了机器人在学习新知识时忘记已有知识的风险。虽然实验是在计算机模拟中进行的,但结果指向了一个未来:机器人可以进入新环境并立即开始工作,利用微小、高效的调整来应对现实世界的突发状况,而无需对其智能进行大规模的重构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →