← 最新论文
🤖 AI

Q-Learning With World Models

该论文提出了 QWM,这是一个将世界模型与标准 Q 学习相结合的框架,通过在想象的轨迹上进行测试时搜索来进行动作选择,从而在机器人操控基准测试中实现了卓越的样本效率和性能,同时通过仅在真实转换上进行训练来避免复合模型偏差。

原作者: Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

通过实践进行学习的机器人正在成为现实,但它们往往需要极其耗费精力的练习才能掌握即使是简单的任务。为了将一个杯子从桌子移动到架子上,机器人可能需要尝试这种动作数千次,在最终成功之前经历无数次失败。这种试错过程是强化学习领域的核心,在该领域中,智能体通过与环境交互并根据其行为获得反馈来进行学习。虽然近期的进展使得这种学习过程变得更快,但最复杂的任务,如组装工具或在杂乱的房间中导航,仍然需要海量的数据。研究人员一直在寻找让这些机器人更高效的方法,希望能减少训练它们所需的时间和能量。一个极具前景的想法是给机器人一个“世界模型”(world model),即一种心理模拟,让它们能够想象如果采取某种行动会发生什么,而不是仅仅盲目地猜测。然而,历史上使用这些心理模拟直接训练机器人一直存在风险;如果机器人的想象力稍有偏差,这些误差就会不断累积,导致机器人学到一个扭曲的现实版本,从而在现实世界中失效。

来自斯坦福大学和北京大学的一个研究小组开发了一种新方法,通过改变机器人使用想象的时机来规避这一危险。他们并不依赖世界模型来教机器人如何移动,而是仅在决策时刻使用它。他们的方法被称为 QWM,它允许机器人从现实世界的交互中学习其核心技能,确保其对物理规律和因果关系的理解始终植根于现实。但是,当机器人面临新情况并必须决定下一步做什么时,它会停下来进行快速的心理模拟。它会为每个潜在行动想象几种可能的未来,预测世界将如何变化,然后选择能带来最佳结果的行动。这个过程类似于国际象棋选手在做出走棋决定前预判几步棋,只不过在这里,机器人是在预判哪种物理动作会产生最高的奖励。

研究人员在具有挑战性的机器人操控任务上测试了该系统,例如举起物体、放置罐头和组装工具。他们将自己的方法与其他顶尖算法进行了比较,这些算法要么在没有任何心理模型的情况下学习,要么完全在模拟世界中学习。结果显示,QWM 的表现显著优于其他方法。它学习得更快,达到高成功率所需的现实世界尝试次数更少,并且在不同任务中表现得更加可靠。至关重要的是,该系统避免了常见的陷阱,即机器人的内部模型变得过于缺陷化,从而教会机器人坏习惯。通过将学习过程与真实数据挂钩,并将想象仅用于在最后一刻优化选择,机器人获得了两全其美之策:现实世界学习的安全性以及预测模型的预见性。

该方法的成功取决于机器人如何构建其心理搜索。当机器人需要行动时,它不仅仅是做一个随机猜测或依赖单一预测。相反,它会生成一棵可能性之树。从当前位置出发,它会考虑几种不同的行动。对于每种行动,它都使用其世界模型来预测世界的下一个状态。然后它重复这一过程,想象如果从那个新状态再采取另一种行动会发生什么,以此类推,从而创建一个潜在未来的分支路径。机器人评估这些路径不仅是看即时结果,而是通过聚合整个想象序列的价值。它将自己对某个行动价值的直接知识与从想象的未来步骤中预测到的奖励结合起来。这使得机器人能够超越当下,选择那些现在看起来可能很困难但随后会导致更好结果的行动。

最重要的发现之一是,即使机器人是通过摄像头观察世界,处理高维视觉信息而非简单的数字时,这种方法依然有效。在这些基于像素的设置中,学习一个完美的世界模型是非常困难的,但研究人员发现,即使是一个并不完美的模型,在进行这种测试时搜索时也能大幅提升性能。机器人不需要成为一个完美的预测者才能获益;它只需要足够好,能够区分一个好的行动和一个坏的行动即可。研究还探讨了机器人应该向未来看多深。看得太远会引入过多的不确定性,因为预测会变得不再可靠;而看得太浅则无法捕捉到行动的长期后果。研究人员找到了一个“甜点区”,即机器人向前看几步,足以进行有效的规划,而不会迷失在预测误差的噪声中。

研究人员还将其方法与其他使用世界模型的方式进行了比较,例如完全在模拟器内训练机器人。他们发现那些方法往往表现挣扎,尤其是在奖励稀疏的任务中(即机器人只有在最后成功时才会获得信号)。在这些情况下,模拟中的误差会迅速累积,使得机器人很难学到任何有用的东西。相比之下,QWM 方法让训练保持在现实基础上。机器人的核心策略和对其价值的理解仅通过现实世界的数据进行更新。世界模型仅仅是一个选择工具,一种用来锐化机器人决策过程的方法,而不会破坏其根本的学习。这种区别被证明至关重要,使该系统能够扩展到复杂的现实机器人问题中,而之前的基于模型的方法在这些问题上往往会失败。

最终,这项工作表明,世界模型的力量并不一定在于取代现实世界,而在于增强我们驾驭现实的能力。通过将想象作为选择的过滤器而非经验的替代品,研究人员创造了一个既具备样本效率又具备鲁棒性的系统。机器人从现实的严酷教训中学习,但利用其思维来避免在错误发生前重蹈覆辙。这种方法为在非结构化环境中部署机器人提供了一条切实可行的路径,在这些环境中,规划和适应的能力与学习能力同样重要。研究结果表明,机器人学习的未来可能不在于构建完美的模拟,而在于构建知道何时信任经验、何时信任想象的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →