← 最新论文
🤖 machine learning

Inverting the Bellman Equation: From QQ-Values to World Models

本文通过证明在多样化奖励函数上训练的基于价值(value-based)智能体隐式地编码了一个独特的生成世界模型,且该模型可以通过一种被称为 PP-learning 的新方法进行显式提取以实现在分布外任务上的强泛化能力,从而挑战了基于模型(model-based)与无模型(model-free)强化学习之间的传统分离。

原作者: Alistair Letcher, Mattie Fellows, Alexander D. Goldie, Jonathan Richens, Jakob N. Foerster, Oliver Richardson

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Alistair Letcher, Mattie Fellows, Alexander D. Goldie, Jonathan Richens, Jakob N. Foerster, Oliver Richardson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何通过迷宫。传统上,有两种方法可以实现:

  1. 制图者(基于模型/Model-Based): 你给机器人一张白纸,让它画出迷宫的地图,学习墙壁的确切位置以及门通向何处。
  2. 肌肉记忆学习者(无模型/Model-Free): 你不要求它画地图。你只是告诉机器人:“如果在这里向左走,你会得到一块饼干;如果向右走,你会受到电击。”机器人学会了针对特定情况的“正确动作”列表,但它并不一定理解这些动作为什么有效,也不理解迷宫是如何构建的。

长期以来,科学家们认为这两种方法是完全分离的。他们认为“肌肉记忆学习者”只知道为了获得奖励该做什么,而并不真正了解它所生活的世界的规则。

重大发现
这篇论文指出:事实上,肌肉记忆学习者也拥有地图。它只是把它隐藏起来了。

作者发现,如果训练一个机器人在各种不同的目标下(不仅仅是“到达出口”,还有“到达红点”、“到达蓝点”、“到达角落”等),机器人的内部大脑(它的“Q值”)会秘密地编码出一个关于整个世界的完美、准确的地图。它确切地知道每一个动作会导致什么结果,即使它从未被明确要求去绘制地图。

神奇的技巧:“P-学习”(P-Learning)
论文介绍了一种新方法——P-学习(意为“概率学习”或“世界模型学习”)。把它想象成一个逆向工程工具

  • 标准学习(Q-学习): 你有一个地图(世界),然后你试图找出最佳动作(Q值)。
  • P-学习: 你拥有最佳动作(Q值),然后你试图找出地图(世界)。

作者展示了你可以通过训练一个已经学会解决许多不同任务的机器人,观察它内部的“待办事项”数值,并通过数学上的“反转”方程,将它一直隐藏着的地图提取出来。这就像观察一位厨师烹饪出的完美佳肴,并能从中推导出他们使用的精确食谱和原料,即便他们从未写下过食谱。

“单一目标”与“多重目标”之谜
该论文还回答了一个棘手的问题:机器人需要看到多少个不同的目标才能学会完整的地图?

  • 在简单、可预测的世界中(确定性/Deterministic): 机器人只需要看到一个目标就能弄清楚整个地图。这就像学习一个拼图,每个碎片都只有一个固定的位置;一旦你看到了全貌,你就知道所有碎片该放哪儿。
  • 在混乱、不可预测的世界中(随机性/Stochastic): 机器人需要看到许多不同的目标(大约等于迷宫中房间的数量),才能确定地图。这就像是在学习一个掷骰子的游戏规则;你需要看到许多不同的结果,才能理解其中的概率。

惊喜:隐藏的超能力
实验中最令人惊讶的部分是,当你使用这个“提取出的地图”去解决机器人从未见过的新问题时,会发生什么。

在一个实验中,他们仅针对特定的位置(如“触摸红点”)训练了一个机械臂。随后,他们使用 P-学习提取了该机械臂隐藏的地图。当他们要求机器人利用这张地图去达到特定的速度(一个它从未被训练过的目标)时,它成功了!

这表明,机器人已经学习到了机械臂底层的物理特性(关节如何运动以产生速度),尽管它之前被告知只需关注位置。这就像你只通过告诉一个人“保持在车道内”来教他开车,然后他突然就能在赛道上完美驾驶,因为他早已在心中掌握了汽车引擎和转向系统的运作原理。

总结

  • 旧观点: 无模型智能体(那些只学习奖励的智能体)并不了解世界;它们只知道该做什么。
  • 新观点: 如果你在足够多的不同目标下进行训练,它们会在大脑中秘密构建一个完美的物理世界模型。
  • 工具: P-学习是一种从智能体中“读取”这种隐藏模型的方法。
  • 结果: 这个隐藏的模型如此精确,以至于它允许智能体解决从未训练过的全新、奇特的难题,证明了“无模型学习”和“基于模型学习”实际上是同一枚硬币的两面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →