← 最新论文
🤖 machine learning

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners

本文研究了经过监督微调的大语言模型是否学习了用于经典规划的内部世界模型,结果表明,虽然这些模型线性地编码了动作有效性和状态谓词,但通过在训练期间扩大状态空间覆盖范围,其恢复底层世界模型的能力得到了显著增强。

原作者: Patrick Emami, Nan Qiang, Peter Graf

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Patrick Emami, Nan Qiang, Peter Graf

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个非常聪明、博学多才的机器人(即大语言模型,LLM),但它从未玩过某个特定的棋类游戏。你想通过向它展示获胜游戏的例子来教它如何玩游戏。这个研究提出的核心问题是:当机器人学习玩游戏时,它究竟是真正理解了游戏规则,还是仅仅在死记硬背动作?

研究人员将此称为“世界模型恢复”(World Model Recovery)。这就像是在问:“机器人是构建了一个关于世界运作方式的心智地图,还是仅仅在鹦鹉学舌地重复它听过的词句?”

以下是利用简单类比对他们发现的研究结果进行的拆解:

实验:教机器人进行规划

研究人员使用一种称为**监督微调(SFT)**的方法,教机器人解决规划问题(例如移动塔中的积木或用飞机运送包裹)。你可以把这理解为给机器人一本包含完美解决方案的教科书。

他们测试了三种创建这些教科书的方法:

  1. “完美路径”书: 只展示通往目标的、最短且最高效的路线(就像 GPS 只显示最快路线一样)。
  2. “随机游走”书: 展示机器人随机的有效动作,即使这些动作是在原地打转或绕远路。
  3. “智能随机游走”书: 与随机游走类似,但增加了一条规则,防止机器人在原地打转,从而迫使它探索地图中的新区域。

两种检查理解程度的方法

研究人员不仅询问“机器人是否解决了谜题”,还通过两种方式观察了机器人的“大脑内部”:

1. “X光检查”(内部表示)
他们使用了一种叫做“线性探测器”(linear probe)的工具,在机器人思考时观察其内部代码。

  • 隐喻: 想象机器人是一位正在烹饪美食的厨师。研究人员不仅品尝了食物的味道,还观察了厨师的手,看他是否知道哪些食材是新鲜的,哪些是腐烂的。
  • 发现: 即使在仅仅是复制动作列表时,机器人的内部“大脑”也已经学会了区分有效动作(合法的动作)和无效动作(非法的动作)。它还学会了一些特定事实的真相(例如“积木 A 是否在积木 B 之上?”)。
  • 局限: 机器人识别有效动作的能力,要强于它用自己的语言解释为什么这些动作有效的能力。这就像一个司机直觉上知道不该闯红灯,却无法解释交通规则。

2. “声音”(生成能力)
他们要求机器人预测下一个动作,并检查它是否对合法动作给予高置信度,对非法动作给予低置信度。

  • 隐喻: 这就像是在问厨师:“如果我给你一个烂鸡蛋,你会说‘不,我不会使用它’吗?”
  • 发现: 在这里,结果褒贬不一。
    • 使用**“完美路径”**训练的机器人表现得很糟糕。当被要求进行预测时,它们无法区分合法动作和非法动作。它们只知道自己记忆中的那条特定路径。
    • 使用**“随机游走”**训练的机器人表现出色。因为它们看到了许多不同的移动方式,所以它们学会了通用的规则。即使面对从未见过的具体情况,它们也能自信地表示:“那个动作是非法的。”

大惊喜:“知之而不言”

最有趣的发现是机器人的**“大脑”“声音”**之间的不匹配。

  • 一些机器人的“大脑”清晰地理解了规则(X光显示它们知道有效与无效的区别)。
  • 然而,它们的“声音”(它们分配给动作的概率)却未能体现出这种理解。
  • 类比: 这就像一个学生在脑海里做对了每一道题(内部知识),但因为紧张或不知道如何表达而写下了错误的答案。这篇论文表明,仅仅因为机器人的输出(声音)显示它不懂规则,并不意味着它的内部(大脑)真的不懂。

关于训练数据的启示

用于训练机器人的数据类型至关重要:

  • 仅在“最优”解上进行训练会让机器人成为一个优秀的记忆者,但却是一个糟糕的规则遵循者。它无法处理新情况。
  • 在“随机”有效动作上进行训练(尤其是避免循环的“智能随机游走”)会让机器人成为真正的学习者。它构建了一个更好的世界心智地图。
  • “分布外”(OOD)测试: 当研究人员给机器人一个难度更高的游戏版本(比训练时有更多的积木或包裹)时,接受“完美路径”训练的机器人完全失败了。而接受“智能随机游走”训练的机器人表现得好得多,这证明它们确实学习到了游戏的概念,而不仅仅是特定的动作。

总结

论文得出结论:如果你想让 AI 真正理解如何规划和导航一个世界,你不应该只向它展示完美的、最短的路径。你需要向它展示各种有效的路径,包括那些混乱的、非最优的路径。这有助于 AI 在其大脑内部构建一个稳健的“世界模型”,即便它有时在通过输出完美表达这种知识方面仍会遇到困难。

简而言之:要教 AI 像规划者一样思考,不要只给它标准答案;要让它在游乐场里自由探索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →