Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform
本文认为,大语言模型因与潜在环境动态的目标不匹配而难以进行长程规划和因果推理,并通过"Flux"环境证明,能够显式访问潜在状态转移的智能体在稳定、长期的决策中显著优于大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对这篇论文的解释。
核心理念:阅读剧本 vs. 参与游戏
想象一下,你正在学习如何玩一款复杂的棋盘游戏。你有两种学习方式:
- “剧本朗读者”(当前的 AI/大语言模型): 你阅读了成千上万人的游戏记录。你非常擅长猜测故事中下一个词是什么。如果有人说“我把兵移到了……",你可以自信地预测"……中心格”。你听起来像个专家,因为你掌握了语言的规律。
- “游戏主持人”(世界模型): 你不仅仅阅读记录,而是在脑海中构建游戏棋盘。你理解规则、每个棋子的位置,以及移动棋子时确切会发生什么。你不仅仅是猜测下一个词,而是模拟游戏的下一个状态。
论文的观点:
当前的 AI(大语言模型或 LLM)是出色的“剧本朗读者”。它们能写出故事、代码和听起来完美的答案。但作者认为,当这些 AI 尝试进行需要长期规划或因果推理(弄清楚因果关系)的任务时,它们就开始失败。它们会迷失方向,因为它们只是在预测句子中的下一个词,而不是追踪世界的实际“状态”。
该论文提出,要构建真正智能的机器(通用人工智能,AGI),我们需要从仅仅预测单词转向构建“世界模型”——即追踪世界随时间变化的内部模拟。
核心问题:“幻觉”陷阱
作者解释说,LLM 遭受一种特定类型的困惑。因为它们被训练为基于概率预测下一个词,所以它们优先考虑听起来合理的内容,而不是实际上真实的内容。
- 类比: 想象一位朗读了图书馆里所有书籍的说书人。如果你问“如果我摔碎一个玻璃杯会发生什么?”,他可能会说“它会粉碎”,因为这在故事中通常是这样发生的。但如果你问“如果我在刚刚掉落一个沉重箱子的同时摔碎一个玻璃杯会发生什么?”,说书人可能会感到困惑。他可能会忘记三句话前他掉落了箱子,因为他只关注当下的词语,而不是整个物理情境。
- 结果: AI 会编造事实(产生幻觉)或失去对游戏状态的追踪(例如,忘记某个棋子已被移出棋盘),因为它没有维持一个关于其所描述现实的持久“心理模型”。
解决方案:潜在动力学推理 (LDI)
作者提出了一种名为潜在动力学推理 (LDI) 的新思维方式。
- 隐喻: 将语言视为真实事件的模糊、低分辨率照片。
- 照片(语言) 向你展示了一场车祸。它告诉你“汽车撞上了树”。
- 现实(潜在状态) 是实际的物理过程:汽车的速度、撞击角度、金属的扭曲。
- 当前的 AI 研究照片并试图猜测下一句话。
- LDI 试图观察照片并重建其背后的实际物理过程。它会问:“汽车的速度和位置必须是什么,才能导致这张照片?”
通过尝试重建词语背后隐藏的“物理过程”(潜在状态),AI 可以更好地进行因果推理。
实验:"FLUX"游戏
为了证明这一点,作者创建了一个名为FLUX的简单游戏。
- 规则: 游戏规则完全用纯英语编写(例如,“如果一个单元格变为零,它将被移除”)。
- 设置: 他们将这些英语规则转化为一个严格的数学计算机模拟器(即“世界模型”)。
- 比赛: 他们让两种类型的玩家相互对抗:
- LLM 玩家: 阅读英语规则和当前的游戏状态文本。它必须通过预测下一个词来猜测下一步。
- RL 玩家(强化学习): 直接在数学模拟器中进行训练。它“看到”实际的数字和状态变化,而不仅仅是文本。
结果:
- RL 玩家(世界模型) 赢得了约 79% 的游戏。
- LLM 玩家 仅赢得了约 11% 的游戏。
LLM 为什么会输?
论文发现了 LLM 失败的三种具体方式,这就像“剧本朗读者”中的“故障”:
- 求和盲区: LLM 忘记了分数的累计总和。它不断做出会将分数推过限制从而导致立即失败的移动,因为它没有在“脑海”中追踪数字,而只是在文本中追踪。
- 行长度计数错误: 随着棋子被移除,游戏棋盘会缩小。LLM 会尝试移动一个不再存在的棋子,因为它失去了对棋盘当前形状的追踪。
- 短视: LLM 做出的移动看起来对下一步很好,但对 10 步之后的游戏来说却糟糕透顶。它无法“看到”未来的后果。
结论:这对 AI 意味着什么
论文得出结论,预测下一个词不足以构建一个真正智能的代理。
- 当前的 AI 就像一位才华横溢的演员,可以完美地背诵剧本,但不理解剧情。
- 未来的 AI(世界模型) 需要像一位导演,理解剧情、角色的动机以及故事如何演变。
作者认为,要实现通用人工智能 (AGI),我们不应该仅仅让 AI 变得更大(更多数据、更多参数)。相反,我们需要改变它学习的方式。我们需要教导 AI 停止仅仅猜测下一个词,转而推断生成这些词语的隐藏“世界”。
简而言之: 要变得聪明,AI 需要停止阅读剧本,开始参与游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。