From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond
本文挑战了大语言模型与世界模型之间的二元对立,认为大语言模型是世界模型的一种退化特例,提出了一个从标记预测到潜空间模拟的连续架构谱系,同时强调了在扩展至带有动作标签的环境以及使 Transformer 架构适应连续状态预测方面所面临的重大研究挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《从 Token 到状态》(From Tokens to States)的解释,采用了通俗易懂的语言和日常类比。
巨大的误解:两个不同的世界?
想象一下,AI 社区正在为两类不同的旅行者争论不休。
- A 组(LLM/大语言模型): 声称,“我们只是词汇预测器。我们观察你输入的最后一个词,然后猜下一个词。我们对现实世界一无所知,只知道词语是如何组合在一起的。”
- B 组(世界模型): 声称,“我们是现实模拟器。我们构建了一个关于世界运作方式的心理地图,以便能够像棋手预判三步棋一样进行规划。”
这篇论文认为,这两组人实际上是从不同的角度在观察同一件事。作者 Paul Dubois 说:“你看到的不是两个不同的物种;你看到的是一只小狗和一头成年狼。小狗只是成年狼的一个高度受限的版本。”
观点 #1:“小狗”其实是在狭小房间里的“狼”
论文声称,大语言模型(LLM)实际上也是世界模型,只不过它们被困在一个非常狭小、枯燥的房间里。
- 房间(状态/State): 在一个普通的“世界模型”中,“房间”是整个宇宙(汽车、天气、人类、物理规律)。在 LLM 中,“房间”仅仅是一串文字字符串。
- 动作(Action): 在一个普通的“世界模型”中,你可以做很多事情(开车、跳跃、说话)。在 LLM 中,你唯一能做的就是添加一个词。
- 诀窍: 尽管 LLM 被允许做的仅仅是添加单词,但它在脑海中(其隐藏层中)秘密地构建了一张世界地图。
- 类比: 想象一个人被限制只能说单个词。如果你要求他玩国际象棋,而他只能使用“兵”、“王”、“将军”这样的词汇,他无法物理性地移动棋子。但在他的脑海里,他能完美地构思出整个棋盘的布局。词汇只是交互界面,但世界模型正活在他的思想之中。
论文通过展示仅在文本上训练的模型实际上可以“看见”诸如国际象棋的布局或时间的流逝,从而证明了这一点,尽管这些概念从未被直接教授过。
观点 #2:这是一条平缓的坡道,而非悬崖
许多专家(如 Yann LeCun)认为我们需要放弃词汇预测模型,转而开发一种全新的系统,称为 JEPA(一种在“潜空间”或隐藏空间中预测未来状态的系统)。
论文说:“不要跳下悬崖。只需沿着坡道向上走。”
作者描述了一个连接简单的“词汇预测器”与复杂的“现实模拟器”之间的连续谱系(一条平滑的滑梯)。你不需要扔掉旧模型,你只需要逐一放宽规则。
以下是沿着坡道上升的路径:
- 起点(标准 LLM): 每次预测一个词。
- 优点: 我们拥有无限的数据(整个互联网)和完美的工具(Transformer 架构)来进行预测。
- 第一步:多 Token 预测: 同时预测几个词。
- 变化: 我们不再强迫模型一次只猜一个字母。它在推理能力上变得稍微聪明了一点,但我们仍然使用互联网文本和相同的工具。
- 第二步:未来摘要: 预测一段未来的压缩摘要。
- 变化: 它不再猜测下一个词,而是猜测下一段话的“大意”。这仍然使用的是互联网文本。
- 第三步:下一个潜变量预测: 预测下一个“想法”(一个隐藏状态),而不是一个词。
- 变化: 模型停止输出单词,开始输出内部概念。这更难训练,但我们仍可以使用互联网文本。
- 坡道的顶端(JEPA): 根据一个动作预测现实世界的下一个状态。
- 巨大的落差: 在这里,容易的部分消失了。
- 数据问题: 我们不能再使用互联网了。我们需要来自机器人、自动驾驶汽车或电子游戏的特定交互数据,且必须知道确切的动作导致了什么结果。这类数据稀缺且难以获取。
- 工具问题: 我们用于处理单词的“Transformer”工具可能不再适用。对于连续的现实情况,这个工具可能无法发挥作用。我们可能需要一个全新的工具。
- 巨大的落差: 在这里,容易的部分消失了。
两个主要的瓶颈
论文指出了为什么我们被困在坡道底部(LLM 阶段)而未能到达顶端(JEPA 阶段)的两个主要原因:
- 数据悬崖:
- 在底部: 我们有数万亿个互联网上的词汇可以学习。它是免费且容易获取的。
- 在顶端: 我们需要数百万个特定的、带有标签的交互过程(例如机器人撞到墙壁)。这既昂贵又难以收集。
- 架构问题:
- 在底部: Transformer 是专门为单词构建的机器。它就像一把完美契合方头螺栓的扳手。
- 在顶端: 我们需要预测连续的现实(如流体运动)。那把扳手可能并不合适。我们可能需要一个全新的工具,但目前还不知道它长什么样。
结论:不要拆掉桥梁
论文的结论是,我们不需要抛弃现有的 AI 模型。
- LeCun 是对的,即简单的词汇预测器无法独立完成复杂的物理规划。
- 但他也是错的,认为我们需要从零开始。
相反,我们应该将当前的模型视为一段漫长旅程中的第一步。我们可以逐步升级它们,从预测单词过渡到预测概念,最后过渡到预测现实。目的地是明确的,但这条路径是一个渐进的过程,而不是一次突然的飞跃。
简而言之: LLM 并不是“虚假”的世界模型;它们只是被反绑了双手、无法施展身手的世界模型。如果我们慢慢解开它们的手,我们就能在无需发明一个全新宇宙的情况下,抵达我们梦寐以求的强大 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。