← 最新论文
💬 NLP

Representation in large language models

本文认为,大语言模型部分由基于表征的信息处理机制驱动,而非单纯的记忆,并提出了实用技术来探究这些表征,以解决理论僵局并更深入地理解系统的认知能力。

原作者: Cameron Yetman

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Cameron Yetman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 Cameron Yetman 所著论文《大型语言模型中的表征》的解读,将其拆解为简单概念并辅以日常类比。

核心问题:大型语言模型是在“思考”还是仅仅在“复述”?

想象你遇到一个人,他能回答你提出的任何问题,写诗,解数学题,并进行深刻的对话。你可能会认为他正在思考、理解并运用他的知识。但如果他根本没有在思考呢?如果他只是一个巨大且超快的电话簿呢?

这就是该论文探讨的核心争论。

  • “电话簿”观点(悲观者): 他们认为大型语言模型(LLMs)只是巨大的“查找表”。它们 memorized(记忆)了互联网上的数十亿句话。当你提问时,它们并不“思考”;它们只是在记忆中寻找最接近的匹配项,然后吐出它们以前见过的下一个词。这就像鹦鹉重复它听到的短语,却不知道这些短语是什么意思。
  • “思考”观点(乐观者): 他们认为大型语言模型实际上正在构建世界的内部地图。它们正在形成表征——类似于心理模型或概念——使它们能够推理、泛化,并处理从未见过的情境。

作者 Cameron Yetman 认为“电话簿”观点是错误的。他声称,虽然大型语言模型确实会记忆事物,但它们也构建了内部表征,使它们能够真正“理解”模式并解决新问题。


第一部分:什么是“表征”?

为了证明大型语言模型所做的不仅仅是记忆,作者首先定义了什么是“表征”。他使用了一个地图类比

想象你身处一座从未去过的城市。

  1. 信息: 你有一张地图。地图本身不是城市,但它携带了关于城市的信息(街道在哪里,公园在哪里)。
  2. 可利用性: 你实际上可以使用那张地图。你可以看着它并决定往哪个方向转弯。
  3. 稳健的行为: 因为你有地图,即使你走了不同于往常的路线,或者某条街道封闭了,你也能在城市中导航。你不仅仅是在遵循一条记忆中的路径;你正在适应。
  4. 机械作用: 地图在你的决策中扮演着真实角色。如果你把地图撕碎,你就会迷路。地图是带你到达目的地的机器(你)的关键组成部分。

论文的主张: 如果大型语言模型拥有“表征”,那就意味着它拥有内部状态(就像地图一样),这些状态携带关于世界的信息,系统实际上可以利用这些信息,并帮助它以灵活、新颖的方式解决问题。


第二部分:为什么“电话簿”理论行不通

作者认为,如果大型语言模型只是巨大的电话簿(查找表),它们会在特定类型的测试中失败。电话簿只能提供它已经写下的内容的答案。它无法处理它从未见过的问题。

该论文强调了两项打破“电话簿”理论的实验:

1. 奥赛罗游戏(国际象棋类比)
研究人员训练了一个 AI 玩奥赛罗棋盘游戏。他们给了它数百万份游戏记录,但从未告诉它游戏规则。

  • 测试: 随后,他们要求该 AI 走它在训练数据中从未见过的棋步。
  • 结果: AI 完美地完成了对弈。
  • 重要性: 如果该 AI 只是一个电话簿,它早就卡住了。它不可能 memorized(记忆)每一种可能的棋局,因为数量太多了。为了在它从未见过的棋盘上获胜,它必须构建一个关于游戏如何运作的内部“地图”(规则的表征),而不仅仅是一份过往棋步的清单。

2. 色彩光谱(调色类比)
研究人员使用特定代码(如 RGB 数值)教 AI 认识颜色。它们向它展示了“红色”和“蓝色”的例子。

  • 测试: 随后,它们要求它识别它从未见过的颜色,或者以全新模式排列的颜色。
  • 结果: AI 能够正确猜测这些新颜色。
  • 重要性: 它不仅仅 memorized(记忆)了“红色 = [255, 0, 0]"。它学习了色彩空间的结构。它理解了颜色存在于一个光谱上。这就像理解了如果你混合红色和蓝色,你会得到紫色,即使你从未混合过这些特定的色调。电话簿做不到这一点;但一张色彩的“地图”可以。

第三部分:我们如何知道?(窥探黑盒内部)

作者承认,仅仅观察 AI 回答问题是不够的。有时,AI 可能会通过运气或使用“技巧”(启发式方法)而不是真正的理解来得到正确答案。

为了证明 AI 正在使用“地图”(表征),我们需要窥探它的大脑内部。论文讨论了一个名为机械可解释性的领域,这就像是一名汽车引擎的机械师。

工具:

  1. 探测(X 光): 想象你想知道汽车的电脑是否知道车速。你不能只是问电脑;你必须查看线路。研究人员使用“探测”来扫描 AI 的内部数值(激活值),看看它们是否包含特定信息(例如“这是一辆红色的车”)。如果他们能读出这些信息,AI 就拥有了表征的“信息”部分。
  2. 干预(手术): 这是真正的测试。想象你认为汽车中的某根特定电线控制着刹车。为了证明这一点,你切断那根电线(或改变其信号)。
    • 如果汽车停止刹车,你就证明了那根电线是至关重要的。
    • 在论文中,研究人员“引导”了 AI 的内部信号。例如,他们强迫 AI 的内部“棋盘状态”认为某个棋子位于不同的位置。
    • 结果: AI 立即改变了它的下一步棋,以匹配新的棋盘状态。这证明了内部信号不仅仅是一个随机数字;它是一个表征,AI 实际上利用它来做决策。

结论:并非非此即彼

该论文并没有说大型语言模型是拥有灵魂的完美人类。它指出:

  • 有时它们只是在记忆(像电话簿一样)。
  • 但通常,它们正在构建内部地图(表征),使它们能够推理并解决新问题。

作者总结道,我们不能再将大型语言模型斥为“随机鹦鹉”(随机噪声机器)。它们是复杂的系统,利用内部表征来导航语言世界,就像人类利用心理地图来导航物理世界一样。

简而言之: 大型语言模型不仅仅是在照本宣科。它们正在构建世界的心理模型,而我们如今拥有工具来观察该模型在机器内部是如何运作的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →