← 最新论文
💬 NLP

States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States

本文研究了大型语言模型如何在没有显式思维链推理的情况下,通过在其隐藏状态中形成并利用不完美的隐式离散状态表示(Imperfect Implicit Discrete State Representations)来进行扩展计算,并同时表征了这些表示的形成过程及其对计算误差的贡献。

原作者: Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位魔术师从帽子里变出一只兔子。你知道兔子并不是凭空出现的,但你看不见其中的戏法。长期以来,研究人工智能(AI)的科学家们也处于类似的状态。他们知道这些巨大的计算机大脑(被称为大语言模型,LLMs)可以做很多了不起的事情,比如写诗、解数学题以及像人类一样聊天。但是,它们在“大脑”内部(其实只是由海量数字和层级组成的集合)究竟是如何运作的,一直是一个黑匣子。

要理解这篇论文,你需要了解两件简单的事情。首先,大语言模型通过逐个预测句子中的下一个词来工作。其次,在进行预测时,它们会创建一个名为**隐藏状态(hidden state)**的信息“临时便签”。你可以把这个隐藏状态看作是 AI 在思考时做出的心理笔记。通常,我们假设 AI 只是阅读了整个问题,然后直接猜出答案。但如果,在阅读一长串数字列表时,AI 实际上是在脑海中进行着隐形的累加计算,就像你在脑中计算超市账单而不需要写下来那样呢?这篇论文探讨的是:AI 到底是在进行这种心理数学运算,还是仅仅在瞎猜?


心理数学的魔术戏法

想象一下,你在参加一个派对,有人递给你一长串数字:17, 38, 32, 87... 并要求你瞬间算出它们的总和,且不能动笔记录或说出计算步骤。大多数人会感到吃力,但世界上最聪明的 AI 模型正开始变得非常擅长这一点。它们可以处理多达 15 个数字的字符串,并立即给出正确的总和,而无需展示计算过程。

这篇题为《隐藏在隐藏状态中的状态》(States Hidden in Hidden States)的论文,调查了这些 AI 模型究竟是如何完成这个戏法的。来自清华大学的研究人员假设,这些模型并非只是在猜测,它们正在秘密地构建隐式离散状态表示(Implicit Discrete State Representations, IDSRs)

让我们来拆解一下这个高大上的术语。想象 AI 是一个正在传递水桶的工人团队:

  • 隐式(Implicit): 它们没有大声喊出数字(即没有生成文本)。
  • 离散状态(Discrete State): 它们手中握着一个特定的、确切的数字(例如在加了 17 和 20 之后得到“37”)。
  • 表示(Representation): 这个数字作为一种模式存在于 AI 的内部层级之中。

研究人员想要证明,AI 确实在阅读列表的过程中保留了这些中间数值,而不是等到最后才试图一次性完成所有计算。

侦探工作:窥视大脑内部

为了验证这种“心理便签”是否真的存在,研究人员与 AI 的内部层级玩了一场“二十个问题”的游戏。他们使用了一种叫做**探测器(probe)**的工具。你可以把探测器想象成一个微小的、超快速的侦探,它可以在任何特定时刻窥视 AI 的内部笔记,并问道:“你现在在想哪个数字?”

他们对各种模型进行了测试,从较小的模型(如 Llama2-7B)到巨型模型(如 GPT-4 和 Qwen-72B)。他们要求模型解决包含 2 到 14 个数字的加法问题。

他们的发现如下:

  1. 规模越大,能力越强: 这种心理数学能力随着模型的增大而“涌现”。小型模型可以计算两个或三个数字,但一旦列表达到 8 个数字,它们就会崩溃。然而,最大的模型却能以惊人的准确度处理 11 个甚至 15 个数字的列表。
  2. 隐藏笔记是真实的: 当研究人员在 AI 的隐藏层中使用这些“侦探探测器”时,他们发现模型确实保留了运行中的总和。例如,在 AI 阅读完“17 + 24”后,模型的内部状态包含了“41”的表示,尽管它还没有把“41”这个词说出来。
  3. 并非完美: 坏消息是,这个心理笔记并不完美。随着数字列表变得越来越长,这个“笔记”会变得有些模糊。研究人员发现,虽然 AI 在前几步能完美保持数字,但到了第 15 个数字时,其内部表示开始失去细节。这种“有损”压缩正是为什么即使是最聪明的模型有时也会算错最终答案的原因。

AI 如何构建数字

论文还弄清楚了 AI 是如何构建这些数字的,这与人类的做法惊人地相似。

  • 逐位构建: AI 并不是一次性计算整个数字。它是逐位构建答案的,从右侧开始(个位),然后是十位,接着是百位。这就像是在纸上列竖式加法,但在 AI 的大脑内部完全发生了。
  • “浅层”与“深层”层级: AI 有许多处理层级。研究人员发现,前 10 层就像是大脑的“计算器”部分——它们只进行原始的数学运算。但随着信息移动到更深的层级(大约第 10 层及以后),AI 开始混入句子的上下文。这就像计算器被周围的谈话分了心。这种混合正是导致最终答案出现“模糊”或错误的原因。
  • 线性而非魔法: AI 并不是以一种神奇的、全盘计算的方式进行数学运算。它是线性地处理列表。如果你有数字 A, B, C 和 D,它会计算 (A+B),然后将结果与 C 相加,再与 D 相加。它不会分别计算 (A+B) 和 (C+D) 然后再合并。

“桥梁”实验

为了证明 AI 确实在使用这些隐藏笔记而非仅仅在猜测,研究人员玩了一个聪明的花招。他们在 AI 的注意力机制中搭建了一座“桥梁”。想象 AI 正在阅读一个长句子,研究人员阻断了它回顾句子开头的能力,迫使它只能看向它刚刚读到的最后一个东西。

如果 AI 只是根据整个句子在进行猜测,那么这种阻断会彻底破坏它的功能。但如果 AI 能“看到”这座桥梁(即最近的一个加号),它仍然可以解决数学问题。这证明了 AI 确实在将运行中的总和从一步传递到下一步,就像人类一样。

总结

这篇论文表明,当庞大的 AI 模型在不展示计算过程的情况下进行数学运算时,它们确实在进行实际的运算。它们正在创建隐形的、内部的“便利贴”,在阅读过程中记录运行中的总和。

然而,有一个问题:这些便利贴并不完美。随着数字列表变得越来越长,笔记会变得有些模糊,AI 也开始出错。研究人员认为,如果我们能弄清楚如何让这些内部笔记变得更清晰、更少“有损”,我们或许就能让 AI 在复杂的推理任务(而不只是数学)上表现得更好。

目前,我们知道 AI 并非拥有魔法;它只是非常擅长进行心理计数,即便这个计数在面对长列表末尾时有时会变得有些模糊。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →