← 最新论文
💬 NLP

Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries

该研究发现,大型语言模型在处理阿拉伯数字时,其隐藏状态表征会在位数转换的结构性边界(如 10 和 100)处出现类似人类范畴知觉的几何扭曲,且这种扭曲源于输入格式的不连续性而非语义知识,并表现为“经典范畴知觉”与“结构范畴知觉”两种受架构影响的稳定模式。

原作者: Jon-Paul Cacioli

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jon-Paul Cacioli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的现象:大型语言模型(LLM)在“看”数字时,大脑内部(隐藏状态)的运作方式,竟然和人类感知世界的“类别化”方式惊人地相似。

为了让你轻松理解,我们可以把这篇论文的核心发现想象成一场关于**“大脑如何给世界画地图”**的探险。

1. 核心概念:什么是“类别化感知”?

想象一下你手里有一把尺子,上面画着连续的刻度。

  • 连续感知:就像看温度计,21 度和 22 度、22 度和 23 度,感觉差别是一样的,平滑过渡。
  • 类别化感知(Categorical Perception):就像看红绿灯。虽然颜色是连续变化的(从红到橙再到黄),但在我们大脑里,红色绿色之间有一道不可逾越的墙。一旦跨过这道墙,我们觉得它们的差别瞬间变大了,而且我们很难把“红”和“绿”搞混。

心理学研究发现,人类对声音、颜色、表情都有这种“跨栏”效应。这篇论文问:AI 也有这种“跨栏”吗?

2. 实验设计:给 AI 出数字题

研究者让 6 种不同的大模型(像 Llama, Mistral, Gemma 等)去处理阿拉伯数字。

  • 测试点:重点观察数字从9 变 10(一位数变两位数),以及99 变 100(两位数变三位数)的地方。
  • 为什么选这里? 因为对 AI 来说,这不仅仅是数字变了,连**“写法”**(Token 化)都变了。
    • 比如"9"可能是一个词块,"10"变成了两个词块。这就像从“单音节”突然变成了“双音节”,结构上有个大断层。

3. 主要发现:AI 的“大脑地图”被扭曲了

研究者像测绘员一样,绘制了 AI 处理这些数字时的“内部地图”(隐藏状态几何结构)。

发现一:AI 真的在“跨栏”

在数字 9 和 10 之间,AI 的“大脑地图”发生了一种结构性的扭曲

  • 比喻:想象 AI 的地图原本是一条平滑的直线。但在 9 和 10 之间,地图突然被**“折叠”了一下,或者被“撑开”**了。
  • 结果:在 AI 看来,9 和 10 之间的距离,比 8 和 9 之间的距离要大得多。这种“距离感”的突然拉大,就是“类别化感知”的几何证据。
  • 结论:这种扭曲在所有测试的模型中都出现了,而且越大的数字边界(如 99 到 100),扭曲得越厉害。

发现二:最惊人的“分裂”——有的 AI“懂”,有的 AI“懵”

这是论文最精彩的部分。研究者发现 AI 分成了两派:

  • 第一派(“经典派”:Gemma, Qwen)

    • 表现:它们不仅内部地图扭曲了,而且如果你问它们"9 是单数还是双数?”,它们能准确回答,界限分明。
    • 比喻:就像一个人不仅心里知道红绿灯有区别,嘴上也能清楚地说出“这是红,那是绿”。
  • 第二派(“结构派”:Llama, Mistral, Phi)

    • 表现:它们的内部地图依然发生了剧烈的扭曲(9 和 10 在它们心里离得很远),但是!如果你问它们同样的问题,它们答不上来,或者表现得模棱两可,完全看不出它们知道这是个“类别”。
    • 比喻:这就像一个人身体本能地对红绿灯做出了反应(看到红灯会下意识刹车,因为大脑里红灯和绿灯的距离感很强),但他嘴上却说不出“这是红灯”这个概念,甚至觉得自己只是在看颜色。
    • 意义:这证明**“知道”(几何结构)和“能说”(行为表现)是可以分离的**。AI 的底层结构已经自动形成了类别,哪怕它自己都没意识到。

4. 关键控制实验:是“学”出来的,还是“生”出来的?

研究者想知道:这种“跨栏”是 AI 学数学学出来的,还是因为输入格式本身导致的?

  • 温度实验:他们让 AI 处理温度(比如 21 度是冷,23 度是热)。虽然人类有“冷/热”的概念,但"21"和"23"在 AI 眼里写法是一样的(都是两个数字字符)。
    • 结果:AI 在温度上没有产生“跨栏”扭曲。说明光有“概念”不够,必须有“格式上的断层”
  • 乱码实验:他们把数字换成毫无意义的单词(如"glorp", "blicket"),但告诉 AI 它们有顺序。
    • 结果:AI 能建立顺序,但“跨栏”效应非常微弱。只有当换成真正的数字(有位数变化)时,效应才爆发。

结论:这种“类别化感知”主要是由输入格式的结构性突变(比如从一位数变成两位数,字符数变了)自动引发的,而不是 AI 真正“学会”了数字分类。就像给 AI 穿了一件带拉链的衣服,拉链拉开的地方(位数变化),AI 的感知就自动断开了。

5. 一个反直觉的真相:最“清晰”的地方,可能不是“干活”的地方

研究者还做了一个“手术”(因果干预):他们试图修改 AI 中间层的信号,看能不能改变它的判断。

  • 发现
    • 在 AI 的早期层(刚看到数字,还没处理完),修改信号能剧烈改变AI 的判断。
    • 在 AI 的后期层(地图已经画得最清晰、最漂亮的地方),修改信号却几乎没用
  • 比喻:这就像修房子。
    • 早期层打地基和砌墙的时候,这时候你动一下砖,房子结构就变了(因果性强)。
    • 后期层装修和挂画的时候,虽然画挂得很漂亮(几何结构最清晰),但你把画摘了,房子的承重结构其实没变(因果性弱)。
    • 警示:以前我们总以为 AI 最“清晰”的那一层就是它在思考的地方,但这篇论文告诉我们:最清晰的地方,可能只是“结果展示区”,真正的计算工作早在前面就干完了。

总结:这篇论文告诉我们什么?

  1. AI 也有“直觉”:即使没有专门教它们分类,只要输入格式有断层(比如数字位数变了),AI 的底层结构就会自动产生“类别化”的感知。
  2. 结构大于行为:有些 AI 虽然嘴上说不出“这是类别”,但它的“大脑地图”已经把它们分得清清楚楚。结构(几何)可以跑在能力(行为)前面。
  3. 格式决定感知:AI 的感知很大程度上被“怎么写”(Token 化)决定了,而不仅仅是“是什么”。
  4. 看人要看“地基”:在研究 AI 时,不要只看它最后输出的漂亮结果(后期层),要关注它早期是如何构建这些结果的,那里才是真正“干活”的地方。

简单来说,这篇论文揭示了 AI 的“潜意识”:它们不需要像人类一样学习分类,只要数字的写法变了,它们的感知世界就会自动发生扭曲,把世界强行分成不同的块。这是一种由结构决定的本能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →