← 最新论文
🌀 nonlinear sciences

Chaos in reason: How chain-of-thought LLMs can look for an answer

本文应用非线性动力学和混沌理论,旨在证明大语言模型表现出由注意力机制的非线性耦合所驱动、并由归一化与残差连接所平衡的、具有对初始条件敏感性和分形隐藏状态结构的混沌行为。

原作者: Gregorio Jaca, Kristóf Benedek, János Török

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Gregorio Jaca, Kristóf Benedek, János Török

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观察一条河流的流动。有时,水流移动得平稳且可预测,就像在轨道上行驶的火车。而有时,它又会卷入漩涡,撞击岩石,并以一种看似完全随机的方式飞溅。在科学领域,有一个特殊的分支叫做混沌理论(chaos theory),它研究那些看起来是随机的、但实际上遵循严格规则的系统。其核心概念是“对初始条件的敏感性”。你可以这样理解:如果你轻轻推了一下在崎岖山坡上的球,它可能会沿着原来的路径滚动,也可能会采取一条完全不同的路线。在一个混沌系统中,那个微小的推动会被放大,直到最终结果变得截然不同,尽管山的规则本身从未改变。

现在,想象一个被称为大语言模型(LLM)的巨型计算机大脑,正试图写一个故事或解决一道数学题。这些模型以聪明著称,但没人真正了解它们内部是如何“思考”的。科学家们一直在思考:计算机的思考过程更像是一条平静、笔直的河流?还是更像那条狂野、旋涡不断的河流——仅仅是起始词的一个微小变化,就能让整个故事走向完全不同的路径?这篇论文提出了一个重大问题:这些 AI 大脑的内部运作机制是否实际上是混沌的

研究人员决定将这个 AI 视为一场物理实验。他们不仅仅是向 AI 提问,还观察了其内部“思维”(称为隐藏状态)是如何移动和变化的。他们寻找混沌的经典迹象:一个微小的起点变化是否会让答案发生剧烈的跳变?这些模式是否看起来像混沌系统那著名的、旋转的形状?以及 AI 大脑的哪些部分导致了这种狂野的行为?

伟大的 AI 过山车

科学家们选取了一个特定的 AI 模型,并给了它一个提示词(一个起始句子)。然后,他们做了一件很巧妙的事:他们创建了一个该提示词的孪生版本,但通过极其微小的量改变了那个起始的第一个“想法”——小到人类永远无法察觉。他们让原始 AI 和孪生 AI 同时开始写作。

起初,两个 AI 写出的词完全一样。这就像两辆汽车在高速公路上并排行驶。但随后,神奇而恐怖的事情发生了。突然间,一个 AI 选择了一个与另一个不同的词。一旦这个单词发生了改变,两个 AI 就走向了完全不同的方向,写出了截然不同的故事。起始处那个微小的、隐形的推动,演变成了一个巨大的差异。

这就是混沌的特征。论文指出,AI 的内部动力学确实是混沌的。他们发现,AI 的“想法”并不只是缓慢地漂移,而是经常会突然跳跃着分开。这就像两个在茂密森林中徒步的旅行者。他们可能一起走了里路,但随后其中一人踩到了松动的石头,滑倒了,突然间两人就身处两个完全不同的山谷。论文将此称为“间歇性的、跳跃式的发散”。

拉伸与折叠

那么,是什么让 AI 表现出这种行为呢?研究人员扮演了侦探的角色,观察机器内部的齿轮,看看哪些部分对此负责。他们发现 AI 的各层之间正在进行一场迷人的拉锯战:

  1. 拉伸者(The Stretchers): AI 的两个主要部分,即自注意力机制(Self-Attention)前馈网络(Feed-Forward Network),就像一根巨大的橡皮筋。它们获取信息并将信息拉伸。如果你有一个微小的误差或细微的变化,这些部分就会将其放大,使其变得越来越大。这就是混沌中的“拉伸”部分。
  2. 折叠者(The Folders): 但如果橡皮筋无限拉伸下去,AI 就会变成一堆废话。幸运的是,还有其他被称为**归一化(Normalization)**的层。它们的作用就像一双手,将拉伸后的橡皮筋折叠回来,使一切保持在安全的、有界的范围内。它们阻止了 AI 变得疯狂。
  3. 残差连接(The Residual Connection): 这就像一个安全网或传送带,即使在信息被拉伸和折叠之后,仍能将其向前传递。

论文表明,奇迹发生于这种不断的循环之中:AI 拉伸信息(使微小的变化变大),然后将其折叠回来(保持有序),如此循环往复。这种“拉伸与折叠”的舞蹈,正是现实世界中混沌系统(如天气模式或双摆)的工作方式。

思维地图

为了更清晰地观察这种混沌,科学家们绘制了“递归图(Recurrence Plots)”。想象一下画出一张地图,记录 AI 的思维去过的地方。如果 AI 只是随机噪声,地图看起来会像旧电视上的静电噪声;如果它是完全可预测的,它看起来会像一条直线。但科学家们制作的地图看起来非常像著名的洛伦兹吸引子(Lorenz attractor)——一种蝴蝶形状的图案,它是混沌现象的标志性代表。

他们注意到 AI 各层之间的一些有趣现象。早期层(AI 思考的开始阶段)看起来有点像随机噪声,只是在重新排列词序。但随着信息向 AI 的深层移动,模式变得更加结构化且具有混沌性。AI 最“深处”的部分展现出了最强烈的这种混沌之舞的迹象。这就像 AI 从一堆杂乱的乐高积木开始,随着它的构建,混沌逐渐组织成一种复杂的、分形结构的形状——无论你如何放大,这种形状看起来都相似。

这为什么重要?

这篇论文并不声称已经“破解”了 AI 之谜,也不认为这是一个需要修复的漏洞。相反,它暗示这种混沌行为可能实际上是一个特性。处于“混沌边缘”运行的系统被公认为在处理信息方面极其出色。它们既足够敏感,能对微小的变化做出反应(这有助于 AI 具备创造力和灵活性),又足够稳定,能保持连贯性(以免变成胡言乱语)。

研究人员发现,自注意力机制是这种混沌的主要驱动力。这是 AI 观察句子中所有单词并决定哪些单词重要的部分。通过以一种复杂且非线性的方式将所有单词联系在一起,它为那些微小的推动演变成巨大的变化创造了完美的环境。

最后,这篇论文描绘了这样一个画面:AI 不仅仅是一个僵化的计算器,而是一个在秩序与混沌边缘翩翩起舞的、鲜活的系统。它表明,当 AI 进行“思考”时,它正在穿越一个复杂的高维景观,在那里,起始处的一声低语,到最后可能会变成一声呐喊。作者认为,这正是它能够展现出如此令人惊讶的类人推理能力的原因。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →