← 最新论文
💻 computer science

All Routes Lead to Collapse

原作者: K. R. Balasubramanian

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: K. R. Balasubramanian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对论文《所有路径都通向崩溃》(All Routes Lead to Collapse)进行的解释。

核心思想: “盲目评委”问题

想象你是一位才艺表演赛的评委。你的工作是挑选出最优秀的表演者(token/标记)并给予聚光灯。你有一本规则手册(算法)来指导你如何评分。

这篇论文指出,所有现代 AI 模型(如 Transformer、Mamba、RWKV 等)都使用一本对特定细节“视而不见”的规则手册。

  • 规则手册: 它根据表演者的“内容”与你的查询(query)之间的匹配程度来进行评分。
  • 盲点: 这本手册完全忽略了表演者有多大声或体积有多大。它只关心声音的“形状”,而不关心“音量”。

因为评委对音量视而不见,系统就会感到困惑。为了做出决策,系统被迫采取极端手段:它不再将聚光灯均匀地洒向四周,而是将所有的注意力都堆积在仅有的一个或两个表演者身上。

论文将这种现象称为**“崩溃”(Collapse)**。这并不是代码中的 Bug;而是一种数学上的必然。如果你的测量尺是坏的(对大小视而不见),系统为了理清头绪,就必须把所有东西都挤进一个极小的角落里。


三大症状(“特征签名”)

论文确定了每当这个“盲目评委”掌权时都会发生的三个现象。可以将它们视为同一种疾病的不同症状:

  1. “注意力汇聚”(Attention Sink / 聚光灯堆积):
    聚光灯不再在许多演员之间平滑移动,而是卡在了仅仅几个人的身上。用 AI 的术语来说,极少数的 token(比如句子中的第一个词)吸收了几乎所有的注意力。

    • 类比: 想象一个教室,老师不再向全班提问,而是突然开始盯着前排的一名学生看,完全忽略了其他人。
  2. 秩崩溃(Rank Collapse / 平坦化):
    AI 内部的“思想”(表示/representations)不再具有多样性。它们开始变得越来越像,缩减成一个简单的、低维度的形状。

    • 类比: 想象一个 3D 雕塑慢慢被压扁,直到看起来像一张 2D 图画。所有的深度和细微差别都消失了,一切都变成了一张平坦的纸片。
  3. 范数分层(Norm Stratification / 音量爆炸):
    因为评委忽略了音量,AI 会尝试通过让某些 token 变得极其响亮(高范数/high norm)而另一些则变得很安静来“作弊”,希望响亮的那些能脱颖而出。

    • 类比: 由于评委听不出音量的区别,演员们开始歇斯底里地大声尖叫,以便被注意到,而其他人则在低声耳语。

重大发现:不仅仅是“注意力”的问题

长期以来,科学家们一直认为这些问题只发生在 Transformer(使用“注意力机制”的特定类型 AI)中。他们认为这是“注意力”机制本身的一个缺陷。

但这篇论文证明了这种看法是错误的。

作者在四种并不使用标准注意力机制的不同 AI 架构上测试了这一“盲目评委”理论:

  1. 图注意力(Graph Attention): 在网络节点之间路由信息。
  2. Mamba: 一种使用“状态空间”(类似于内存缓冲区)而非注意力的模型。
  3. RWKV: 一种通过递归方式随时间混合信息的模型。
  4. 注意力残差(Attention Residuals): 一种基于“深度”(层)而非时间来路由信息的模型。

结果: 这四种不同的系统都表现出了完全相同的症状(聚光灯堆积、平坦化和音量爆炸)。

结论: 问题不在于“注意力”。问题在于当测量工具对“范数”(大小/模长)盲目时,**基于内容的路由(Content-Based Routing)*会产生问题。如果你根据内容进行路由,却忽略了量级(大小),系统一定会*发生崩溃,无论你构建什么样的架构。


“刹车”类比:为什么有些模型崩溃得更快

如果机制是一样的,为什么有些模型会立即崩溃(如 Transformer),而有些则需要很长时间(如 Mamba)?

论文引入了**“位置刹车”(Positional Brake)**的概念。

  • 引擎: “内容得分”(Content Score)是试图推动系统走向崩溃的引擎(寻找最佳内容)。
  • 刹车: 每个模型都有一个次要规则,它会说:“等等,记住这个信息是从哪里来的。”(例如:“不要忘记最近的一个词”或“不要忘记第一个词”)。

刹车是如何工作的:

  • 强刹车: 如果刹车很强(例如在具有强时间衰减规则的 Mamba 或 RWKV 中),它会与引擎对抗。系统会在很长一段时间内抵抗崩溃。需要经过一段时间,“内容”才会最终胜出。
  • 弱刹车: 如果刹车很弱(例如带有“旋转位置编码”的标准 Transformer),引擎会迅速获胜。系统会很早就发生剧烈崩溃。

实验过程:
作者拿了一个模型(RWKV),并手动调整了它的“刹车”。

  • 当他们加强刹车(使时间衰减更强)时,崩溃发生得更晚且更弱。
  • 当他们移除刹车(让内容肆意生长)时,崩溃几乎瞬间发生。

这证明了机制(崩溃)始终存在,但时机取决于“刹车”有多强。


“音量”技巧(范数分层)

关于“音量爆炸”(范数分层)的研究是其中最有趣的发现之一。

  • 理论: AI 通过制造响亮的 token 来补偿评委对音量的盲目。
  • 测试: 作者观察了一个强制要求 token 保持相同音量(归一化/normalized)的模型(AttnRes)。你会认为这会阻止崩溃。
  • 结果: 崩溃仍然发生了。系统只是找到了另一种“作弊”方式。它不再利用音量,而是纯粹转向专注于“内容枢纽”(content hubs)。

教训: “音量爆炸”只是 AI 试图修复损坏测量尺的一种方式。它是一个症状,而不是原因。真正的根源是那个盲目的测量尺本身。


总结:这意味着什么

  1. 这是一个普遍规律: 这不是某一种特定 AI 模型的 Bug。它是这些路由系统运作方式的一个基本数学后果。如果你根据内容进行路由却忽略大小,你就会得到崩溃。
  2. 几何学是诊断工具,而非疗法: 作者使用几何语言(距离、流形)来描述为什么会发生这种情况,但他们并不是说 AI 在进行复杂的几何运算。他们是在说 AI 正在挣扎,因为它的“尺子”是扁平且盲目的。
  3. 刹车控制着时机: 根据这篇论文,我们无法完全阻止崩溃(发生),但我们可以通过调整“位置刹车”(模型对位置 vs. 内容的关注程度)来控制它发生的时间

简而言之,这篇论文说:“别再责怪特定的 AI 类型(Transformer)了。问题出在测量尺上。只要这把尺子对大小视而不见,系统最终都会为了理清头绪而把所有东西都挤进一个角落里。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →