← 最新论文
📊 statistics

Inverse Depth Scaling From Most Layers Being Similar

该论文揭示了大型语言模型的损失与深度成反比,这是由于功能相似的层充当了低效但稳健的集成,这表明未来需要架构创新以实现更有效的组合深度利用。

原作者: Yizhou Liu, Sara Kangaslahti, Ziming Liu, Jeff Gore

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhou Liu, Sara Kangaslahti, Ziming Liu, Jeff Gore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图建造一座规模宏大、超级聪明的知识库(即大型语言模型,或称 LLM)。为了让这座图书馆变得更聪明,你可以转动两个主要的旋钮:你可以把书架做得更宽(增加“宽度”或同时容纳信息的容量),或者你可以把建筑盖得更高(增加“深度”或处理层数)。

长期以来,科学家们一直认为,把建筑盖高就像是在为一道复杂的食谱添加更多的步骤。他们认为第 1 层处理基础知识(如语法),第 2 层处理含义,第 3 层处理逻辑,以此类推。他们相信这些层级像是一个施工队一样协同工作,每一层都为构建复杂的结构添加一个特定的、独特的砖块。这就是论文中所称的**“组合装配”(Compositional Assembly)**。

然而,这篇论文指出,这些 AI 模型并不是这样工作的。研究发现,在这些高耸建筑中的大多数层级实际上都在做完全相同的事情,只是略有差异。

“嘈杂估计量人群”的比喻

作者发现,这些层级并不像专业的施工队,而更像是一群正在猜测数学题答案的人

  • 旧观点(组合式): 想象一场接力赛,选手 1 将接力棒交给选手 2,选手 2 再交给选手 3,以此类推。每位选手都承担着不同的、特定的任务,以将接力棒传向终点。
  • 新发现(集成平均): 想象你问了 100 个人西瓜的重量。每个人都猜得不太准,且每个人犯的错误都不一样。但是,如果你取这 100 个猜测值的平均值,结果会非常准确,因为个人的误差会相互抵消。

论文声称,在大型语言模型中,大多数层级就像这 100 个人。他们都在观察同样的信息,并试图完成同样的工作。因为他们都带有一定的“噪声”(即不完美),所以增加更多的层级仅仅是给了你更多的人来通过平均化来消除噪声。

“反深度”的发现

这是作者发现的一个令人惊讶的数学规则:你增加的层数越多,模型就越聪明,但收益却在递减。

如果你将层数翻倍,模型并不会变得聪明两倍;它只会变得稍微聪明一点。具体来说,误差(即模型出错的频率)与深度成反比下降。

  • 想象你在听一个微弱的无线电信号。如果你只有一个天线,静电噪音很大。如果你增加第二个天线,静电会减少一些。如果你增加一百个天线,静电会变得非常低,但增加一百个天线并不会让它变得完全静默;它只会让声音变得稍微安静一点。

论文称之为**“反深度缩放”(Inverse Depth Scaling)**。这意味着,仅仅通过堆叠更多的层级来构建更聪明的 AI 是一种低效的方式,因为这些层级是冗余的。它们并没有学习新的、复杂的技能,而只是在帮助消除前一层产生的误差。

为什么会发生这种情况?

作者运行了“玩具模型”(这些 AI 大脑的简化、小型版本)实验,以查明原因。他们发现,这些模型的构建方式(使用“残差连接”,允许信息跳过某些层级)促成了这种“人群”行为。

他们还发现,这些模型试图解决的任务(预测句子中的下一个词)可能不是平滑、循序渐进的过程。因为任务是“锯齿状”或不可预测的,模型无法使用平滑、分步的学习策略。相反,它会默认采用“人群”策略:只需向问题投射足够多相似的层级,然后让平均法则发挥作用。

核心结论

论文得出结论,目前的语言模型在深度利用上是低效的。我们正在建造非常高的塔楼,而其中大多数楼层都在做着与下方楼层完全相同的事情。

  • 好消息是: 这种“人群”方法非常稳健。如果你移除几个层级或重新排列它们,模型仍然能很好地工作,因为“人群”规模庞大,丢失几个人并不会产生影响。
  • 坏消息是: 这是一种资源的浪费。为了让这些模型变得显著更聪明,我们可能需要发明新的架构设计,迫使层级真正学习不同的、专业化的技能(即“施工队”的概念),而不是仅仅通过平均化误差来工作。

简而言之:我们一直在建造 AI 摩天大楼,而每一层楼都只是下面一层楼的副本,只是带有一点噪声。论文证明了虽然这种方法行之有效,但它并不是构建天才的最有效方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →