← 最新论文
🤖 AI

On the Smallness of the Large Language Models Scaling Exponents

本文认为,当前大语言模型的缩放指数表明了一种不可持续的能量机制,这一结论在考虑了非零损失极限的“基座效应”后依然成立,同时本文还通过类比流体湍流来讨论数据平滑度对这些指数的影响。

原作者: Sauro Succi, Peter V. Coveney, Alex Hansen

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Sauro Succi, Peter V. Coveney, Alex Hansen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “越大越好”的问题

想象一下,你正在试图教一个机器人完美地说话。目前 AI 世界的规则是:“机器人的体积越大,它说话就越好。” 这种被称为“无墙”(no-wall)的发现,暗示只要你不断增加数据和计算能力,机器人就会永远变得越来越聪明。

然而,本文作者认为这种策略是不可持续的。他们指出,即使我们还没有触及智能的极限,我们也正在撞向能源消耗的墙壁。

核心问题:收益递减

论文使用了一个简单的数学概念来解释为什么这是一个问题。想象一下,你正在试图擦干净一扇非常脏的窗户。

  • 目标: 让窗户变得完美透明(零误差)。
  • 现状: 为了让窗户仅仅变干净“一半”,你需要的不仅仅是两倍的努力,而是需要 1,000 倍 的努力。

作者指出,目前的语言大模型(LLMs)拥有一个非常小的“缩放指数”(衡量其进步速度的数字,大约在 0.05 到 0.1 之间)。

  • 类比: 如果你想让 AI 的性能提升一点点,你就必须喂给它堆积如山的全新数据,并消耗大量的电力。这就像是在试图把一个巨石推上坡,而且随着高度增加,坡度变得越来越陡。论文认为这是一个死胡同,因为能源资源有限。

“底座”辩护:为什么我们不能坐以待毙

一些批评者说:“别担心!我们并不真的需要 AI 达到完美(零误差)。我们只需要它达到‘足够好’的状态,不再胡言乱语即可。我们在它触底之前停止训练。”

作者将此称为**“底座效应”(Pedestal Effect)**。他们想象了一个地板(底座),无论你给多少数据,AI 的误差都永远无法低于这个水平。

  • 论文的反驳: 即使我们接受不需要完美这一观点,数学逻辑依然站不住脚。作者表明,由于这个“地板”相对于起点来说太高了,导致“足够好”的区间被过快地触达,而此时微小的缩放指数仍然适用。
  • 隐喻: 想象你在往浴缸里注水。你辩解说:“我不需要注满到边缘,我只需要有几英寸深的水就行。” 作者说:“即便你的目标很低,但因为水龙头滴水极其缓慢,在你达到那几英寸深度之前,可能要花上百万年,而且你会比达到目标更早耗尽水源(能量)。”

为什么数字如此之小?(数据的“粗糙性”)

论文提出了一个问题:为什么 AI 进步得如此缓慢?

他们将 AI 训练与流体湍流(如河流中旋转的水流或上升的烟雾)进行了对比。

  1. 平滑 vs 粗糙: 如果你试图学习一个平滑、可预测的模式(比如一条直线),你会学得很快。但现实世界的数据(语言、图像、复杂系统)是“粗糙”且混沌的,就像波涛汹涌的大海。
  2. 分形连接: 作者使用了物理学中的类比。在风暴中,能量并不是均匀分布的,而是集中在微小的、混沌的旋涡中。要理解这场风暴,你必须观察这些微小的旋涡。
  3. 结果: 由于数据是“粗糙”且混沌的,AI 必须付出巨大的努力才能找到其中的模式。论文表明,数据的“粗糙性”迫使缩放指数保持在极低的水平。

“隐藏地图”理论

论文引用了 Sharma 和 Kaplan (SK) 的一个理论,该理论认为学习速度取决于数据的内在维度(Intrinsic Dimension)

  • 类比: 想象一座图书馆。
    • 嵌入空间(Embedding Space,即图书馆的大小) 是巨大的——可能有数百万个书架。
    • 内在维度(Intrinsic Dimension,即包含真实故事的实际书籍数量) 要小得多,但仍然非常庞大。
  • 问题: 尽管大模型非常擅长从庞大的图书馆中寻找“真实的故事”(压缩数据),但这个“真实的故事”本身仍然过于复杂(维度过多),以至于 AI 无法在不烧掉全世界能源供应的情况下高效地学习它。

结论:停止盲目追求“更大”

作者总结道,“越大越好”的方法是能源枯竭的诱因。

  • 判决: 无论 AI 变得多么聪明,如果数据是复杂且“粗糙”的,那么让它变得稍微聪明一点所需要的能量将永远过高。
  • 建议路径: 我们不应该只是建造更大的、更笨的模型来消耗更多电力,而是应该回归到基于物理学的底层模型(被称为“世界模型”)。这些系统理解的是世界运作的方式(如重力或因果关系),而不仅仅是记忆海量数据库中的模式。

简而言之: 我们正试图通过投入越来越多的劳动力来解决一个复杂的谜题,但这个谜题实在太难了,以至于我们在解开它之前,咖啡(能量)就要喝光了。我们需要改变策略,而不仅仅是增加工人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →