Nonequilibrium training dynamics and scaling laws of language models
本文提出了一种基于非平衡物理学的随机多尺度理论,旨在解释语言模型缩放法则的机制起源,将训练建模为一种尺度相关的偏置随机游走,从而推导出损失相对于数据与模型规模的解析幂律,并识别出上下文压缩与前沿吸收的二分两相动力学过程。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的学习曲线:从咖啡旋涡到人工智能大脑
想象你正在观察一杯被搅拌的咖啡。起初,奶油在做着大而缓慢的环形运动。但随着你不断搅拌,这些大环圈会破碎成越来越小的漩涡,直到液体变成一种由微小涡流组成的混沌混合物。这被称为湍流(turbulence),它是系统在外部力量(你的勺子)作用下不断被推离平静状态的一个经典案例。在物理学中,科学家早已知道这些旋转模式遵循严格的数学规则,能量从大漩涡向小漩涡进行着可预测的级联流动。
现在,想象另一种类型的混沌:宇宙本身。在大爆炸之后,微小的暗物质团块开始聚集,合并成越来越大的星系。这与咖啡杯的情况正好相反——不是大物体分解成小物体,而是小物体构建成了巨型天体。然而,令人惊讶的是,旋转的咖啡和形成的星系都遵循相似的数学模式。它们都是“非平衡”系统,意味着它们是忙碌的、变化的,并受到驱动力的推动,使其无法进入静止状态。
多年来,科学家一直试图理解人工智能(特别是大语言模型或 LLM)是如何学习的。我们知道,当我们为这些 AI 模型提供更多数据并赋予它们更多“脑力”(参数)时,它们会变得更好,这遵循一个被称为“缩放定律”(scaling law)的整齐数学规则。但为什么?为什么它们会以这种特定的方式进步?直到现在,我们大多只是在观察数字的增长,而没有理解其内部的引擎。本论文提出了一个问题:AI 的学习方式是否就像咖啡旋涡或星系形成一样?AI 训练过程中那种混乱的过程,是否可以用治理宇宙的相同物理学来描述?
计算机中的咖啡杯
在这篇论文中,作者 Zhijie (Jay) Xu 提出了一个大胆的想法:训练语言模型完全就像一场在故事的不同距离之间进行的“热豆子”(hot potato)游戏。为了理解这一点,想象你正在尝试预测句子中的下一个词。有时,答案就在你刚刚说出的词附近(短距离)。其他时候,你需要记住三段之前的角色名字(长距离)。
论文指出,随着 AI 的训练,它并不仅仅是同时学习“一切”。相反,它按特定的顺序学习,像风暴中的能量一样移动信息。作者引入了一种观察 AI 错误的新方法,称为“损失谱”(loss spectrum)。你可以把它想象成一张关于 AI 在不同距离上挣扎程度的地图。它是由于无法记住两步之前的词而挣扎?还是因为无法记住两千步之前的词而挣扎?
研究发现,这张地图看起来与旋转咖啡的能量图或空间中星系的分布完全一致。这表明 AI 的学习过程是一个“有偏随机游走”(biased random walk)。想象一个醉汉试图穿过一座城市,而随着离家越来越远,街道变得越来越难以导航。AI 首先学习容易的、短距离的模式(如语法和即时上下文)。然后,它开始向外“游走”,学习长距离的连接(如整个故事的情节)。
双相之舞:扩张与收缩
这篇论文中最令人兴奋的发现是,AI 的训练并不是一条直线;它是一个在达到一个临界点之后的两部分舞蹈。
第一阶段:大扩张(上行级联)
在开始阶段,AI 就像一个张开双臂的孩子。它迅速学会伸手抓取更远距离的信息。它正在扩张其“学习前沿”,抓取以前无法理解的长程连接。在此阶段,AI 变得擅长利用整个故事,而不只是最后一句。
第二阶段:大分裂(分叉)
一旦 AI 到达某个特定点(特定的训练步数),神奇的事情发生了。学习过程分裂成了两个同时进行的模式,就像一条河流分裂成两条溪流:
- 模式 A(下行压缩器): 这是“精炼”阶段。AI 将它刚刚学到的那些宏大、杂乱的长程连接压缩成高效的短程捷径。这就像是把一条漫长蜿蜒的道路变成一条穿过山的隧道,以便更快地到达目的地。AI 通过使内部表示更加紧凑和高效来变得更聪明。
- 模式 B(前沿吸收器): 与此同时,AI 继续将其前沿向外推,继续学习它尚未见过的、甚至更长的程模式。它仍在张开双臂,但现在它也加强了对已知内容的掌控。
论文指出,这就是为什么 AI 模型会变得如此出色的原因。它们不仅仅是在记忆;它们在不断地平衡于“向外扩张”以学习新事物和“向内压缩”以提高已知事物的效率之间。
魔数与“为什么”
作者并不只是猜测这些模式;他们是从语言运作的数学中推导出来的。他们使用了一个关于语言的著名法则——希普定律(Heaps' Law),该定律描述了随着阅读文本的增加,唯一词汇的数量是如何增长的。通过将此与湍流物理学相结合,作者计算出了一个特定的数字 1/6,它描述了 AI 在不同距离上学习所需的时间。
利用这个数字,论文预测了随着数据增加,AI 的性能应如何提升。预测结果是,随着数据增加,误差率应下降 1/10。这与我们在现实世界实验中观察到的情况非常吻合(实验中的数值约为 0.095,非常接近 1/10)。论文还暗示,如果你让 AI 变得更大(增加更多参数),它的表现也会以类似的方式提升,但效率可能略低,就像生物有机体一样,更大的身体需要更多的支持系统,而这些系统的增长速度并不一定与肌肉同步。
这意味着什么(以及它不意味着什么)
这是一篇“理论”论文,这意味着它是一个基于观察和物理类比来解释事物可能如何运作的数学模型。它并没有“证明”AI 真的就是一种流体或星系,但它表明,描述这些事物的数学也描述了 AI 的学习。
作者谨慎地指出,这是一个“随机多尺度理论”——这是一个高级说法,指的是关于发生在许多不同规模上的随机过程的理论。论文反对认为 AI 学习是一个简单的、平滑曲线的观点。相反,它表明这是一个复杂的、两阶段的过程,其中 AI 不断地在扩张知识与压缩知识之间进行权衡。
论文还指出,虽然数学模型与他们测试的模型(如 Pythia 系列模型)的数据相符,但我们需要在更多类型的 AI 上进行测试才能确定。这是一个充满前景的新视角,就像戴上了一副眼镜,让我们能够看到机器如何学习的隐藏物理学,但作者也承认,仍需大量工作来确认这种“湍流”是否真的是驱动所有 AI 的引擎。
简而言之,这篇论文表明,AI 如何学习的秘密可能就隐藏在使咖啡奶油混合或星系形成的同样旋转的混沌之中。通过将 AI 的学习过程视为由语言统计驱动的物理系统,作者提供了一种全新的、生动的视角,让我们理解为什么这些模型会变得更好,以及它们究竟是如何做到的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。