← 最新论文
🤖 machine learning

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts

本文介绍了 MOSAIC,这是一个系统感知的协同设计框架,它证明了只有通过将模型架构与硬件约束进行联合优化,而非仅仅通过传统的计算最优缩放法则,稀疏混合专家模型的最佳稀疏性才会显现。

原作者: Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个终极、最强大的机器人大脑。在人工智能的世界里,这个“大脑”是一个庞大的计算机程序,被称为大语言模型(LLM)。为了让这些大脑变得更聪明,科学家们发现了一个简单的规则:如果给它们喂入更多的数据并让它们变得更大,它们就会变得更擅长理解世界。这个规则被称为“缩放法则”(scaling law)。长期以来,构建这些大脑的配方一直分为两个独立的步骤。首先,一位数学家会根据可用的计算能力(称为“算力”)来计算出大脑的最佳尺寸。然后,另一位工程师会尝试将这个大脑的大小压缩到特定的计算机芯片上,以使其运行得尽可能快。

你可以把这想象成规划一次公路旅行。第一步是根据你的汽油预算决定你想开多远。第二步是挑选汽车。但如果由于你选的汽车太重、太笨拙,导致它极其耗油,这意味着你实际上无法开到原计划的距离,那该怎么办?这就是这篇论文要解决的问题。它认为,你不能先选定一个大脑尺寸,然后再去担心汽车。你必须将大脑和汽车进行协同设计,因为大脑的形状会改变汽车行驶的效率。如果你忽略了汽车的引擎,你最终可能会得到一个“完美”的大脑,但它却太重而无法移动,让你只能困在起跑线上。


问题所在:“完美”却无法适配的大脑

这篇论文介绍了一种名为 MOSAIC(通过系统感知训练进行模型优化的协同设计)的新思维方式。来自亚马逊 AGI 基础团队(Amazon AGI Foundations)的作者们注意到,旧有的做法正在浪费资源。传统上,研究人员会计算一个“计算最优”(Compute-Optimal)的模型。这是指在固定的计算能力下,能获得最佳结果的模型尺寸,前提是假设每一分算力都被完美地利用了。

然而,作者们发现了一个隐藏的陷阱。他们关注的是一种特殊的 AI 架构——混合专家模型(Mixture-of-Experts, MoE)。想象一个巨大的图书馆,与其由一个巨大的图书管理员阅读所有的书,不如拥有数千个微小的专业专家。当一个问题进来时,一个智能路由会将问题发送给仅有的几个专家(例如 100 个专家中的 2 个)来回答。这使得模型非常快速且高效,因为它不需要为每个问题都唤醒整个图书馆。

旧的数学理论认为,为了获得最佳效果,你应该尽可能扩大图书馆的规模,并唤醒尽可能少的专家。换句话说,“完美”的模型应该是极其稀疏的(大部分是空的)。论文指出,如果你只看“我们需要多少次计算?”这种纯粹的数学逻辑,答案总是:“让它尽可能稀疏。”数学上的最优稀疏度始终处于可能性的边缘。

转折点:汽车引擎至关重要

故事在这里发生了变化。作者们意识到,虽然数学说“要极度稀疏”,但计算机芯片的物理现实却说“没门”。

当你拥有一个拥有数千个微小专家的模型时,计算机必须做大量的额外工作,仅仅是为了决定“唤醒哪些专家”以及“如何在专家之间传递信息”。这就像有一个巨大的办公大楼,经理整天都在各个隔间之间奔波递送备忘录,导致实际工作的时间寥寥无几。模型变得越稀疏,计算机在这些“奔波”任务(称为通信成本)上浪费的时间就越多,而用于实际思考(计算)的时间就越少。

论文认为,旧有的“计算最优”数学模型是有缺陷的,因为它假设计算机可以将 100% 的力量都投入到思考部分。而在现实中,一个超稀疏的模型可能只有 8% 的算力用于实际思考,而一个稍密一点的模型可能会有 15%。

解决方案:MOSIC

为了解决这个问题,团队构建了 MOSAIC。他们不再问:“对于固定的数学计算量,最好的模型是什么?”而是问:“在我们的特定计算机集群上,在固定的时间内,我们实际能运行的最优模型是什么?”

他们结合了两个要素:

  1. 缩放法则(Scaling Law): 一个基于模型大小和形状来预测其智能程度的模型。
  2. 性能模型(Performance Model): 一个模拟器,它可以预测模型在真实硬件上的运行速度,并将“奔波”成本考虑在内。

当他们运行 MOSAIC 时,结果令人惊讶。那个“完美”的模型并不是位于稀疏度极端边缘的模型。相反,最好的模型是一个内部解(interior solution)——即一个皆大欢喜的中庸之道。它足够稀疏以保证效率,但又不会过于稀疏,以至于让计算机因为管理那些微小专家而陷入停滞。

他们的发现

团队在使用了 NVIDIA B200 GPU 的真实硬件上进行了测试。他们训练的模型规模从 7 亿到 180 亿个激活参数不等(总参数量高达 790 亿)。

  • 旧方法: 如果你仅仅遵循旧的数学理论,你会选择一个稀疏度约为 0.985(意味着 98.5% 的专家处于睡眠状态)的模型。但在他们的特定集群上,这个模型会非常慢,导致训练时间过长,并且它的智能程度实际上会低于一个稍密一点的模型。
  • MOSAIC 方法: 系统发现,那个“甜点位”(sweet spot)是稀疏度约为 0.96 的模型。这个模型并非“理论上”的最优,但它是“实践上”的最优。它运行得更快,能更有效地利用计算机的算力,并且实现了更低的误差率(意味着它更聪明),甚至超过了那个“理论上”最好的模型。

事实上,他们证明了那个在纸面上看起来最好(拥有最多“模型 FLOPs”)的模型,在现实生活中反而是训练速度最慢的。最终胜出的模型,是那个平衡了数学逻辑与硬件现实的模型。

为什么这很重要

这篇论文表明,我们不能再将 AI 模型的设计与运行这些模型的计算机设计视为两个独立的步骤。你不能仅仅选定一个模型尺寸,然后寄希望于计算机能够处理它。模型的形状会改变计算机的行为。

作者们谨慎地指出,他们的发现是针对他们所使用的特定计算机芯片(NVIDIA B200)以及他们开发的特定软件的。他们并没有发现一个适用于宇宙中每台计算机的通用法则。然而,他们证明了在 AI 训练的前沿领域,忽视“系统”(即硬件以及数据如何移动)会导致次优的结果。

通过使用 MOSAIC,他们展示了“最好的”模型并不是图表上的一个固定点,而是一个取决于你的特定硬件预算的移动目标。最有效的模型是那个像手套一样完美贴合你的集群的模型,而不是那个在纸面上看起来最完美的模型。这是一种从“计算最优”(数学所言)向“集群最优”(硬件所能实际交付)的转变。

简而言之,如果你想构建最聪明的 AI,你不仅需要一个更大的大脑,你还需要一个能完美适配其躯体的大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →