← 最新论文
💻 computer science

What Counts as Compute? An Empirical Analysis of Accounting Conventions in Compute-Optimal Transformer Training

本文表明,尽管计算参数与计算量统计口径的变化会显著改变拟合出的计算最优训练前沿的指数,但由于损失函数的平坦性,这种变化对训练效率的实际影响是微小的,且具体的统计选择可以从简单的架构比例中进行预测。

原作者: Alexander Memming

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Memming

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烤出一个完美的蛋糕,但你手头没有食谱。你知道味道取决于两件事:你用了多少面粉(蛋糕的大小)以及你烤了多久(时间的长短)。在人工智能的世界里,科学家们正试图寻找这种完美的“食谱”,用来训练被称为 Transformer 的巨型类脑计算机。他们想知道:如果我有一笔固定的钱用于支付电费和计算机时间,我应该建造一个微型大脑并喂给它一座数据大山,还是建造一个巨大的大脑并只喂给它一点点数据?

为了弄清楚这个问题,研究人员必须进行数学计算。他们统计“配料”(大脑的大小)和“精力”(所需的计算机工作量)。但棘手的部分在于,就像烘焙师根据是否包含碗的重量或仅计算面粉本身来以不同的方式计算“杯数”一样,AI 科学家也用不同的方式统计“配料”和“精力”。有些人统计大脑的所有部分,而另一些人只统计主要的思考部分。有些人统计原始的数学运算,而另一些人则统计计算机实际工作的秒数。多年来,大家都认为这些不同的计数方式并不重要,因为他们研究的大脑都非常巨大,以至于那些额外的部分微不足道。但如果你是在烤一个小纸杯蛋糕而不是一个巨大的婚礼蛋糕,情况会怎样?计数的不同方式是否会突然改变食谱?

独立研究员亚历山大·梅明明(Alexander Memming)撰写的这篇论文正是提出了这样一个问题。作者决定不再猜测,而是开始测量。梅明明没有去观察只有巨头公司才负担得起的庞大且昂贵的 AI 模型,而是构建了一个由 35 个较小、可控的 AI 模型组成的网格。他在相同的规则下,使用相同的教育文本训练了所有模型,但他对结果进行了四种不同的分析,仅仅改变了他统计“规模”和“成本”的方式。

研究结果有点像是发现你的厨房秤在称量少量物体时会撒谎。论文发现,当你使用旧的、简单的计数方法(忽略了大脑的“输出头”)时,数学计算会建议你应该建造一个比更精确的计数法所建议的规模小约 19 倍的模型。换句话说,取决于你使用哪把“尺子”,推荐的食谱会发生剧烈变化。指数——一个告诉模型应如何增长的数字——仅仅通过改变会计方法就从 0.25 移动到了 0.42。这是一个巨大的差异,这意味着两个科学家即使观察的是完全相同的训练过程,也可能仅仅因为使用了不同的数字定义,而发表完全不同的“最优”食谱。

然而,有一个转折让正在实际构建这些模型的人感到没那么可怕。尽管在理论上食谱看起来非常不同,但做出来的蛋糕味道几乎是一样的。作者发现,最佳性能的“谷底”是非常平坦的。这意味着,如果你遵循错误的食谱(基于旧的、简单的计数方法),你并不会浪费掉你的整个预算。你可能会浪费大约 18% 的计算量,但最终结果仍然非常接近最佳结果。论文得出结论,虽然我们需要非常小心地报告我们的数字,以便科学家们能够进行“苹果对苹果”式的比较,但会计方法稍有偏差所带来的实际成本却小得令人惊讶。那个“完美”的食谱是一个移动的目标,但“足够好”的食谱范围比我们想象的要宽得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →