✨ 要点🔬 技术摘要
想象一下,你正试图烤出一个完美的蛋糕,但你手头没有食谱。你知道味道取决于两件事:你用了多少面粉(蛋糕的大小)以及你烤了多久(时间的长短)。在人工智能的世界里,科学家们正试图寻找这种完美的“食谱”,用来训练被称为 Transformer 的巨型类脑计算机。他们想知道:如果我有一笔固定的钱用于支付电费和计算机时间,我应该建造一个微型大脑并喂给它一座数据大山,还是建造一个巨大的大脑并只喂给它一点点数据?
为了弄清楚这个问题,研究人员必须进行数学计算。他们统计“配料”(大脑的大小)和“精力”(所需的计算机工作量)。但棘手的部分在于,就像烘焙师根据是否包含碗的重量或仅计算面粉本身来以不同的方式计算“杯数”一样,AI 科学家也用不同的方式统计“配料”和“精力”。有些人统计大脑的所有部分,而另一些人只统计主要的思考部分。有些人统计原始的数学运算,而另一些人则统计计算机实际工作的秒数。多年来,大家都认为这些不同的计数方式并不重要,因为他们研究的大脑都非常巨大,以至于那些额外的部分微不足道。但如果你是在烤一个小纸杯蛋糕而不是一个巨大的婚礼蛋糕,情况会怎样?计数的不同方式是否会突然改变食谱?
独立研究员亚历山大·梅明明(Alexander Memming)撰写的这篇论文正是提出了这样一个问题。作者决定不再猜测,而是开始测量。梅明明没有去观察只有巨头公司才负担得起的庞大且昂贵的 AI 模型,而是构建了一个由 35 个较小、可控的 AI 模型组成的网格。他在相同的规则下,使用相同的教育文本训练了所有模型,但他对结果进行了四种不同的分析,仅仅改变了他统计“规模”和“成本”的方式。
研究结果有点像是发现你的厨房秤在称量少量物体时会撒谎。论文发现,当你使用旧的、简单的计数方法(忽略了大脑的“输出头”)时,数学计算会建议你应该建造一个比更精确的计数法所建议的规模小约 19 倍的模型。换句话说,取决于你使用哪把“尺子”,推荐的食谱会发生剧烈变化。指数——一个告诉模型应如何增长的数字——仅仅通过改变会计方法就从 0.25 移动到了 0.42。这是一个巨大的差异,这意味着两个科学家即使观察的是完全相同的训练过程,也可能仅仅因为使用了不同的数字定义,而发表完全不同的“最优”食谱。
然而,有一个转折让正在实际构建这些模型的人感到没那么可怕。尽管在理论上食谱 看起来非常不同,但做出来的蛋糕 味道几乎是一样的。作者发现,最佳性能的“谷底”是非常平坦的。这意味着,如果你遵循错误的食谱(基于旧的、简单的计数方法),你并不会浪费掉你的整个预算。你可能会浪费大约 18% 的计算量,但最终结果仍然非常接近最佳结果。论文得出结论,虽然我们需要非常小心地报告我们的数字,以便科学家们能够进行“苹果对苹果”式的比较,但会计方法稍有偏差所带来的实际成本却小得令人惊讶。那个“完美”的食谱是一个移动的目标,但“足够好”的食谱范围比我们想象的要宽得多。
技术摘要:什么才算计算量?关于计算最优 Transformer 训练中会计惯例的实证分析
问题陈述 推导 Transformer 的计算最优训练方案涉及两个关键但往往隐含的选择:定义“模型大小”(什么算作参数)以及定义“计算量”(什么算作训练成本)。该领域两个被引用最多的研究——Kaplan 等人 [2020] 和 Hoffmann 等人 [2022]——做出了不同的选择:前者仅计算非嵌入参数,而后者计算总参数量。两者都依赖于近似公式 C ≈ 6 N D C \approx 6ND C ≈ 6 N D (其中 N N N 为参数,D D D 为 token 数),忽略了输出 Softmax 投影和注意力机制的计算成本。
虽然这些近似值在处理前沿规模模型(如 GPT-3、Chinchilla)时是成立的(因为此时嵌入层和输出头开销可以忽略不计),但在学术界和较小规模研究可及的较小规模下,这些近似值会失效。在这些规模下,输出投影可能消耗大部分训练 FLOPs,且嵌入参数可能在参数计数中占据主导地位。本文探讨的问题是:在保持底层训练运行固定的情况下,改变会计惯例会对报告的计算最优前沿(特别是 N ∗ ∝ C a N^* \propto C^a N ∗ ∝ C a 中的指数 a a a 以及每个参数对应的 token 比例)产生多大的影响?此外,遵循次优惯例在实际损失方面会有多少代价?
方法论 作者进行了一项受控的实证扫描,以隔离会计惯例的影响。
模型家族: 训练了 35 个仅解码器(decoder-only)Transformer 模型,基于 FineWeb-Edu 数据集。模型范围从 0.056M 到 5.98M 个非嵌入参数(N n e N_{ne} N n e ),宽度 d ∈ { 48 , … , 288 } d \in \{48, \dots, 288\} d ∈ { 48 , … , 288 } ,且深度与宽度挂钩(L = max ( 2 , d / 48 ) L = \max(2, d/48) L = max ( 2 , d /48 ) )。
词表与计算量: 实验在两种 BPE 词表大小(V = 2048 V=2048 V = 2048 和 V = 8192 V=8192 V = 8192 )下运行,以通过 16 倍的因子改变嵌入/输出头开销的比例。训练计算量在 5.8 倍的范围内变化。
控制变量: 为了消除先前缩放研究(如 Porian 等人 [2024])中识别出的混淆变量,作者通过自身的扫描校准了学习率,使余弦调度与运行长度相匹配,确保没有数据重复,并使用了统一的优化器和分词器。
四种会计惯例: 对相同的 35 次运行在四种不同的规模(N N N )和成本(C C C )定义下进行了分析:
K (Kaplan): N = N n e N = N_{ne} N = N n e ,C = 6 N n e D C = 6N_{ne}D C = 6 N n e D 。
H (Hoffmann): N = N t o t N = N_{tot} N = N t o t (总参数),C = 6 N t o t D C = 6N_{tot}D C = 6 N t o t D 。
F (精确 FLOP): N = N n e N = N_{ne} N = N n e ,C = C e x a c t C = C_{exact} C = C e x a c t (包括注意力矩阵乘法和输出 Softmax)。
W (墙钟时间): N = N n e N = N_{ne} N = N n e ,C = C s e c C = C_{sec} C = C sec (测量的设备时间)。
分析: 作者将数据拟合到一个标准的加性损失曲面(L = E + A / N α + B / D β L = E + A/N^\alpha + B/D^\beta L = E + A / N α + B / D β )上,并为每种惯例推导出了计算最优前沿。此外,他们还推导出了一个闭式关系,可以根据架构本身可计算的两个弹性系数来预测指数的变化。
关键结果
偏移幅度: 在同一数据集上改变会计惯例会导致拟合指数 a a a 发生显著变化,范围在 0.25 到 0.42 之间。隐含的每个参数对应的 token 比例在不同惯例间移动了 19 倍 。
“头部”主导地位: 在小规模下导致差异的主要驱动因素不是注意力机制,而是输出 Softmax 投影 。在最小的模型(d = 48 , V = 8192 d=48, V=8192 d = 48 , V = 8192 )中,输出头消耗了 83% 的训练 FLOPs,使得 $6ND$ 近似值对真实成本的低估高达 8.5 倍 。
预测准确性: 通过两个弹性系数(κ c \kappa_c κ c 和 γ c \gamma_c γ c )推导出的闭式关系成功预测了四种惯例中三种的拟合指数,误差在 0.105 以内。这证实了指数的偏移是一个确定性的算术后果,而非噪声。
排序: 这些惯例一致地表现为 a H < a K < a F a_H < a_K < a_F a H < a K < a F (其中 H H H 是总参数,K K K 是非嵌入且使用 $6ND, , , F$ 是精确 FLOPs),符合理论预测。
实际成本(不对称性): 尽管报告的指数和最优比例存在巨大分歧,但遵循“错误”惯例的实际成本 是适度的。由于 IsoFLOP 损失谷底非常平坦,遵循次优建议最多只会浪费 18% 的计算预算(0.031 nats per token)。三种基于 FLOP 的惯例在计算等效项上彼此差异在 5% 以内。
意义与主张 本文声称,除非明确说明具体的会计惯例(参数定义和成本度量),否则不同研究报告的计算最优指数是不具可比性的 。这种分歧在学术缩放实验通常进行的规模区间内最为显著,因为在此区间,开销比例是非忽略不计的。
然而,本文对于指数的绝对值保持了谦逊,指出这些是特定数据、架构和优化协议的属性,而非通用常数。其主要贡献是结构性的:
它提供了一个转换规则 (公式 12),允许研究人员在不同惯例之间转换指数。
它提供了一个诊断工具 (检查是否满足 a + b = 1 a+b=1 a + b = 1 ),用以识别一项研究是否假设了 $6ND$ 近似。
它证明了虽然簿记选择会造成报告指标在数值上的巨大差异,但损失景观具有足够的平坦性 ,因此这些差异带来的实际惩罚很小。
作者总结道,领域内应明确报告会计惯例以确保可重复性和可比性,但从业者无需对这些偏差导致的推荐方案微调感到恐慌,因为“计算最优谷底”是非常宽容的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。