← 最新论文
📊 statistics

Asymmetric Scaling Laws from Sparse Features

本文提出了一种基于稀疏激活的神经缩放定律模型,揭示了一种导致双重下降行为的新颖瓶颈,该行为具有不同的欠参数化和过参数化缩放指数,最终证明在固定预算下计算最优的训练优先增加数据集规模而非模型容量。

原作者: John Sous, Michael Winer

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: John Sous, Michael Winer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人在一座庞大的图书馆中识别书籍里的模式。通常,我们假设如果你给机器人更多的书籍(数据)或一个更强大的大脑(更多参数),它的智能会以稳定、可预测的速度提升。这就是科学家们所称的“缩放定律”。

然而,这篇论文指出,当这些书籍中的信息是稀疏的——意味着大部分页面是空白的,只有少数特定的词汇承载实际意义——规则就会完全改变。机器人表现出的行为取决于它是受限于大脑的大小,还是受限于已阅读的书籍数量。

以下是用简单类比对论文主要观点的拆解:

1. “稀有关键词”问题

想象图书馆里藏有数百万本书。大多数时候,书籍谈论的是像“猫”或“狗”这样常见的事物。但偶尔,一本书会包含一个非常罕见、高度具体的词,比如“嗜铬细胞瘤”(一种特定的医疗状况),或者对罕见金融危机的引用。

  • 在正常(稠密)的世界里:每个词都频繁出现。如果你有更多的书,你会更频繁地看到每个词。如果你有一个更大的大脑,你就能记住更多的词。这种改进是对称的。
  • 在这篇论文的“稀疏”世界里:稀有词如此罕见,以至于即使你读了 1,000 本书,你也可能一次都看不到“嗜铬细胞瘤”这个词。如果你从未见过它,无论你的机器人头脑有多大,它都无法学会这个词。

2. 两种不同情境下的两条不同规则

作者发现,机器人的学习速度遵循两条不同的定律,具体取决于哪种资源是瓶颈:

  • 情境 A:大脑太小(参数不足)
    如果机器人有一个微小的头脑,它只能容纳少数几个概念。无论你给它 100 万本书还是 100 本书,它都只能学会它能塞进脑子里的那几个最常见的事物。

    • 结果:增加更多的书籍帮助不大。你必须让大脑变大才能学到更多。这种改进速度很快。
  • 情境 B:大脑巨大,但书籍稀缺(参数过剩)
    现在,给机器人一个巨大的头脑。它本可以学会一切,但它受限于书籍。由于“稀有关键词”如此罕见,机器人可能读了 1,000 本书却依然错过了那些稀有词。它需要阅读多得多的书籍,仅仅为了瞥见那些稀有词一眼。

    • 结果:增加更多的算力没有帮助,因为机器人正遭受数据饥渴。这种改进要慢得多。

重大发现:学习的“速度”(指数)对于大脑大小和数据大小是不同的。过去,人们认为这些速度是相同的。这篇论文证明,稀疏性打破了对称性,创造了一个“双重下降”曲线:在跨越拥有足够数据以发现稀有词的阈值之前,性能会先下降,然后再次上升。

3. “计算预算”困境

想象你有一笔固定的资金(计算预算)用于训练。你可以花钱买更多的书(数据),或者建造一个更大的大脑(模型规模)。

  • 旧思维:你应该将资金平均分配给书籍和大脑。
  • 新发现:由于稀有词极难找到,你应该将几乎所有的资金都花在书籍上
    • 为什么?因为如果你已经读过的书中没有那些稀有词,让大脑变大也无济于事。你需要一个庞大的图书馆,以确保机器人至少能看见一次那些稀有且高价值的关键词。论文表明,最优策略会大幅转向收集更多数据,而不是构建更大的模型。

4. “稳定性”警告

论文还考察了机器人是如何学习的(使用一种称为梯度下降的方法)。

  • 风险:如果机器人试图学得太快(使用较大的“步长”),它可能会被单个极其罕见且响亮的“尖峰”数据(在一本书中出现的非常不寻常的词)搞糊涂。这可能导致机器人崩溃或无法学习。
  • 对策:论文计算了这种崩溃发生的概率。它表明,虽然这种情况很罕见,但在稀疏环境中,它发生的频率比我们想象的要高。这表明在现实世界中,我们可能需要更加谨慎地控制机器人的学习速度,以避免这些“稀有尖峰”导致的崩溃。

5. 这对“聪明”的机器人有效吗?

作者不仅在简单的线性机器人上测试了这一点,还在具有非线性层的“聪明”机器人(如现代人工智能)上进行了测试。

  • 结果:即使拥有复杂、非线性的头脑,不对称性依然存在。数据的稀有和稀疏本质是根本原因,而非机器人头脑的简单性。无论机器人是简单还是复杂,如果数据是稀疏的,缩放规则就会改变。

总结

这篇论文告诉我们,在一个重要信息隐藏于稀有、稀疏信号中的世界里:

  1. 数据为王:你需要比模型规模多得多的数据来发现那些稀有信号。
  2. 对称性被打破:扩大数据的规则与扩大模型规模的规则不同。
  3. 不要贪心:如果你只是让模型变大而没有获取更多数据,你就会撞上一堵墙,模型无法学会那些稀有且重要的事物,因为它从未见过它们。

核心信息是,稀疏性从根本上改变了我们构建和训练人工智能的方式,迫使我们优先考虑海量数据集,而非庞大的模型规模,以捕捉那些稀有且高价值的洞察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →