← 最新论文
💻 computer science

When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

本文研究了数据匮乏情况下的稀疏语言模型训练,证明了稀疏性不仅提高了效率,还延迟了数据饱和,并实现了一种能够优化活跃参数、数据重复与计算预算之间性能权衡的新型缩放法则。

原作者: Boqian Wu, Qiao Xiao, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Mykola Pechenizkiy, Elena Mocanu, Torsten Hoefler, Decebal Constantin Mocanu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Boqian Wu, Qiao Xiao, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Mykola Pechenizkiy, Elena Mocanu, Torsten Hoefler, Decebal Constantin Mocanu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:教材不够用了

想象一下,你正在试图教一个聪明的学生(AI)如何像人类一样写作。在过去,策略很简单:“给他们越多的教科书(数据),并且把他们的脑容量(模型大小)做得越大,他们就会变得越聪明。”

但高质量的教科书快用完了。互联网上的优质写作内容是有限的,而我们已经读过了其中的大部分。现在,我们面临的情况是:我们必须通过一遍又一遍地阅读同样的几本书来教这个学生。

旧的规则是:“如果你把同一本书读了 10 遍,你会感到厌倦并停止学习新事物。”这被称为“收益递减”。这篇论文提出了一个问题:当我们不得不重复使用相同的数据时,有没有一种方法可以保持有效的学习?

解决方案:“稀疏”教室

研究人员尝试了一种新的教学方法,称为稀疏训练(Sparse Training)

为了理解这一点,请想象两个教室:

  1. 密集型教室(The Dense Classroom): 教室里的每个学生都被迫听每一场讲座,并对每一个主题做笔记。如果老师重复讲授一次讲座,每一个学生都会再次听到它。最终,学生们会感到厌倦,课堂也会停止学习。
  2. 稀疏型教室(The Sparse Classroom): 老师制定了一条规则:“只有 50% 的学生会听这场讲座。另外 50% 的学生则休息。”但这里有个转折:谁在听,每次都在变化。
    • 在讲座 1 中,学生 A 在听。
    • 在讲座 2 中,学生 B 在听。
    • 在讲座 3 中,学生 C 在听。

尽管老师是在重复完全相同的讲座(数据),但每次在“听”的学生(AI 的组成部分)却是不同的。这让“课堂”保持新鲜感,防止了当相同的脑部区域反复接收相同信息时所产生的厌倦感。

他们的发现

研究人员在从小型到非常大型(高达 20 亿参数)的 AI 模型上测试了这种方法,并发现了三个主要结论:

1. 稀疏性延迟了“厌倦”(数据饱和)
在普通的课堂上,如果你读一本书 4 遍,学生就会停止学习。但在“稀疏型教室”中,学生可以在开始感到厌倦之前,处理阅读那本相同的书 6 到 7 次

  • 核心观点: 通过轮换哪些部分的 AI 在“听”,你可以更长时间地重复利用有限的数据,而不会让 AI 陷入停滞。

2. 稀疏性的“金发姑娘区”(最佳平衡点)
你可能会想:“如果 50% 很好,那么 90% 会更好吗?”研究人员发现事实并非如此。

  • 稀疏度太低(密集型): AI 很快就会感到厌倦。
  • 稀疏度太高(90% 以上): AI 没有足够的“学生”在听,导致无法学习全局观。
  • 恰到好处(适中,约 50%): 这是甜点位(Sweet Spot)。它在保证有足够多的“耳朵”去学习的同时,通过保持旋转新鲜感来延迟厌倦。

3. 最好的策略取决于你的目标
该论文确定了两种不同的“获胜策略”,取决于你更看重什么:

  • 如果你想要绝对的最佳性能(最低损失/Loss): 你应该追求适度的稀疏度(约 50%)。对于你拥有的数据,这能提供最好的结果。
  • 如果你想要节省成本/计算能力(计算最优/Compute-Optimal): 你应该追求更高的稀疏度(约 60-75%)
    • 类比: 想象你有一个固定的学校旅行预算。
      • “适中”策略能让你在旅行中获得最好的成绩。
      • “高稀疏度”策略能让你获得与最好的学校相同的成绩,但你为此花费的钱要少 8 到 10 倍

新的规则手册(缩放法则/Scaling Law)

研究人员创建了一个新的数学公式(“缩放法则”)来预测 AI 的表现如何。

  • 旧规则: 性能取决于 模型大小 + 数据量。
  • 新规则: 性能取决于 模型大小 + 数据量 + 你重复数据的次数 + 你的模型有多“稀疏”(即旋转程度)

这个新公式准确地预测了:如果你缺乏数据,你不应该仅仅构建一个更大的大脑;你应该构建一个更稀疏的大脑,并让它轮流关注。

总结

当数据匮乏时,你不能只是继续以同样的方式进行训练。这篇论文表明,通过使用稀疏训练(即让 AI 的不同部分轮流从相同的数据中学习),你可以:

  1. 让 AI 在相同数据上学习得更久,而不会感到“厌倦”。
  2. 训练出巨大的模型,其智能程度与旧模型相当,但使用的计算能力减少了 8 到 10 倍
  3. 找到完美的平衡点(约 50%-75% 的稀疏度),以实现针对特定情况的最佳效果。

简而言之:当数据稀缺时,不要仅仅把模型做大;要让它更聪明地去“听”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →