← 最新论文
💬 NLP

Spokes: Optimizing for Diverse Pretraining Data Selection

该论文介绍了 SPOKES,这是一个通过使用 G-Vendi 分数和指数梯度下降直接优化数据多样性的概率多样化框架,并证明了同时针对质量和多样性进行预训练数据选择的方法,在下游性能方面显著优于现有基准和随机采样。

原作者: Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正试图用有限的食材(数据)创造出一场完美、盛大的饕餮盛宴(预训练 AI 模型)的大厨。你的仓库里有数百万份食谱,但你只能使用其中特定数量的食谱进行烹饪。

核心问题是:你应该挑选哪些食谱?

大多数大厨(AI 研究员)有两种主要的挑选方式:

  1. 随机抓取一把: 你可能会得到不错的组合,但也可能不小心选了 50 个味道完全一样的“香辣鸡肉”食谱。这太枯燥且重复了。
  2. 只挑选评分最高的食谱: 你过滤掉了差的食谱,但你可能会得到 50 个全是“高端法式料理”的食谱。你会缺失多样性,比如街头小吃、甜点或汤品。你会缺乏多样性。

这篇论文介绍了一个名为 SPOKES 的新工具(其名称代表一种优化数据多样性的方法)。以下是它的工作原理,通过简单的解释说明:

问题所在:“多样性”难以衡量

作者说,“多样性”就像轮子的辐条。如果所有的辐条都挤在一起,轮子就会失衡,无法滚动。你希望辐条(你的数据)能均匀地分布在圆周各处。

问题在于,你不能仅凭一份食谱来判断它是否具有多样性。你必须观察每一份食谱是如何与每一份其他食谱相互作用的。如果你试图检查所有可能的食谱组合,以寻找完美的轮子,那将耗时比宇宙的寿命还要长。这在计算上太难了。

解决方案:SPOKES

SPOKES 不仅仅是靠猜测或使用简单的规则(比如“按主题分组”),它使用一种聪明的数学技巧来直接针对多样性进行优化。

1. “梯度”指南针
SPOKES 不仅仅是阅读文本内容(这就像看书的封面),它观察的是食谱如何改变大厨的大脑。在 AI 术语中,这被称为“梯度”。

  • 想象两份食谱:一份蛋糕食谱和一份披萨食谱。
  • 如果你教大厨做蛋糕,他们的大脑会向一个方向转变。
  • 如果你教他们做披萨,他们的大脑会向完全不同的方向转变。
  • SPOKES 测量这些“大脑转变”。它希望挑选那些能让大厨的大脑向尽可能多样的方向推动的食谱,从而确保大厨学习到广泛的技能。

2. “辐条”类比
该方法将数据视为轮子的辐条。它使用一个叫做 G-Vendi 分数 的数学分数来衡量辐条分布得是否均匀。

  • 随机采样: 辐条是杂乱且堆积在一起的。
  • SPOKES: 它重新排列辐条,使其像完美的自行车轮一样,间距完美且均匀。

3. “质量”与“多样性”的平衡
有时,你只想追求最高质量的食谱(质量过滤);有时,你想要最多的多样性(多样性)。SPOKES 让你可以将这两个目标结合起来。

  • 你可以告诉 SPOKES:“我要 90% 的多样性和 10% 的质量,”或者“我要两者的完美平衡。”
  • 论文发现,最好的结果来自于平衡两者。这就像你的菜单既有最高评价的菜肴,又有极其丰富的菜系,而不是只有顶级的法式料理。

他们发现了什么?

作者在两个大规模互联网文本库(称为 DCLM 和 FineWeb)上进行了测试。

  • 更好的多样性: 当他们使用 SPOKES 挑选 500,000 份文档时,其“多样性分数”比随机挑选高出了 489 点。现有的方法(如仅仅是去除重复项)仅实现了微小的 7 点提升。
  • 更聪明的 AI: 当他们用 SPOKES 挑选的数据训练一个小型 AI 模型(LLaMA-1B)时,该模型变得更聪明了。
    • DCLM 数据集上,性能提升了 1.5 点
    • FineWeb 数据集上,性能提升了 1.4 点
  • 令人惊讶的发现: 即使 SPOKES 挑选的数据在“质量评分”(根据标准过滤器)方面略低,AI 的表现依然更好。这证明了多样性与质量同样重要。一套由“还可以”的食谱组成的多元化菜单,比一套虽然“完美”但千篇一律的食谱能教会大厨更多知识。

核心结论

SPOKES 是一种新的 AI 训练数据选择方法。它不是简单地挑选“最好”或“随机”的数据,而是通过数学手段确保数据像轮辐一样分布均匀。这创造了一个更平衡、更多样且最终更聪明的 AI 模型,即使在数据量有限的情况下也是如此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →