← 最新论文
📊 statistics

Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining

本文将大语言模型的数据混合问题重新定义为一个经典的混合实验,提出利用稀疏谢费(Scheffé)响应面模型和模型稳健的最优设计,通过显式捕捉各领域之间的加性效应与交互效应,从而高效地识别最优数据分配方案。

原作者: Yicheng Mao, Hongru Du

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yicheng Mao, Hongru Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能系统的性能在很大程度上取决于其在初始训练阶段所摄取的“饮食”。正如人类儿童根据接触的是故事、技术手册还是日常对话而产生不同的学习方式一样,大型语言模型通过其所接收的特定文本组合来学习其能力。研究人员早已知晓不同类型数据的比例至关重要:给模型提供更多的代码可能会使其更擅长编程,而提供更多的科学文章则可能提高其推理能力。然而,模型能够处理的数据总量受限于固定的计算能力预算。这产生了一个难题:如果你有固定的训练时间,该如何决定究竟要在每种类型的文本上花费多少时间?增加某一主题的份额必然意味着减少另一主题的份额,如果这种平衡掌握不好,就会浪费昂贵的计算资源,并导致机器的能力下降。

最近,科学家们尝试通过在各种数据混合物上训练小型、廉价的模型版本来解决这个问题,希望利用这些结果来指导更大、更强大的系统的训练。由卡尔加里大学和弗吉尼亚大学研究人员进行的一项新研究表明,整个过程不仅仅是一个猜测或随机采样的问题,实际上是一个经典的统计实验,被称为混合实验(mixture experiment)。在这种视角下,不同的数据源就像食谱中的原料,目标是找到完美的配比。研究人员将一种最初用于制定化学产品或食物配方的特定数学框架应用于人工智能训练问题。通过将数据混合视为一种结构化的实验而非随机猜测,他们能够揭示不同类型文本之间的隐藏关系,并表明研究人员选择测试混合物的方式可以变得更加高效。

该团队使用了来自先前研究的一个名为 RegMix 的公开数据集,该研究涉及在 17 种不同类型的数据(从维基百科文章、法律文件到源代码和聊天记录)上训练 512 个小型模型。研究人员没有使用那些仅能预测最佳结果而不解释原因的复杂“黑箱”机器学习工具,而是采用了一种将结果分解为两个部分的方法:每种数据类型的个体价值,以及仅在两种特定类型结合时才会出现的特殊价值。他们发现,数据源的价值并非固定不变,而是取决于它与什么混合在一起。例如,某些在单独考虑时显得微弱或无用的领域,在与网络衍生的文本配对时会变得非常有价值。分析显示,最强大的组合不仅在于将好的成分相加,还在于特定的成分对如何相互作用,从而比预期更有效地降低模型的误差。

这种方法还让研究人员看到,他们在小型模型中发现的关系即使在观察更大规模的模型时依然成立。该方法成功预测了哪些数据混合物在不同规模下表现最佳,其准确性与更灵活但缺乏可解释性的机器学习模型相匹配。至关重要的是,这项研究表明,研究人员目前选择测试混合物的方式可以得到改进。在原始的 RegMix 研究中,测试混合物的选择是随机的,就像从帽子里抽签一样。这项新研究证明,通过使用特定的设计策略来选择测试点的分布位置,科学家可以用大约减少 25% 的训练次数来实现同样的理解水平。这意味着测试数据混合物的昂贵过程可以变得更便宜、更快,且不会损失寻找最佳训练配方的能力。

研究结果表明,人工智能训练领域应当不只将数据混合视为一个预测问题,而应视为一个刻意的实验设计问题。通过认识到测试混合物的选择与对结果的分析同样重要,研究人员可以节省大量的计算能力。该研究证实,最佳的数据混合通常是由不同来源如何互补来定义的,而不是由任何单一来源的质量决定的。虽然具体结果源自特定的数据集和模型,但该框架提供了一种清晰、结构化的方式来思考如何“喂养”人工智能,将一个复杂的分配问题转化为一个可以指导开发更聪明、更高效语言模型的、可解的实验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →