Hierarchical Data Selection via Manifold Coverage and Sparse Feature Coverage in LLM Post-training
该论文提出了 MASS,一种层级化数据选择框架,通过首先通过低维流形覆盖进行数据分组,随后通过稀疏特征覆盖选择高质量子集,从而提升了大语言模型后训练的效率与性能,在一致优于现有基准测试的同时,往往能以显著更小的数据集达到与全量数据训练相媲美的效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界里,随着模型变得越来越庞大且功能日益强大,一个持久的挑战也随之出现:教导它们所需的海量数据。为了进行有效的学习,这些系统需要庞大的示例库,但收集和处理这些信息既昂贵又耗时。研究人员长期以来一直在寻找一种方法,以识别这些海量集合中最有价值的信息,希望仅使用可用数据的极小且高质量的一部分来训练强大的模型。主流观点认为,如果你能衡量两个数据点之间的差异程度,你就能挑选出一组涵盖所有必要领域的多样化数据集。然而,这种方法经常碰壁,因为用于衡量这些差异的数学空间过于拥挤且充满噪声,将广泛的主题与微小的无关细节及随机误差混杂在一起。
一组研究人员现在提出了一种解决该问题的新方法,将数据的选择视为一个分层的发现过程,而非扁平化的搜索。他们认为,要找到最好的数据,必须首先理解信息的宏观景观,然后深入挖掘其中具有意义的细粒度细节。通过构建一个先按主要主题对数据进行分组,然后再仔细选择样本以覆盖这些主题内微妙变化的系统,他们创造出了一种始终优于现有技术的方案。在涉及复杂视觉和推理任务的测试中,这种新方法使得仅在极小比例数据上训练的模型,其表现能够达到甚至超过使用整个数据集训练的模型。
由来自多所大学的彭孙(Peng Sun)及其同事领导的研究小组开发了一种名为 MASS 的方法,其全称为“流形感知稀疏选择”(Manifold Aware Sparse Selection)。为了理解为什么这很有必要,请想象试图组织一个巨大的图书馆,其中每本书都由一个极其冗长的关键词列表来描述。如果你尝试通过直接比较这些列表来寻找相似的书籍,你可能会因为两本书都包含“快”这个词,就把一本关于猫的书和一本关于汽车的书归为一类,尽管它们的题材完全不同。原始列表由于充斥着过多的次要细节和随机噪声,无法展示图书馆真正的结构。该团队意识到,用于训练现代人工智能模型的数据也具有类似的特征;这些数据的数学表示维度极高且极其复杂,简单的比较无法捕捉到它们真实的相互关系。
为了解决这个问题,该团队设计了一个模仿人类探索新领地的两步走过程。首先,他们使用一种称为“稠密自编码器”(dense autoencoder)的工具,将复杂的数据压缩成更简单、低维的形式。这就像是将一张高分辨率的三维山脉地图,压平为一张清晰的二维地形图,只显示主要的峰峦与谷地,而剔除了每一块岩石和灌木丛的杂乱细节。这一步允许系统识别数据中的主要语义群组,有效地根据主导主题将图书馆划分为“科学”、“历史”和“小说”等不同的区域。这种粗粒度的分组确保了所选数据能够覆盖知识空间的各个主要区域。
一旦数据被组织进这些广泛的组别中,第二步便开始了。在这里,研究人员使用另一种工具——“稀疏自编码器”(sparse autoencoder),来寻找每个组别内部特定的、细粒度的细节。如果说第一步处理的是大局,那么这一步则专注于区分同一类别内不同示例的独特特征。这就像是在“科学”类书籍区行走,并确保所选书籍不仅涵盖了通用的物理学,还涵盖了量子力学、天体物理学和热力学等具体的子课题,而不是仅仅挑选五本关于同一个狭窄主题的书。该工具旨在挑选出最重要的特征,忽略那些常使其他方法产生困惑的噪声和冗余。
研究人员在两个具有挑战性的数据集上测试了这种方法:一个侧重于通用视觉指令,另一个侧位于涉及图像和文本的复杂推理任务。他们将自己的方法与另外九种流行的数据选择技术进行了对比,其中包括随机选择以及基于相似性或重要性评分的方法。结果令人震惊。在从总量的 5% 到 15% 不等的不同数据量下,MASS 方法产生的模型表现始终优于任何其他选择策略。在若干情况下,使用 MASS 筛选出的子集进行训练的模型,其性能甚至超越了使用完整数据集训练的模型,在视觉理解和逻辑推理的基准测试中取得了更高的准确率。
该研究还进行了一系列细致的检查,以了解该方法为何如此有效。研究人员发现,如果跳过第一步,直接从原始的复杂表示中进行分组,结果会变差,这证实了初始压缩对于寻找正确结构的重要性。同样,如果仅使用第二步而没有初始的分组,则无法捕捉到数据的完整广度。两步结合至关重要:第一步提供了稳定的框架,而第二步则确保了丰富的细节覆盖。他们还发现,该系统对分析工具的具体变化具有鲁棒性,即使采用不同类型的数据表示方式,也能表现良好。
这项工作的核心洞察之一是,数据的质量与多样性同样重要。MASS 系统整合了一个质量评分,使其能够避免选择即便具有独特性但质量低劣的样本。这确保了最终的子集不仅具有多样性,而且是可靠的。研究人员指出,虽然该方法在建立分组和特征提取方面需要一些初始计算投入,但与在更小数据集上进行训练所节省的资源相比,这一成本微不足道。准备数据的过程是一次性的投资,它通过减少通常进行大规模训练所需的巨大资源,从而带来长期的回报。
最终,这项工作表明我们看待如何教导人工智能的方式发生了根本性的转变。研究人员证明,与其假设数据越多越好,或者仅仅认为挑选多样化的样本就足够了,不如去尊重数据本身的结构——即先理解宏观景观,再填充具体细节。通过遵循信息的自然层级,人工智能模型可以学习得更加高效。这些发现为那些需要在没有无限计算能力或无尽数据流的情况下训练强大系统的开发者,提供了一条切实可行的路径,证明了只要拥有正确的选择策略,少量的优质数据确实可以发挥巨大的作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。