Proper Dataset Valuation by Pointwise Mutual Information
本文提出了一种信息论框架,通过量化策展数据与测试数据之间的互信息来评估数据策展方法,从而克服了传统基于测试得分的指标可能导致过度拟合且无法捕捉真实信息量的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的现代时代,用于训练机器的数据质量已变得与机器本身的复杂性同样重要。多年来,盛行的观点是数据越多越好,这导致了海量文本和图像的收集。然而,随着这些系统规模的扩大,研究人员意识到,仅仅增加容量是不够的;数据必须经过策划、过滤和精炼,才能真正发挥作用。该领域的核心挑战在于,如何辨别哪些数据清洗和选择方法能真正提高模型的学习能力,而哪些方法仅仅是诱使系统在特定测试中表现得看似聪明,却并未真正理解世界。这是一个测量问题:如果你仅凭模型在已知考试中的表现来评判一种数据选择方法,你可能会鼓励那些倾向于记忆考题而非教授底层规律的策略。
来自清华大学、斯坦福大学和 Together AI 的一个研究团队提出了一种评估这些数据策划方法的新方式,这种方式超越了最终的测试分数,转而衡量数据集所提供的实际信息量。他们认为,一个好的数据集应该是能够减少关于任务真实规则之不确定性的数据集,他们利用一个框架将这一概念形式化,以确保更具信息量的数据能带来更好、更具泛化能力的模型。为此,他们开发了一种方法,通过一种被称为“互信息”的数学概念,来计算一个策划后的数据集能告诉我们多少关于另一个独立测试数据集的信息。他们的工作表明,传统的测试往往会奖励那些让训练数据看起来与测试数据高度相似的策略,而这种做法会降低模型处理新的、未见情况的能力。相比之下,他们的新评分系统能够正确识别出何时一个数据集已被剥夺了其真正的学习价值,即便模型的测试分数看起来有所提高。
研究人员首先指出了目前业界判断数据质量的一个缺陷。标准做法是获取一个数据集,使用某种新技术对其进行清洗,然后用其训练一个模型,并观察该模型在基准测试中的表现。虽然这看起来合乎逻辑,但它创造了一种危险的激励机制。如果数据策划者完全了解测试的内容,他们就可以调整训练数据以完美匹配测试分布。这可能会提升在该特定考试上的得分,但这通常意味着模型只是学会了识别测试中的特定模式,而非学习任务的普遍原理。研究人员称之为“策略性”策划。这是一种操纵系统的行为,使得数据关于问题的本质变得不再具有信息量,尽管测试结果看起来更好了。为了解决这个问题,他们需要一种能够直接衡量“信息量”的方法,且这种衡量应独立于模型在特定问题集上的得分表现。
他们转向了信息论中的一个概念——布莱克威尔排序(Blackwell ordering),该概念提供了一种严谨的方式来比较不同数据集包含关于未知真相的信息量。简单来说,如果一个数据集比另一个数据集更能让你对隐藏的真相做出更好的决策,那么它就被认为是更具信息量的。研究人员表明,如果一种数据策划方法使得数据集根据这种排序变得更缺乏信息量,那么它就是一种应当被惩罚的策略性方法。为了在实践中衡量这种信息量,他们建议计算策划后的训练数据与测试数据之间的互信息。互信息是衡量知道一件事能告诉你多少关于另一件事的信息的一种度量。如果训练数据和测试数据在彼此之间具有高度的信息性,则表明训练数据捕捉到了问题的真实底层结构。如果一种策划方法削弱了这种联系,那么它很可能正在移除有价值的学习信号。
挑战在于,为大规模、复杂的数据库计算这种互信息是极其困难的。现有方法在处理小型、简单的成对数据点时效果良好,但在面对成千上幅图像或文档的高维复杂性时就会失效。为了克服这一点,该团队设计了一种新颖的方法,将数据集视为训练机器学习模型的工具。他们不再尝试直接比较原始数据点,而是通过在训练数据和测试数据上分别训练一个贝叶斯模型(一种估计不同结果概率的模型),通过分析模型在看到训练数据与看到测试数据时其对世界的信念是如何变化的,从而推导出一个精确的得分。这个得分被称为逐点互信息(PMI)得分,它充当了数据质量的“真相守护者”。
研究人员在多个现实场景中测试了他们的方法,范围涵盖了从图像分类任务到大型语言模型训练。在一组实验中,他们创建了包含基本特征(如数字的形状)和非基本特征(如背景颜色)的数据集。随后,他们应用了两种不同的策划策略:一种是通过移除错误标记的数据来提高质量;另一种则是基于非基本背景颜色来移除数据,使训练集看起来更像测试集。结果非常鲜明。传统的测试得分法给出了更高的分数给那项基于背景颜色移除数据的策略,错误地暗示这是一种更好的方法。实际上,这种策略降低了数据集向模型传授关于实际数字形状知识的能力。然而,新的 PMI 得分却正确地为这种策略性移除分配了较低的分数,识别出它剥夺了数据的真实学习价值。
针对大型语言模型的进一步实验强化了这些发现。团队使用了旨在测试模型能否泛化到新型、未见问题类型的设计数据集。他们比较了三种选择训练数据的方式:一种是最大化多样性,一种是随机选择,另一种是专注于高度相似、冗余的样本。在训练数据自身的分布上的标准测试准确率更青睐于那种冗余、低多样性的选择,并给予其最高分。然而,当这些模型在完全不同的现实世界数据集上进行测试时,受冗余数据训练的模型表现最差。相反,PMI 得分将多样化、高质量的数据排在首位,这与模型的实际泛化能力完美契合。这证实了新指标成功地区分了那些真正教导模型的、以及那些仅仅帮助模型记忆特定测试的数据。
这项工作的意义对于人工智能的未来至关重要。随着模型变得越来越强大,瓶颈正从计算能力转向它们所消耗的数据质量。如果研究人员继续依赖测试分数来策划数据,他们可能会构建出脆弱且在面对意外情况时容易失效的模型。新的 PMI 评分函数提供了一种方式,确保数据策划工作聚焦于真正的学习而非策略性操纵。通过提供一种可靠的衡量数据集真实信息量的方法,该方法有助于开发者构建不仅擅长通过考试,而且能够稳健地理解其所设计的复杂多变世界的系统。研究结论指出,尽管传统指标可能会产生误导,但一种基于训练数据与测试数据之间关系的、基于信息论的方法,为评估驱动现代智能的数据质量提供了一条清晰且有原则的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。