← 最新论文
🤖 machine learning

Enhancing Automated Machine Learning via Homogeneous Train-Test Splitting Methods

本文提出了一种用于训练集-测试集划分的优化分布方法,该方法通过显式最大化子集之间的统计相似性,在十五个 UCI 数据集上优于五种既定策略,实现了最高的平均 MMD 相似度得分 89.0%,并缓解了由分布不匹配引起的评估不稳定性。

原作者: Yearn Tan Yin Tze, Charles Grellois

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yearn Tan Yin Tze, Charles Grellois

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正试图发明完美披萨新配方的厨师。为了知道你的配方是否真的美味,你不能只品尝你自己做的披萨;你需要让陌生人进行盲测。但问题在于,如果你只给陌生人吃那些和你练习时完全一样的披萨,他们可能会觉得你的披萨棒极了,但实际上它只是平庸之作。在计算机科学领域,特别是机器学习领域,计算机通过研究数据来学习,就像厨师研究食材一样。为了观察一台计算机是否学得很好,科学家们将数据分为两堆:一堆是供计算机学习的“训练集”,另一堆是供计算机稍后证明其技能的“测试集”。

大问题在于:你该如何划分这些数据?如果你只是随机地将数据扔进两堆,你可能会不小心把所有简单的例子都给了计算机去学习,而把所有困难的例子都留给了测试。或者,如果数据中存在隐藏的模式(比如一堆看起来很相似的食材聚集在一起),随机划分可能会完全错过这些模式。这至关重要,因为如果划分不公平,计算机可能会认为自己是个天才,而实际上它只是运气好;或者它可能会认为自己是个失败者,而实际上它其实非常出色。能否正确完成这次划分,决定了一台计算机是能在现实世界中正常运作,还是会彻底崩溃。

这篇由 Yearn Tan Yin Tze 和 Charles Grellois 撰写的论文,就像是一场严谨的味觉测试竞赛,旨在看看哪种数据划分方法最为公平。作者研究了五种不同的数据划分方式,其中包括一些传统的技巧和一种由他们发明的新方法,名为“优化分布法”(Optimised-Distribution)。他们在十五个不同的数据集上测试了这些方法,这些数据集的规模从大约 150 个条目的小型集合到拥有超过 250,000 条条目的庞大数据库不等。

研究人员发现,一些专家使用的流行且高级的方法实际上会让划分变得更糟。他们发现,那些旨在为训练集挑选最“多样化”或最“极端”样本的方法(如 Kennard–Stone 和 SPXY 算法)往往会导致训练集看起来与测试集完全不同。这就像如果你只训练一位厨师去处理辛辣、烧焦且形状怪异的披萨,然后又让他去评判一个正常的、新鲜的披萨。这位厨师会感到困惑,结果也会一团糟。事实上,这些高级方法在名为 MMD 的“相似性测试”中得分接近于零,这意味着这两堆数据在本质上是不同的。

另一方面,作者的新方法“优化分布法”将划分视为一种平衡行为。它不仅仅是随机挑选样本或挑选最极端的样本,而是不断地在训练集和测试集之间检查并交换数据,以确保它们在统计学上是完全一致的。这种方法赢得了比赛,平均实现了 89.0% 的相似度得分,是所有测试策略中最高的。

然而,论文还提供了一个非常重要的现实提醒。作者发现,虽然拥有完美的划分是非常棒的,但它并不总是会改变最终的分数。如果数据量非常庞大(例如那个拥有 253,680 条条目的数据集)或者非常容易理解,即使是随机划分也行得通,因为计算机拥有如此多的信息,它必然能学到正确的模式。这种新方法在数据量小、杂乱或棘手时表现最为出色。在这些特定情况下,使用糟糕的划分方式会让计算机看起来表现很差,而使用作者的新方法则能帮助它表现得更加可靠。因此,虽然你不一定总是需要一个完美的划分,但当你处理有限或困难的数据时,这种新的分饼方式能确保计算机获得一个证明其真实技能的公平机会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →