Scaling Laws for Classical Machine Learning on Tabular Data: A Benchmark Study
本研究展示了一个大规模、课堂级分布的基准测试,涵盖了 18 个数据集和 6 个模型家族共 11,536 次训练运行,证明了虽然幂律法则能有效描述大多数具有近似共享指数的表格模型的学习曲线,但由于实现细节而非随机种子,显著的方差依然存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何做决策,比如预测客户是否会购买某种产品,或者一笔贷款是否会被偿还。长期以来,科学家们一直痴迷于研究巨型神经网络的“缩放法则”(scaling laws)——这些像大脑一样庞大的计算机驱动着聊天机器人和图像生成器等技术。他们发现了一个神奇的规则:如果你给这些巨兽喂入更多的训练数据、更多的神经元细胞和更多的计算能力,它们的错误率就会以一种完全可预测的方式下降,就像滑梯一样顺着山坡下滑。这个规则变得如此重要,以至于许多公司仅仅为了计算需要购买多少数据,就会投入数百万美元。
但转折点在于:现实世界中的大部分场景并不是由巨型神经网络运行的。它们运行在“表格数据”(tabular data)之上。想想电子表格:每一行是一个客户,每一列是他们的年龄、收入和购买历史。这是商业活动的基石,被广泛用于保险定价、销售预测等各种领域。对于这些任务,更简单、更古老的工具(如决策树和线性模型)往往比那些花哨的巨兽表现得更好。一个关键的问题是:这些更简单的工具是否也遵循同样的“更多数据 = 更少错误”的神奇规则?如果它们遵循,这个规则是对每个人都一样,还是会根据你使用的特定电子表格而改变?直到现在,还没有人在如此大规模的层面上进行过测试,以观察当不同的人尝试运行同一个实验时,这个规则是否依然成立。
这篇论文是一场规模宏大的、教室级别的实验,旨在回答正是这个问题。作者并没有让单一的研究团队进行几次测试,而是组织了 127 名研究生机器学习课程的学生充当独立的科学家。每位学生都被赋予了一套特定的规则,并被分配了三个不同的真实世界数据集(如信用卡违约或房价数据)进行研究。他们必须在这些数据集上训练六种不同类型的“经典”机器学习模型,从极少量的数据开始,逐渐增加数据量,以观察错误率是如何变化的。他们总共运行了超过 11,000 次训练过程,创建了一个庞大的结果库,用以观察一个简单的数学公式是否能预测模型的学习效果。
研究结果非常清晰,但也带有一些重要的注意事项。首先,那个“神奇公式”(幂律)对于大多数模型来说都非常有效。作者发现,在约 78% 的实验中,该公式与数据的拟合程度非常好,能够准确预测随着数据增加,错误率会下降多少。然而,并非所有模型都是平等的。“基于树的模型”(如 Boosting 和随机森林)是其中的佼佼者,它们始终表现优异,并达到了最低的错误率。相比之下,一些模型(特别是 Lasso 回归)完全没有遵循这一规则,往往只是在猜测平均值,而忽略了数据规模的大小。
该研究还探讨了一个引人入胜的问题:对于一类模型家族而言,无论数据集如何变化,是否存在一个统一的“学习速度”?答案是“某种程度上是”。对于六种模型家族中的五种,学生们发现,一个平均的“学习速度”(指数)几乎可以像为每个数据集计算独特速度那样,准确预测模型的行为。这就像是在说,所有同品牌的汽车加速速率大致相同,即使具体的路况有所不同。然而,这并不是一个完美的普遍规律;拟合并不完全精确,而且对于像 Ridge 回归这样的模型,其“速度”非常不稳定,无法被信任。
或许最令人惊讶的发现不在于数据,而在于从事这项工作的人。尽管每位学生都得到了完全相同的指令和相同的随机种子(一个数字起点)以确保他们应该得到完全一致的结果,但他们的最终答案仍然存在细微差异。作者计算出,这种“人为实现噪声”(human implementation noise)——由人们处理缺失数值或编码文本时产生的细微且不可避免的差异所引起——导致了结果中约 14% 的偏差。这表明,当一个研究团队声称发现了某种特定的缩放法则时,由于实验设置本身的原因,存在着大约 14% 的固有“模糊性”。
最后,这篇论文为表格数据的世界提供了一份实用的地图。它证实了对于大多数商业问题,你不需要超级计算机;一个调优良好的树模型很可能会胜出。它提供了一份数据的“购物清单”,估算出对于某些常见问题,你可能只需要几百行数据就能达到很高的准确度,而另一些问题则可能需要数万行。但它也提醒我们要保持谦逊:这些规则是近似的,而非绝对的,而且你准备数据的方式可能会引入与数据本身一样多的不确定性。它提醒我们,在机器学习的世界里,即使是最简单的电子表格,也有其复杂、略显混乱但最终又是可预测的节奏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。