← 最新论文
🤖 machine learning

Understanding the Surprising Generalization Properties of Tabular Foundation Models

本文揭示了表格基础模型可以通过在单个真实表格上进行自监督预训练来实现强大的泛化能力,证明了它们的性能更多地取决于任务和特征的数量与质量,而非海量数据集,并表明其上下文学习机制本质上是基于检索的。

原作者: Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能广袤的版图中,一种持久的观点认为数据存在于截然不同、彼此孤立的世界中。人们认为,一个被训练用来识别手写数字的计算机程序,应该无法帮助房地产经纪人估算房价,因为这两项任务似乎毫无共同之处。这种观点将数据表视为僵化且特定的谜题,其中一个规则不可能适用于另一个。然而,新一代被称为“表格基础模型”(tabular foundation models)的人工智能模型,已经开始挑战这一假设。这些系统的设计初衷不是通过永久记忆单一的数据集来学习,而是通过从被要求解决问题的那一刻所呈现的一系列示例中进行学习。它们通过观察即时提供的少量有标签示例,并利用该上下文来预测新的、无标签的行。研究人员的核心问题在于:这些模型是否需要一个包含数千个不同现实世界数据集的庞大且多样化的库来学习如何泛化,还是说其中存在一种更简单、更基本的机制在起作用。

一个研究团队致力于测试这种学习过程的极限,并以一个令人惊讶且反直觉的实验作为开端。他们仅使用一个真实的现实世界数据集来训练一个强大的 AI 模型:一个包含手写数字向量化图像的表格。在标准设定下,人们会预料到这样一个模型在面对如加州房价或大学入学统计数据等完全无关的任务时会表现得极其糟糕。然而,结果打破了这一预期。该模型在仅见过数字数据的情况下,展现出了在这些完全不同的任务上做出准确预测的强大能力。这一发现表明,模型并非仅仅是在记忆关于数字的事实,而是学习了一种更通用的技能:如何观察一组示例,找到其中重要的部分,并利用它们来解决新问题。

为了理解为什么会发生这种情况,研究人员调查了是什么让一个数据集对于教导这些模型而言是“好”的。他们分析了数十个不同的表格,从小型集合到大型档案库不等,以观察哪些属性会导致最佳性能。他们发现,表中行(即实例)的数量出奇地不重要。一个拥有数百万行但只有少量列的数据集,并不比一个拥有许多列但规模较小的数据集更能教好模型。相反,关键因素是特征(即列)的数量。拥有许多不同类型信息的表格可以让模型练习更广泛的逻辑关系。研究人员发现,成功的真正驱动力不是数据的绝对量,而是模型可以练习的任务多样性。通过将不同的列组合视为不同的问题,单个表格可以提供数千个独特的学习机会。模型在训练期间能够解决的独特任务越多,它在处理新的、未见的挑战时就变得越出色。

这一洞察促使团队重新思考如何为这些模型应对现实世界做准备。传统观念认为,要构建一个强大的模型,应当策划一个庞大的数据集集合,仔细剔除重复项,并过滤掉任何看起来过于简单或结构不良的表格。研究人员通过在超过 1,700 个现实世界数据集的大型语料库上训练模型来测试这一点。他们发现,删除完全重复的数据对最终性能没有影响,而激进地过滤掉“弱”数据集实际上反而损害了模型泛化的能力。事实证明,即使是一个只有少量特征的简单表格,也能为特定类型的逻辑推理提供宝贵的练习。最有效的策略不是丢弃数据,而是在更细微的层面进行清洗。通过移除彼此近乎相同或包含过多缺失值的列,研究人员在不缩小库规模的前提下提高了练习任务的质量。这种细粒度的清洗一致性地提升了模型在广泛基准测试中的表现。

论文最后提出了一种理解这些模型运作方式的新方法。该模型并非作为一个存储了每种可能情况的通用规则的庞大百科全书在运作,其功能更像是一位熟练的图书管理员。当面对一个新问题时,它并不依赖于一份预先写好的答案解析。相反,它会扫描即时提供的示例,识别出与当前问题最相似的示例,并汇总它们的答案以形成预测。研究人员通过展示那些泛化能力最强的模型同时也最擅长从给定的示例中检索正确信息,为这一点提供了强有力的证据。他们发现,迫使模型依赖简单的相似性匹配并不会使其失效;事实上,对于较弱的模型,使其过程更趋向于一种直观的寻找相似邻居的搜索,反而提升了它们的结果。这表明,这些系统的魔力不在于存储一个复杂的、预先计算好的规则宇宙,而在于学习如何从提供的上下文中寻找并使用正确的信息片段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →