✨ 要点🔬 技术摘要
在人工智能广袤的版图中,一种持久的观点认为数据存在于截然不同、彼此孤立的世界中。人们认为,一个被训练用来识别手写数字的计算机程序,应该无法帮助房地产经纪人估算房价,因为这两项任务似乎毫无共同之处。这种观点将数据表视为僵化且特定的谜题,其中一个规则不可能适用于另一个。然而,新一代被称为“表格基础模型”(tabular foundation models)的人工智能模型,已经开始挑战这一假设。这些系统的设计初衷不是通过永久记忆单一的数据集来学习,而是通过从被要求解决问题的那一刻所呈现的一系列示例中进行学习。它们通过观察即时提供的少量有标签示例,并利用该上下文来预测新的、无标签的行。研究人员的核心问题在于:这些模型是否需要一个包含数千个不同现实世界数据集的庞大且多样化的库来学习如何泛化,还是说其中存在一种更简单、更基本的机制在起作用。
一个研究团队致力于测试这种学习过程的极限,并以一个令人惊讶且反直觉的实验作为开端。他们仅使用一个真实的现实世界数据集来训练一个强大的 AI 模型:一个包含手写数字向量化图像的表格。在标准设定下,人们会预料到这样一个模型在面对如加州房价或大学入学统计数据等完全无关的任务时会表现得极其糟糕。然而,结果打破了这一预期。该模型在仅见过数字数据的情况下,展现出了在这些完全不同的任务上做出准确预测的强大能力。这一发现表明,模型并非仅仅是在记忆关于数字的事实,而是学习了一种更通用的技能:如何观察一组示例,找到其中重要的部分,并利用它们来解决新问题。
为了理解为什么会发生这种情况,研究人员调查了是什么让一个数据集对于教导这些模型而言是“好”的。他们分析了数十个不同的表格,从小型集合到大型档案库不等,以观察哪些属性会导致最佳性能。他们发现,表中行(即实例)的数量出奇地不重要。一个拥有数百万行但只有少量列的数据集,并不比一个拥有许多列但规模较小的数据集更能教好模型。相反,关键因素是特征(即列)的数量。拥有许多不同类型信息的表格可以让模型练习更广泛的逻辑关系。研究人员发现,成功的真正驱动力不是数据的绝对量,而是模型可以练习的任务多样性。通过将不同的列组合视为不同的问题,单个表格可以提供数千个独特的学习机会。模型在训练期间能够解决的独特任务越多,它在处理新的、未见的挑战时就变得越出色。
这一洞察促使团队重新思考如何为这些模型应对现实世界做准备。传统观念认为,要构建一个强大的模型,应当策划一个庞大的数据集集合,仔细剔除重复项,并过滤掉任何看起来过于简单或结构不良的表格。研究人员通过在超过 1,700 个现实世界数据集的大型语料库上训练模型来测试这一点。他们发现,删除完全重复的数据对最终性能没有影响,而激进地过滤掉“弱”数据集实际上反而损害了模型泛化的能力。事实证明,即使是一个只有少量特征的简单表格,也能为特定类型的逻辑推理提供宝贵的练习。最有效的策略不是丢弃数据,而是在更细微的层面进行清洗。通过移除彼此近乎相同或包含过多缺失值的列,研究人员在不缩小库规模的前提下提高了练习任务的质量。这种细粒度的清洗一致性地提升了模型在广泛基准测试中的表现。
论文最后提出了一种理解这些模型运作方式的新方法。该模型并非作为一个存储了每种可能情况的通用规则的庞大百科全书在运作,其功能更像是一位熟练的图书管理员。当面对一个新问题时,它并不依赖于一份预先写好的答案解析。相反,它会扫描即时提供的示例,识别出与当前问题最相似的示例,并汇总它们的答案以形成预测。研究人员通过展示那些泛化能力最强的模型同时也最擅长从给定的示例中检索正确信息,为这一点提供了强有力的证据。他们发现,迫使模型依赖简单的相似性匹配并不会使其失效;事实上,对于较弱的模型,使其过程更趋向于一种直观的寻找相似邻居的搜索,反而提升了它们的结果。这表明,这些系统的魔力不在于存储一个复杂的、预先计算好的规则宇宙,而在于学习如何从提供的上下文中寻找并使用正确的信息片段。
技术摘要:理解表格基础模型令人惊讶的泛化特性
问题陈述
表格基础模型(Tabular Foundation Models, TFMs)旨在执行上下文学习(In-Context Learning, ICL),即模型在不更新权重的情况下,利用提供的带标签示例来预测新输入的标签。该领域普遍的假设是,要在异构表格领域进行有效的迁移学习,需要在大规模、多样化的语料库(无论是合成数据还是大规模真实数据集集合)上进行预训练,以覆盖未见的任务分布。本文对这一假设提出了挑战,研究了 TFM 是否能够通过在单个真实表格 上进行预训练来实现鲁棒的泛化,并试图理解这种泛化的底层机制。
研究方法
作者采用了分为三个主要阶段的系统性实验方法:
单表预训练分析:
设置: 作者从头开始在单个真实数据集(例如向量化后的 MNIST 或 Colleges 数据集)上预训练表格 ICL 模型(使用 TabPFNv1 和 TabDPT 的共享骨干架构)。
评估: 这些单数据集模型在无需权重更新的情况下,在多样化的基准测试集(用于分类的 CC-18,用于回归的 CTR-23)上进行评估。
元分析: 对 88 个预训练数据集进行元分析,使用 XGBoost 回归器将数据集属性(特征数量、实例数量、缺失值等)与下游泛化性能进行关联。
任务多样性控制: 作者通过操纵固定数据集在预训练期间看到的唯一“任务”(目标列与特征列的排列组合)的数量,以分离数据量与任务多样性对结果的影响。
大规模语料库预训练与消融实验:
语料库: 使用来自 OpenML 的 1,732 个真实数据集构建语料库,研究语料库策展策略。
消融实验:
数据集层面: 测试精确去重以及过滤掉“低特征”或“差质量”数据集的影响。
列层面: 应用细粒度的预处理(丢弃缺失值超过 50% 的列、基于相关性的去重以及强制执行最小特征数),以在不丢弃整个数据集的情况下提高任务质量。
缩放: 在不同的模型容量(深度/宽度)和上下文长度(1k, 2k, 4k token)下进行扩展实验,以验证研究结果是否适用于更大的模型。
机制研究(检索 vs. 先验):
检索任务: 作者构建了一个受控任务,其中查询行(query rows)是上下文行(context rows)的精确副本,用以衡量模型的“检索”并复制标签的能力。
架构约束: 他们修改了注意力机制,使查询和键的投影权重相等(W Q = W K W_Q = W_K W Q = W K ),迫使模型表现得更像 k-最近邻(kNN)算法。
注意力分析: 他们检查了强单数据集模型的注意力图,以识别通用的模式。
核心贡献与发现
1. 来自单表的惊人泛化能力
与认为多样化预训练数据至关重要的观点相反,作者证明了通过在单个真实表格 (如 MNIST 或 Colleges )上进行自监督目标训练的 Transformer,可以在结构和语义完全无关的数据集上实现鲁棒的上下文泛化。例如,仅在 MNIST 上训练的模型在加州房价预测任务上也表现良好。
2. “以任务为中心”的视角
论文指出,泛化是由任务的数量和质量 而非单纯的数据实例总量驱动的。
特征数 > 实例数: 预训练数据集中的特征数量是下游性能最强的预测因子。减少实例数量对性能影响微乎其微,而减少特征数量则会大幅降低性能。
质量的普适性: 泛化能力强的数据集往往在所有下游任务中都表现出色,无论其领域如何。不存在显著的“领域到领域”的迁移优势;有些数据集具有广泛的用途,而有些则普遍较差。
任务多样性: 在预训练期间增加唯一任务(目标/特征排列组合)的数量,即使是在单个数据集上,也能持续提升性能。
3. 语料库设计洞察
在扩展到大规模语料库时,作者发现:
数据集层面的过滤是无效的: 精确去重没有带来收益,且激进地过滤掉“低特征”数据集实际上会降低性能。低特征数据集贡献了独特的、更简单的依赖结构,这些结构可以与高特征数据集形成互补。
列层面的预处理至关重要: 精细的清洗(移除高度相关或缺失严重的列)能持续提升下游性能。这在不缩小语料库规模的前提下,提高了任务的质量和多样性。
4. 泛化机制:学习到的检索
论文提出了一个新的框架来理解 TFM 的泛化,反对“先验拟合”(即权重存储通用决策规则)的假设。相反,作者认为 TFM 扮演的是学习到的检索与聚合程序 的角色:
检索相关性: 模型从上下文中检索精确标签的能力与其泛化性能之间存在强相关性(Pearson 相关系数 = 0.89)。
类 kNN 行为: 强制模型使用更简单的、基于相似性的注意力机制(W Q = W K W_Q = W_K W Q = W K )并不会损害性能,对于较弱的模型甚至会提升性能,这表明其核心能力是识别相关样本并聚合其标签。
通用检索空间: 强模型表现出相似的注意力模式,这表明存在一个支持泛化的通用检索空间。
意义与主张
本文声称提供了一种看待 TFM 如何泛化的新视角 ,将重点从参数化迁移(学习通用预测器)转向非参数化的、基于检索的机制。
理论转向: 它挑战了 TFM 学习数据生成过程之先验的贝叶斯解释,转而认为它们学习的是如何识别相关的上下文点。
实际影响: 其发现为未来的模型和语料库设计提供了一个“以任务为中心”的框架。具体而言,它建议在 TFM 预训练中,优先考虑通过特征丰富度和列级清洗来最大化任务的多样性,而不是简单地堆砌海量数据或进行激进的数据集级去重。
谦逊态度: 作者承认,虽然其证据强烈支持检索假设(并反驳了严格的先验拟合),但他们并不声称已经彻底证明了不存在任何参数化学习,而是认为检索是解释观察到的能力的充分且简洁的解释。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。