Do Tabular Foundation Models Agree with Themselves?
本文揭示了表格基础模型(TFMs)无法生成忠实的联合分布,因为它们在所有评估的数据集和任务中都违反了边缘化一致性和分解一致性要求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探,但你寻找线索的地方不是犯罪现场,而是一个巨大的电子表格。这就是表格基础模型(Tabular Foundation Models)的世界,这是一个热门的新兴人工智能领域,计算机通过学习行和列中的数据来预测事物,比如预测一笔贷款是否会被偿还,或者一套房子的价格可能是多少。这些模型是基于一个聪明的想法构建的,叫做贝叶斯推理(Bayesian inference),这基本上是一种高级的说法,意思是:“让我们根据新证据来更新我们的信念。”把它想象成一个天气预报员,他最初对降雨有一个大致的猜测,但一旦看到乌云,他就会更新他的预测,说:“好吧,肯定要下雨了。”
长期以来,科学家们一直希望这些 AI 模型是完美的“天气预报员”。他们认为,如果你要求模型预测一件事,然后利用这个预测去猜测另一件事,它所讲述的整个故事应该能够完美契合,就像一部逻辑严密、章节环环相扣的优秀小说一样。但问题在于,在现实世界中,我们往往不知道“真实”的答案来与之对比。这就像是在没有标准答案的情况下给学生的作文评分。因此,研究人员并没有问“这个模型对不对?”,而是提出了一个更简单、也更棘手的问题:“这个模型是否能对自己讲出一个一致的故事?”他们想知道,这个 AI 是在编造一些看起来还不错的随机数字,还是真的在遵循严格的逻辑和概率规则。
你即将听到的这篇论文题目是**《表格基础模型是否能与自身保持一致?》("Do Tabular Foundation Models Agree with Themselves?")**,它深入探讨了这个谜团。由 Christian Klötergens 及其团队领导的研究人员决定让最流行的表格数据 AI 模型(如 TabPFN、TabICL 和 TabFM)接受一场严格的“逻辑测试”。他们不仅要求模型进行预测,还要求它们以两种不同的方式讲述同一个故事,并检查这些故事是否匹配。
想象一下你正在尝试猜一款神秘奶昔的味道。
- 测试 1(边缘化一致性): 你问 AI:“这款奶昔是什么味道?”然后你问它:“如果奶昔是红色的,它是什味道?如果它是蓝色的,它又是什味道?”最后,你根据奶昔是红色或蓝色的可能性,将这两个答案混合在一起。如果 AI 是一致的,那么这个“混合”后的答案应该与第一个直接得到的答案完全相同。
- 测试 2(因子分解一致性): 你要求 AI 以两种不同的顺序讲述奶昔的成分。首先,它猜水果,然后猜甜味剂。其次,它猜甜味剂,然后猜水果。如果 AI 真正理解了数据,那么最终呈现的奶昔全貌应该是相同的,无论它先猜哪个成分。
研究人员在各种各样的现实世界数据集上运行了这些测试,从葡萄酒质量评分到汽车价格以及医疗记录。他们使用了一个被称为**全变分距离(Total Variation Distance)**的数学尺子来衡量答案之间的差距。得分为 0 表示模型完全一致;得分越高,表示模型越自相矛盾。
结果令人震惊。每一个被测试的模型都未能通过这两项测试。 在每一个数据集上,无论是对于简单的“是/否”问题(分类问题)还是数值预测问题(回归问题),模型都会根据提问方式的不同而给出不同的答案。这就像 AI 在你直接询问时告诉你奶昔是“草莓味”的,但当你先询问颜色时,它突然决定那是“蓝莓味”的,尽管颜色其实是一样的。
研究发现,虽然某些模型比其他模型在讲述一致故事方面表现得稍好一些(例如,一个名为 TabFM 的模型是表现最一致的分类器,而 TabPFNv3 是最接近一致性的回归模型),但没有任何一个模型是真正一致的。 事实上,这种不一致现象非常普遍,研究人员据此得出结论:这些模型并不代表数据的单一、统一的“联合分布”。用通俗的话说:这些模型并没有遵循它们本应模仿的严格概率定律。它们本质上是在根据提问顺序的不同,在“幻觉”出不同版本的现实。
作者还发现了一些有趣的事情:成为一个“优秀的”预测者(大多数情况下都能猜对答案)并不意味着你是一个“一致的”预测者。一个模型可能在预测房价方面非常准确,但在你以不同顺序询问其推理过程时,它仍然会产生矛盾。这表明,一致性是一个独立且隐藏的缺陷,目前的基准测试忽略了这一点。
那么,这对未来意味着什么?这篇论文并不是说这些模型没用——它们仍然是我们处理许多任务时最好的工具。然而,它也敲响了警钟:如果我们希望模型能够就变量之间的复杂关系提供逻辑连贯的解释,我们就不能盲目信任它们。研究人员建议,未来的模型需要将“一致性”作为一个核心特征进行构建,例如,通过训练使它们对这些矛盾进行惩罚,而不仅仅是专注于得到最终的正确答案。在此之前,我们必须记住,这些强大的 AI “侦探”擅长发现线索,但根据提问者的不同,它们有时会讲述不同版本的同一个故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。