← 最新论文
🤖 machine learning

High Performance, Low Reliability: Uncertainty Benchmarking for Tabular Foundation Models

本文揭示,尽管表格基础模型在预测精度上优于梯度提升决策树,但其不确定性量化与校准能力较差,凸显了必须解决的关键性能与可靠性之间的权衡,以实现其可信部署。

原作者: José Lucas De Melo Costa, Fabrice Popineau, Arpad Rimmel, Bich-Liên Doan

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: José Lucas De Melo Costa, Fabrice Popineau, Arpad Rimmel, Bich-Liên Doan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招募一支侦探团队,根据一份线索清单(即“表格数据”)来破解谜案。有些侦探是经验丰富的老手,他们使用一种特定且可靠的方法(如梯度提升决策树,简称 GBDT)解决了数千起案件。另一些则是全新、超级聪明的 AI 侦探,它们在从未见过真实案件之前,就已经在数百万个伪造案件上接受了训练(这些就是表格基础模型,简称 TFMs)。

这篇论文是一份成绩单,旨在比较这两类侦探的表现,但有一个转折:它不仅仅问“谁答对的题目最多?”,它还问“谁知道自己何时在猜测?”

以下是他们研究发现的详细分析:

1. “聪明但过度自信”的陷阱

新的 AI 侦探(TFMs)速度极快且准确。当被要求选出正确的嫌疑人时,他们获得了最高分(AUC)。他们看起来像是侦探工作的未来。

然而,研究人员发现了一个隐藏的缺陷。当这些 AI 侦探不确定时,他们并不承认。相反,他们会自信地指向唯一的嫌疑人,即使线索杂乱无章或令人困惑。他们就像一个在考试中猜答案的学生,即使实际上完全不知道自己在说什么,却以 100% 的自信作答。

2. “安全但诚实”的老手

老式侦探(GBDTs)的整体准确率略低。他们可能会比 AI 漏掉几条线索。但是,他们更清楚自己的局限。当线索令人困惑时,他们会说:“我不确定,可能是这五个人中的任何一个。”

在这篇论文的语境中,这种诚实是通过一个称为共形预测(Conformal Prediction)的概念来衡量的。你可以将其想象为一个“安全网”。

  • 目标:如果你希望有 90% 的把握抓住了真凶,那么你的“安全网”(即你提供的嫌疑人名单)应该在 90% 的情况下包含真正的罪犯。
  • 结果:老式侦探构建的安全网在实际中 90% 的情况下都奏效了。而新的 AI 侦探构建的安全网看起来很小且精确,但他们错过真凶的频率超过了应有的水平。他们“过度自信”了。

3. 权衡:速度与安全

论文将这种现象称为“性能 - 不确定性权衡”。

  • AI(TFMs):高性能,低可靠性。当数据干净简单时,他们表现出色;但当数据嘈杂或混乱时,他们会变得不稳定且过度自信。
  • 老手(GBDTs):性能略低,但可靠性高。即使线索令人困惑,他们也能保持冷静和诚实。

4. “合成”压力测试

为了确保结论可靠,研究人员制造了一个充满噪音和混乱线索的虚假、混乱的犯罪现场。

  • AI 侦探获得了最高分,但犯了巨大且自信的錯誤。
  • 老手侦探的表现更加稳定。当线索无法解释时,他们会承认不确定性,这使得他们在棘手的情况下更值得信赖。

结论

论文总结道,虽然这些新的 AI 模型在干净数据上获得“正确答案”的能力令人惊叹,但他们尚未学会如何保持谦逊。他们目前属于高性能但低可靠性

如果你需要一个侦探来处理简单、清晰明确的案件,AI 是一个很好的选择。但如果你面对的是混乱、复杂或高风险的情况,而犯错会带来危险,那么老派、诚实的侦探(GBDTs)仍然是更安全的选择,因为他们知道自己何时在猜测。

简而言之:新的 AI 是跑得最快的选手,但当赛道变得崎岖不平时,它会被自己的鞋带绊倒。老选手跑得稍慢一些,但当道路变得崎岖时,他们绝不会失足。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →