← 最新论文
🤖 machine learning

LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models

本文提出 LUCoS,一种用于低标签表格学习的无监督方法,该方法通过利用无监督嵌入的潜在几何结构而非不可靠的原始特征空间来选择标记实例,从而在 67 个数据集上通过确保有效的覆盖范围和表示质量实现了最先进的性能。

原作者: Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Oroel Ipas, Guillermo Gomez-Trenado, Rocío Romero-Zaliz, Isaac Triguero

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《LUCoS:面向表格基础模型的潜在无监督上下文选择》的通俗解读,辅以生动的类比。

核心难题:“空白画布”困境

想象你是一位才华横溢的厨师(即 AI 模型),但手头只有极少量的食材(标注数据)可供使用。而你拥有一个巨大的储藏室,里面堆满了未标记的生蔬菜和香料(即未标注数据)。

表格基础模型(如 TabPFN)的世界里,厨师并非通过烹饪上千顿饭并调整食谱来学习。相反,厨师通过上下文学习(ICL)来学习。这意味着厨师只需查看一小份“品尝菜单”(即上下文集,包含少量示例),就能立即根据这些示例推断出如何烹饪其余的菜肴。

关键难点在于:厨师对放在那份“品尝菜单”上的示例极其敏感。

  • 如果你给厨师 5 个随机示例,他们可能会猜测食谱是“辣味”。
  • 如果你给厨师 5 个精心挑选的示例,他们可能会猜测是“甜咸口”。
  • 这两组示例的数量相同,但一组能带来美味佳肴,另一组则会导致灾难。

这篇论文提出的问题是:当我们尚不知道答案(标签)这被称为“冷启动”问题。

旧方法:在黑暗中猜测

通常,当人们试图在不了解答案的情况下挑选这些示例时,他们会直接查看原始数据。

  • 类比:想象试图在一个灯光熄灭、水果混杂(苹果挨着石头,香蕉挨着汤罐)的黑暗房间里,从板条箱中挑选出最好的 5 种水果。
  • 问题:表格数据杂乱无章。它包含数字、类别、缺失值以及奇怪的量纲。在这种原始状态下测量两行数据之间的“距离”,就像试图用一把专为汤设计的尺子去测量石头和香蕉之间的距离一样。这毫无意义。
  • 结果:论文发现,如果你只是随机挑选水果,或者基于这种混乱的视图试图挑选“不同”的水果,效果往往不如完全随机挑选。

解决方案:LUCoS(“魔法翻译器”)

作者提出了一种名为 LUCoS(潜在无监督上下文选择)的新方法。

步骤 1:魔法翻译器(嵌入)
LUCoS 不使用杂乱无章的原始数据,而是利用一种特殊的“翻译器”(一种名为 TabClustPFN 的无监督 AI 模型)。

  • 类比:这个翻译器将所有杂乱的蔬菜和水果重新整理,放入一个完美有序的高科技仓库中。在这个新仓库里,相似的物品自然聚集在一起。苹果靠近苹果,香蕉靠近香蕉,而石头则远离汤罐。
  • 为何有效:这个“潜在空间”(即新仓库)构建了一种几何结构,使得“距离”真正具有意义。在这个新空间中彼此靠近的物品,实际上在任务相关的方面是相似的。

步骤 2:智能挑选器(K-Medoids)
一旦数据进入这个有序的仓库,LUCoS 便利用简单的几何规则来挑选示例。

  • 类比:假设你需要挑选 5 名代表展示给厨师。在有序的仓库中,你只需挑选各自群体中最“居中”的 5 种水果。你挑选苹果堆正中间的那个苹果,香蕉堆中间的那根香蕉,以此类推。
  • 规则:这被称为 K-Medoids。它确保你能覆盖整个仓库,而不会挑选出重复项。

步骤 3:标注
你将仓库中挑选出的这 5 种特定水果映射回现实世界,并请专家为其标注(例如,“这是一个苹果”)。现在,你拥有了你的“品尝菜单”。

步骤 4:预测
你将这份完美的品尝菜单提供给 TabPFN 厨师。厨师查看这些高质量示例,并以惊人的准确度预测其余数据。

实验结果

作者在 67 个不同的数据集(如医疗记录、财务数据等)上测试了该方法,每个类别的标签数量极少(从每个类别 1 个示例到 32 个示例不等)。

  1. “神谕”测试:他们首先证明,如果你能神奇地知道答案并挑选绝对最好的 5 个示例,模型的性能将大幅提升。这证明了存在巨大的“差距”需要填补。
  2. LUCoS 与随机挑选对比:LUCoS 在未看到任何标签的情况下,填补了该差距的很大一部分。
  3. “救援”效应
    • 在极低预算下(1-2 个示例):挑选任何结构化示例(即覆盖性)这一简单行为就起到了帮助作用。
    • 在中等预算下(4-16 个示例):这是 LUCoS 大放异彩的地方。旧方法(从混乱的原始数据中挑选)实际上开始失效,表现甚至差于随机猜测。然而,LUCoS 保持良好表现,因为它利用了“有序仓库”(即潜在空间)。
    • 结论:论文发现,空间的几何结构比挑选器的复杂性更重要。在智能空间中使用简单的挑选器(LUCoS),胜过在愚蠢空间中使用复杂的挑选器。

一句话总结

LUCoS 通过先将杂乱的数据翻译成干净、有序的“心智地图”,使相似事物自然聚集,从而解决了为 AI 挑选最佳训练示例的问题;这使得即使在没有可用标签的情况下,也能利用简单的几何规则为 AI 挑选出完美的学习示例。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →