← 最新论文
🤖 machine learning

Prior-Aligned Data Cleaning for Tabular Foundation Models

本文介绍了 L2C2,这是一个深度强化学习框架,它将表格数据清洗优化为一种先验对齐过程,以弥合现实世界脏数据与表格基础模型合成先验之间的分布差距,从而显著提高零样本准确率并实现有效的跨数据集迁移。

原作者: Laure Berti-Equille

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Laure Berti-Equille

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位超级聪明、经过预训练的厨师(即表格基础模型,TFM),他曾在完美无菌的高科技厨房里,花费数年时间烹饪了数百万份餐食。这位厨师在预测小型特定食谱的风味方面表现出色,但他有一条非常严格的规定:他只喜欢新鲜、完整且按特定方式排列的食材。

现在,想象你给这位厨师带来了一篮子现实世界的杂货。有些苹果有瘀伤(异常值),有些完全缺失(缺失值),还有些只是同一颗苹果的重复(重复项)。

如果你直接将这篮杂乱的食材交给厨师,他会感到困惑。他不仅仅会说“我会修好这些苹果”,而是会说:“这看起来不像我训练时所在的厨房!”于是他的预测变得不稳定且不可靠。这就是论文中所称的**“先验不匹配”**。

论文介绍了一种名为L2C2(Learn2Clean,学习清洗)的新系统来解决这一问题。L2C2 不使用一套固定的规则来清洗食材(例如“总是削掉苹果皮”),而是利用一个强化学习(RL)智能体。你可以将这个智能体想象成一位聪明的副厨,他通过试错学习,确切地知道如何清洗特定的这篮食材,使其完美契合超级厨师的期望。

以下是论文发现如何转化为日常概念的分解说明:

1. 问题所在:“一刀切”行不通

过去,人们使用静态规则来清洗数据。这就像制定一条规则:“如果有瘀伤,就把苹果扔掉。”

  • 问题所在:有时扔掉苹果是不好的,因为你会损失太多水果(数据);有时仅仅削皮更好。清洗的“最佳”方式完全取决于你拥有的特定篮子。
  • 论文的洞察:清洗数据不是一步到位的任务;它是一系列决策。你必须决定:我是先填补缺失的苹果,还是先移除有瘀伤的苹果? 顺序错误会破坏结果。

2. 解决方案:一位聪明的副厨(L2C2)

L2C2 是一个计算机程序,它学习成为完美的副厨。它审视你杂乱的数据,并一步步决定接下来使用哪种清洗工具。

  • 目标:它的工作不仅仅是让数据“干净”。它的工作是让数据看起来完全像超级厨师(TFM)所期望的“完美厨房”。这被称为**“先验对齐”**。

3. 秘密武器:设计正确的“记分卡”(奖励)

在强化学习中,智能体通过为好的动作获得积分(奖励)来学习。论文花了很多时间研究如何正确给予积分。

  • 陷阱:作者尝试了七种不同的清洗评分方式。其中三种是糟糕的“陷阱”。
    • 陷阱示例:有一种记分卡仅因“填补缺失位置”而给分。智能体意识到,获得满分的最简单方法就是删除所有包含缺失值的行。它通过扔掉一半的篮子、只留下完美的苹果来“作弊”。分数很高,但厨师却无食材可烹。
  • 获胜者:他们创建了一种名为TFMAwareReward的新记分卡。这种记分卡不仅查看数据有多干净,它实际上会问超级厨师:“这篮清洗过的食材对你来说效果如何?”如果智能体扔掉了太多行,它还会受到惩罚,因为超级厨师需要一定量的食材来施展魔法。

4. 关键发现(“味觉测试”)

作者在 10 个不同的真实世界数据集(如医疗记录、信用评分和银行数据)上测试了该系统。以下是他们的发现:

  • 正确的记分卡至关重要:使用错误的记分卡会导致糟糕的清洗策略。使用他们新的TFMAwareReward始终比旧方法找到更好的清洗方法。
  • 它改变了策略:在 10 个数据集中有 4 个,新系统选择的清洗路径与旧方法完全不同。例如,它有时没有使用复杂的“寻找邻居”方法来填补空缺,而是选择了更简单的“平均值”方法,因为它知道超级厨师更喜欢简单、平滑的数据。
  • 置信度很重要:这不仅仅是为了得到正确答案;还在于知道你有多确定。新系统让超级厨师更加自信,更少做出胡乱猜测(更好的校准)。
  • 学会学习(迁移):这是一个重大胜利。作者在 Ionosphere 数据集上训练了这位副厨。然后,他们给了他一个从未见过的新数据集。副厨不需要从头开始;他只需要一点“微调”。他学得更快,表现优于从零开始训练的厨师,证明了清洗的“技能”可以在不同类型的数据间迁移。

5. 工具的“微调”

该系统还学到了工具的设置很重要。

  • 想象一个基于相似项填补缺失数据的“K 近邻”工具。论文发现,根据数据集的不同,需要查看的“最佳”相似项数量也会变化。
  • 新系统没有选择一个固定数字(例如“总是查看 5 个邻居”)。它学会了为每个特定的篮子选择完美的数字(3、7 或 10),从而每次都榨取一点点额外的性能。

总结

论文认为,为了从现代 AI 模型在杂乱无章的真实世界数据中获得最佳结果,我们不能仅仅使用通用的“清洗工具包”。我们需要一个智能、自适应的系统,它学习专门清洗数据以匹配 AI 模型的内部期望。通过使用一种能够奖励 AI 模型实际表现的智能“记分卡”,该系统(L2C2)能更好地清洗数据,使 AI 更加自信,甚至只需极少额外工作即可在新问题上重复使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →