想象一下,你正试图教计算机根据一张数据电子表格来识别不同类型的汽车(如轿车、SUV 和卡车)。问题在于,你只有五个带标签的示例(例如“这是一辆轿车”),但却有数千行未标记的行,其中汽车类型是隐藏的。这被称为半监督少样本学习。
对于图像(如汽车照片),计算机非常擅长此道。它们可以裁剪照片、将其旋转或改变颜色,然后说:“嘿,这仍然是同一辆车!”这些“扭曲”的版本有助于计算机学习。
但对于表格数据(包含数字和类别的电子表格),这种方法行不通。你无法真正“裁剪”一张电子表格。如果你随机更改汽车的里程数,或将“红色”改为“蓝色”,你可能会创造出一辆从未存在过的假车(例如一辆里程为 0 但车龄已达 100 年的汽车)。这会令计算机感到困惑。
SeBA(出生即分离对齐)登场了。
本文的作者表示:“让我们停止尝试扭曲数据。相反,让我们将其拆分。”
核心思想:“分裂人格”类比
想象你拥有一份详尽的人物传记(即数据行)。SeBA 不是试图创造该人物的虚假版本,而是将传记在开头(即“出生”时)一分为二。
- 特征视图:你向计算机提供故事的前半部分(例如“年龄”、“职业”、“城市”)。
- 目标视图:你向计算机提供后半部分(例如“薪水”、“爱好”、“汽车类型”)。
现在,这里有个魔法技巧:
- 计算机查看人物 A 的特征视图,并尝试猜测其在目标视图中的“最佳匹配”是谁。
- 它发现人物 A 的“特征视图”与人物 B 的“特征视图”非常相似。
- 接着,计算机检查:“人物 A 和人物 B 的‘目标视图’是否相似?”
- 如果相似,计算机就会学到:“啊!这两个人是相关的,尽管我只看到了他们故事的一半。”
这就像一场**“猜双胞胎”**的游戏:
- 你向计算机展示双胞胎 A 的左侧照片。
- 你向它展示双胞胎 B 的左侧照片。
- 计算机说:“那些看起来是同一个人!”
- 然后,它检查右侧。如果右侧也匹配,计算机就会学到“左侧 A"和“左侧 B"属于同一个“右侧”家族。
通过用成千上万次随机拆分反复进行此操作,计算机学会了一种非常聪明的方式来组织数据,而无需发明虚假数据或扭曲数字。
为什么这更好?
- 不再有虚假数据:以前的方法试图“增强”(扭曲)数据,这往往会破坏电子表格的逻辑(例如让汽车的里程数变为负数)。SeBA 不这样做。它只是将真实数据一分为二。
- “最近邻”地图:计算机构建了一张基于谁与谁最接近的地图。它学到,如果两行在“特征”部分看起来相似,那么它们在“目标”部分很可能属于同一组。
- 轻量级:所使用的计算机模型小巧且简单(就像一个基础计算器),因此当带标签的示例非常少时,它不会感到困惑或“过度思考”。
结果
作者在许多涉及不同领域的“电子表格”(数据集)上测试了这种方法,包括:
他们发现,SeBA 在几乎每一项测试中都是猜测正确标签的最佳方法,尤其是在带标签的示例非常少(1 次或 5 次)的情况下。它特别擅长处理杂乱的数据、列数众多的数据,或者主要是类别(如“是/否”或“红/蓝”)的数据。
简而言之
SeBA 是一种新方法,用于在带标签的示例非常少时,教计算机从电子表格中学习。它不是通过创建虚假版本来“耍杂技”般地处理数据,而是简单地将数据一分为二,并教计算机匹配这两半。这避免了编造虚假数据带来的困惑,并为现实世界中的基于表格的问题产生了更智能、更准确的模型。
技术摘要:SeBA——基于出生即分离对齐的表格数据半监督少样本学习
1. 问题陈述
本文针对表格数据的**半监督少样本学习(SS-FSL)**问题。在该设定下,模型必须利用极少量的标注样本(支持集)来学习数据分类,同时利用大量未标注数据池。
尽管半监督少样本学习在计算机视觉(CV)和自然语言处理(NLP)领域已确立,但在表格数据中仍鲜有探索。将标准半监督少样本学习方法应用于表格数据的主要瓶颈在于其对自监督学习(SSL)框架的依赖,而这些框架需要数据增强。
- 增强挑战:在计算机视觉中,增强操作(如裁剪、旋转)能保留语义含义。而在表格数据中,定义有意义的增强并非易事。常见的策略(如零掩码、高斯噪声或从边缘分布采样)往往会扭曲语义、生成分布外样本,或违反特征约束(例如使分类变量变为非整数),从而削弱自监督学习的有效性。
- 当前局限:现有的表格数据预训练方法往往完全回避自监督学习,转而依赖聚类检测、扩散模型或在自生成任务上的元学习,这可能无法充分利用对比学习范式的潜力。
2. 方法论:出生即分离对齐(SeBA)
作者提出了SeBA,这是一种联合嵌入框架,消除了对人工设计数据增强的需求。SeBA 不通过增强创建正样本对,而是通过将数据在“出生”时分离为两个独立且互补的视图来构建它们。
核心机制
数据分离:对于每一个未标注数据的迷你批次,采样一个二元掩码 m。该掩码将每个数据点 x 的特征分割为两个视图:
- 特征视图(xf):掩码为 0 的特征(x⊙(1−m))。
- 目标视图(xt):掩码为 1 的特征(x⊙m)。
这些视图是互补且独立的。
目标相似性图:正样本对基于目标视图定义。对于样本 x,仅使用目标视图中的特征(xt 和 xt′)在批次内识别其最近邻 x′。这种最近邻关系作为语义相似性的“真实标签”。
对齐目标:模型被训练以将特征视图(xf)的表示与其最近邻的特征视图(xf′)的表示对齐。
- 条件投影器:由于特征视图 xf 本身不包含用于创建它的掩码 m 的信息,SeBA 采用条件投影器 π(h,m)。该投影器以编码器输出 h 和掩码 m 作为输入,使模型能够学习一个考虑特定分离方案的特定任务潜在空间。
- 损失函数:对齐优化使用InfoNCE 损失,该损失拉近正样本对(z,z′)的表示,并推远不相关的样本。
处理表格数据特性:
- 类型感知分离:为防止将单个分类变量(通过独热编码)分割到不同视图中,掩码在编码前应用于原始表示。
- 缺失数据插补:分离后的特征被替换为零(零插补),作者发现对于其轻量级 MLP 编码器,这优于从边缘分布采样。
- 集成:为了应对数据集的多样性并避免选择次优的分离比例,作者训练了多个具有不同固定分离比例(r∈{0.1,…,0.5})的模型,并在推理阶段集成它们的预测。
3. 主要贡献
- 新颖的预训练框架:引入 SeBA,这是首个针对表格数据的 SS-FSL 方法,它用源自数据分离的最近邻图取代了基于增强的正样本对构建。
- 理论依据:针对高斯数据的理论分析表明,随着目标视图维度的增加和类别间分离度的增大,目标视图中属于不同类别的最近邻的概率呈指数级衰减。这验证了在目标视图中进行最近邻匹配能产生有意义的正样本对。
- 实证验证:广泛的实验表明,SeBA 生成了改进特征 - 标签关系的输出空间,在大多数情况下优于最先进(SOTA)的基线方法。
4. 实验结果
作者在8 个标准基准数据集(来自 OpenML-CC18)和3 个额外的挑战性数据集(高维且稀疏:CNAE、Devnagari、FashionMNIST)上评估了 SeBA。
- 性能:在 1-shot、5-shot 和 10-shot 设置中,SeBA 在 24 个实例中的 17 个实现了最先进(SOTA)性能。在其余 7 个实例中,它位列前三。
- 鲁棒性:与 STUNT 和 D2R2-c 等竞争对手相比,SeBA 表现出更优越的稳定性,在不同随机种子下的结果方差更低。
- 具体优势:
- SeBA 在纯分类值数据集(DNA、PIX)上取得了最佳性能。
- 在高维数据集(如 PIX、SEM)上,SeBA 与基线之间的性能差距尤为显著。
- 消融研究:
- 条件投影器:对性能至关重要,特别是在低数据 regime(1-shot)下。
- 编码器架构:轻量级 2 层 MLP 优于更复杂的 FT-Transformer 架构。
- 预处理:归一化结合零插补产生了最佳结果。
- 分离比例:与单一固定比例相比,集成使用不同比例训练的模型提供了最稳健的结果。
5. 意义与主张
本文主张,自监督学习方法在表格少样本学习中表现不佳,并非表格数据固有的局限性,而是依赖于不恰当增强策略的结果。
通过出生即分离对齐重新思考自监督学习,作者证明了:
- 无需人工增强即可为表格数据构建有意义的正样本对。
- 这种方法产生的表示显著改善了特征 - 标签关系,证据是潜在空间中的标签一致性相比输入空间有所提高。
- SeBA 为表格数据的半监督少样本学习范式开辟了新途径,为医学、金融和科学等标注数据稀缺的领域提供了一种实用、轻量且高效的解决方案。
该工作将 SeBA 定位为数据受限应用的基础性步骤,建议未来的研究应探索类似的无增强对齐策略,用于表格表示学习。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。