想象一下,你正在教一名学生识别不同类型的动物,但你只有每种动物的三张照片可以展示给他们。这就是“少样本学习”所面临的挑战。现在,想象这些动物被连接在一个巨大而复杂的网络中(就像社交网络或家谱),其中它们之间的关系与动物本身同样重要。这就是图少样本学习。
本文介绍了一种名为IMPRESS的新方法,旨在解决当前方法在尝试从这些极少量数据中学习时所面临的两个主要问题。
以下是 IMPRESS 的工作原理,通过简单的类比进行解释:
两大核心问题
1. 错误的地图(欧几里得空间与双曲空间的问题)
大多数现有方法试图将这些复杂的网络映射到一张平坦的纸上(欧几里得空间)。
- 类比: 想象试图在一张平坦的纸上绘制一个庞大的家谱或企业组织架构图。随着树状结构变深(祖父母 -> 父母 -> 子女 -> 孙辈),分支会被挤压在一起,距离也会发生扭曲。你无法看清真实的层级结构;所有人看起来都像是彼此等距的。
- 现实: 现实世界中的图(如研究主题或公司结构)天然具有层级性,就像树或金字塔一样。
- IMPRESS 的解决方案: IMPRESS 不使用平坦的纸张,而是利用双曲空间。
- 类比: 想象一个向外弯曲的莫比乌斯带或马鞍形状。在这个弯曲的表面上,你可以容纳一棵巨大而深邃的树,而无需挤压分支。你深入得越深,拥有的“空间”就越多。这使得模型能够清晰地看到数据的真实层级结构,就像树的三维模型比平面绘图更好一样。
2. 样本量过小(分布问题)
当模型试图从它拥有的少量照片(标记节点)中学习时,它假设这少数几张照片能完美代表整个群体。
- 类比: 想象你试图猜测整片森林的样子,但只被允许观察三棵树。如果这三棵树恰好都是松树,你可能会错误地得出结论,认为整片森林都是松林。你正在对微小且缺乏代表性的样本进行“过拟合”。
- 现实: 由于示例太少,模型会感到困惑并做出糟糕的猜测,因为这一小组示例并不像数据真实且隐藏的分布。
- IMPRESS 的解决方案: IMPRESS 使用去噪扩散模型来充当一位富有创造力的厨师。
- 类比: 模型被给予少量的“食材”(即那少数几个标记示例)。它不是只用这三样食材烹饪,而是利用一种特殊的食谱(扩散模型)来生成数百种新的、逼真的“假”食材,这些食材看起来与真实的完全一样。
- 工作原理: 它从纯噪声(电视上的雪花噪点)开始,在少数示例的引导下慢慢“去噪”,直到生成一个完整且丰富的数据集。这为模型提供了更大、更具代表性的数据集供其学习,防止它因原始样本过小而感到困惑。
整体运作流程(工作流程)
训练阶段(学习环节):
- 模型利用弯曲的地图(双曲空间)来学习图的“形状”,从而理解层级结构。
- 它还利用训练期间可访问的所有未标记数据,学习生成新数据的“食谱”(扩散)。它学习在这种弯曲空间中一个“正常”节点的样子。
测试阶段(考试环节):
- 模型被赋予一个新任务,其中只有少量标记示例(即“支持集”)。
- 它利用其厨师技能,基于那少数几个真实示例生成许多新的合成示例。
- 然后,它在扩展后的丰富数据集(真实示例 + 生成示例)上训练一个简单的分类器。
- 最后,它参加测试(即“查询集”),并获得了更高的分数,因为它不必仅基于三个示例进行猜测。
为何有效(结果)
本文声称,通过使用弯曲的地图来更好地观察结构,并利用厨师来创造更多数据,IMPRESS 始终优于其他方法。
- 理论证明: 他们在数学上证明了这种方法具有更紧的“安全网”(泛化界),意味着它在新数据上犯错的可能性更低。
- 现实世界测试: 他们在著名数据集(如科学论文的引文网络)上进行了测试,结果表明,特别是在标记示例非常少的情况下,其准确率显著高于之前的方法。
简而言之: IMPRESS 通过为模型提供一张适合复杂结构的更好地图和一个能创造更多练习数据的魔法生成器,解决了图学习的问题,使其不必在信息如此匮乏的情况下进行猜测。
以下是论文《利用双曲空间与去噪扩散改进图少样本学习》(IMPRESS)的详细技术总结。
1. 问题陈述
本文解决了图少样本学习(FSL)的挑战,具体针对无监督少样本节点分类任务。其目标是在元训练阶段不依赖标注数据的情况下,仅利用少量标注的支持节点(M-shot)和大量未标注的查询节点,将节点分类到新的类别中。
作者指出了现有图 FSL 方法的两个关键局限性:
- 欧几里得空间的局限性:大多数当前模型在欧几里得空间中学习节点表示。然而,现实世界的图数据(例如组织结构、学术分类体系)通常具有内在的层次或树状结构。欧几里得几何在嵌入此类结构时会遭受显著的失真,无法捕捉真实的几何关系。
- 分布偏差与过拟合:在元测试阶段,模型通常在非常小的支持集上训练分类器。这导致了两个问题:
- 小支持集的实证分布往往与真实的潜在类别分布存在显著偏差(分布偏移)。
- 直接在稀疏数据上训练会导致严重的过拟合,损害对查询集的泛化能力。
2. 方法论:IMPRESS 框架
提出的框架IMPRESS(IMproves Praph Representation with Enhanced Space and Sampling,即利用增强空间和采样改进图表示)在两个阶段运行:元训练和元测试。它整合了双曲几何和去噪扩散模型。
A. 元训练阶段
双曲节点表示学习:
- 模型不是在欧几里得空间,而是在庞加莱球(双曲空间)中学习节点嵌入,该空间天然适合层次结构。
- 架构:使用变分图自编码器(VGAE)。
- 编码器:节点特征通过对数映射从欧几里得空间投影到双曲流形的切空间。图卷积(GCN)在切空间中执行。生成的嵌入通过指数映射映射回双曲空间。
- 解码器:利用双曲空间中潜在变量的内积重构图的邻接矩阵。
- 目标:模型在无监督条件下(仅使用图结构和特征)进行训练,以最小化重构损失和 KL 散度,学习保留层次几何的潜在分布。
原型引导的去噪扩散:
- 由于元训练期间没有标签,模型在学到的潜在嵌入上使用无监督聚类(DBSCAN)来分配伪标签并计算类别原型。
- 在这些潜在嵌入上训练一个去噪扩散概率模型(DDPM)。
- 条件化:扩散过程通过交叉注意力机制以类别原型为条件。这使得模型能够在没有显式真实标签的情况下学习每个类别的数据分布,为后续生成新类别的样本做好准备。
B. 元测试阶段
- 嵌入生成:
- 对于具有少量支持集(Stes)和查询集(Qtes)的新任务,预训练的 VGAE 将节点编码到双曲潜在空间中。
- 从标注的支持集中计算类别原型。
- 数据增强:
- 训练好的扩散模型为每个新类别生成 D 个新的合成节点嵌入,以支持集的原型为条件。
- 将这些生成的样本与原始支持集结合,形成增强支持集(S~tes),有效地将样本量从 M 增加到 M+D。
- 分类:
- 在增强支持集上训练线性分类器,并在查询集上进行评估。
3. 主要贡献
- 新颖框架(IMPRESS):首个在无监督图少样本学习背景下,结合双曲空间进行结构表示和去噪扩散进行分布丰富化的框架。
- 理论进展:
- 证明了对于 δ-双曲图,与欧几里得编码相比,双曲编码提供了更紧的泛化界(O(e−δ))。
- 推导了分类误差界,表明所提出的方法通过最小化类内方差、最大化类间距离以及减小生成分布与真实分布之间的 Wasserstein 距离来降低误差。
- 原型引导扩散:引入了一种机制,在无监督设置下利用类别原型引导扩散模型,解决了在没有先验标签信息的情况下为新类别生成样本的挑战。
- 实证优越性:在多个基准测试中展示了持续的最先进性能。
4. 实验结果
该模型在六个基准数据集上进行了评估:CoraFull、Coauthor-CS、Cora、WikiCS、Cora-ML、CiteSeer,以及大规模数据集ogbn-arxiv。
- 性能:IMPRESS consistently 优于广泛的基线方法,包括:
- 图嵌入方法(GCN, SGC)。
- 传统元学习(ProtoNet, MAML)。
- 图元学习(Meta-GNN, GPN, TEG, COSMIC)。
- 无监督图元学习(VNT, NaQ)。
- 示例:在ogbn-arxiv(5 类 3 样本)上,IMPRESS 达到了61.11%的准确率,显著击败了第二名(COSMIC 为 52.98%)。在CoraFull上,它达到了85.49%(而次优结果为 75.18%)。
- 消融研究:
- 移除双曲组件(w/o hyp)导致性能显著下降,证实了双曲几何对于层次数据的必要性。
- 移除扩散组件(w/o dif)也降低了性能,验证了通过扩散进行数据增强能有效缓解标签稀缺和分布偏差问题。
- 超参数敏感性:
- 发现最佳曲率(c)在 0.5 到 2.0 之间。
- 生成样本数量(D)呈现倒 U 型趋势,在 D=50 时性能最佳。
5. 意义
这项工作弥合了图数据的几何深度学习与生成建模之间的差距。
- 几何洞察:它验证了现实世界的图在双曲空间中能得到更好的建模,为欧几里得嵌入的“失真”问题提供了理论和实践解决方案。
- 数据稀缺解决方案:通过利用扩散模型合成高质量的、基于类别条件的样本,它为克服少样本学习中的“小数据”瓶颈提供了一种稳健策略,减少了过拟合并改善了决策边界。
- 无监督能力:利用从无监督聚类导出的伪标签来训练扩散模型的能力,使得该框架非常适用于标注数据昂贵或不存在现实世界场景。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。