在数字世界中,我们的许多信息不仅仅是以事实列表的形式组织的,而是以复杂的连接网络形式存在的。想象一个社交网络,人们通过友谊联系在一起;或者一个图书馆,书籍通过讨论的主题相互关联。在计算机科学中,这些网络被称为图(graphs)。当这些网络中的项目还携带了文字描述时——比如用户的个人简介或书籍的摘要——它们就变成了研究人员所称的文本属性图(text-attributed graphs)。几十年来,科学家们一直试图教会计算机理解这些网络,希望能够预测诸如用户下一步可能购买什么,或者哪篇研究论文最相关等问题。挑战始终在于如何将网络的形状与文字的含义结合起来。最近,一种被称为大语言模型的新型强大计算机程序出现了。这些模型非常擅长阅读和理解文本,这使得许多研究人员相信,它们可以独立解决这些图问题。然而,仅仅依赖这些强大的文本阅读器已被证明既昂贵又有时不可靠,因为它们也会像其他读者一样犯错。
来自韩国和美国的的一个研究小组提出了一种处理该问题的不同方法,该方法提出了一个简单但至关重要的问题:谁应该成为网络中每个特定部分的“老师”?他们的工作题为《谁来教导?》(Who Should Teach?),其核心观点是,图中的每个节点并不都需要同样种类的帮助。在他们的系统中,“节点”仅仅是指网络中的单个项目,例如一个人或一份文档。研究人员发现,虽然有些节点通过观察其邻居和网络的结构能得到最好的理解,但另一些节点则通过阅读其文本描述能得到最好的理解。为了测试这一点,他们构建了一个名为 CoTeach 的框架,该框架充当了两种不同类型“老师”的智能管理者。一种老师是图神经网络,一种旨在从网络的连接和结构中学习的系统。另一种老师是大语言模型,旨在从书面文本中学习。CoTeach 并没有强迫语言模型去分析每一个项目,而是先让“图老师”进行观察。如果图老师对一个节点非常确定,它就会处理这项工作。如果图老师不确定,系统随后会请出语言模型,根据文本提供第二种意见。
研究人员在四个真实世界的数据集上测试了这种方法,这些数据集包括学术论文和网络文章的集合,且是在可用学习示例非常稀少的情况下进行的。他们发现,这种双老师系统始终优于仅依赖一种类型老师的方法,也优于试图使用语言模型处理一切的方法。通过让图老师处理简单的案例,并仅在必要时才引入昂贵的语言模型,该系统不仅变得更加准确,而且运行成本也显著降低。事实上,与某些过度依赖语言模型的现有方法相比,这种新方法使用的计算资源减少了高达 67 倍。这项研究表明,教导计算机理解这些复杂网络最有效的方法不是使用单一、全能的工具,而是根据具体问题智能地在不同工具之间切换。这种自适应策略使计算机能够从有限的数据中更有效地学习,同时避免了过度依赖强大的文本处理模型所带来的高昂成本和潜在错误。
技术摘要:用于文本属性图少样本节点分类的 CoTeach
问题陈述
文本属性图(Text-Attributed Graphs, TAGs)结合了图拓扑结构与节点相关的文本属性,这为在下游任务(如节点分类)中有效融合结构与语义信息带来了挑战。虽然近期的研究利用大语言模型(LLMs)来增强少样本设置下的 TAG 学习,但现有方法通常在所有节点上统一应用 LLM 衍生的监督信息。这种方法忽略了 LLM 输出可靠性的巨大差异:对于某些节点,LLM 的指导极具启发性;而对于另一些节点,它可能会引入噪声或错误。此外,统一查询 LLM 会产生高昂的资金成本。
本文解决的核心问题是监督来源缺乏自适应性。图神经网络(GNNs)擅长利用结构信号,而 LLMs 擅长语义推理。本文认为,最优的监督来源可能因节点而异,从而提出了一个问题:“谁应该教导每个节点?”
方法论:CoTeach 框架
作者提出了 CoTeach,这是一个基于置信度的双教师学习框架,旨在为少样本设置中的每个节点动态选择最可靠的教师。该框架由三个主要部分组成:
GNN 教师(结构感知):
- 利用自监督方法(Deep Graph Infomax)及随后的分类器,根据图拓扑结构生成预测。
- 为每个节点生成伪标签和置信度分数(预测概率)。
- 根据置信度阈值 γg 将节点划分为两类:
- VGNN:高置信度节点,其结构信息被认为是足够的。
- VR:低置信度节点,其结构信息本身不足。
LLM 教师(语义感知):
- 专门针对 VR 中的不确定节点进行处理。
- 为了降低成本,它采用了种子节点选择策略(通过聚类节点表示并选择质心),仅查询代表性的节点子集,而非 VR 中的所有节点。
- 对于选定的节点,LLM 接收包含节点文本和候选标签描述的提示词(prompts),以生成概率分布。
- 只有超过第二个置信度阈值 γl 的预测才会被保留作为可靠的伪标签,形成集合 VLLM。
学生模型:
- 一个基于 GNN 的模型,通过从两个教师提供的置信度感知伪标签中学习进行训练。
- VGNN 中的节点由 GNN 教师的输出进行监督,而 VLLM 中的节点由 LLM 教师的输出进行监督。
- 训练目标结合了来自两个教师的交叉熵损失(用于硬伪标签)和知识蒸馏损失(用于软概率分布),并由超参数 α 进行加权。
核心贡献
- 新视角: 本文引入了一种自适应监督视角,承认了 LLM 衍生监督在节点层面的可靠性差异,并指出统一应用 LLM 是次优的。
- 新颖框架: 提出了 CoTeach,这是一个基于置信度的双教师框架,能够根据预测置信度自适应地在 GNN 教师和 LLM 教师之间进行选择,确保最可靠的信号引导每个节点。
- 广泛评估: 该框架在四个真实的 TAG 数据集(Cora, Citeseer, Pubmed, WikiCS)上进行了评估,证明了其在提高少样本节点分类性能的同时,减少了不必要的 LLM 利用。
实验结果
评估将 CoTeach 与 10 种竞争方法进行了对比,包括骨干 GNN(GCN, GAT, GraphSAGE)、预训练语言模型(BERT, BART, SBERT)以及现有的 GNN+LLM 方法(LLMGNN, TAPE, LLM4NG)。
- 性能 (EQ1 & EQ2): 在大多数少样本设置(k∈{3,5,7,10})下,CoTeach 始终取得了最佳的整体性能。消融实验证实,结合两种教师比单独使用其中之一或不使用教师具有更优的结果。具体而言,CoTeach 变体实现了 1.6 的平均排名(AR),显著优于基准模型。在具有挑战性的 3-shot 设置中观察到了显著提升,在 Cora 数据集上比最强的基准模型提高了多达 6.9%。
- 成本效率 (EQ3): CoTeach 展示了显著的成本效率。与 TAPE 相比,它减少了高达 67.6 倍的 LLM Token 消耗,与 LLMGNN 相比减少了 8.3 倍,同时保持了卓越的准确率。
- 鲁棒性 (EQ4): 敏感性分析表明,CoTeach 对超参数的选择具有较强的鲁棒性,在采用适中的置信度阈值和充足的种子节点覆盖时表现最佳。
意义与主张
本文声称 CoTeach 为少样本 TAG 学习提供了一种简单且有效的自适应监督机制。通过认识到 GNN 和 LLM 具有互补的优势,该框架避免了统一应用 LLM 的弊端。其主要意义在于能够在提高分类性能的同时,降低与商业 LLM 推理相关的资金成本。作者将这项工作定位为向更高效、更可靠地将 LLM 集成到图学习中迈出的重要一步,特别解决了不同节点间监督质量的可变性问题。文中提到,未来的工作可能会将该框架扩展到边级和图级学习场景。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。