← 最新论文
📊 statistics

DeGLIF for Label Noise Robust Node Classification using GNNs

本文提出了 DeGLIF,这是一种利用图神经网络上的留一法影响函数来稳健地识别并重新标记噪声节点的去噪技术,该技术无需预先知晓噪声模型或噪声水平,从而实现了比现有基准方法更优越的节点分类准确度。

原作者: Pintu Kumar, Nandyala Hemachandra

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Pintu Kumar, Nandyala Hemachandra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,机器通过学习示例进行学习,就像学生通过教科书学习一样。但如果教科书里充满了错别字,或者更糟的是,当书后的答案是错误的时候,会发生什么呢?这就是“噪声标签”问题。在许多现实场景中,例如绘制社交网络图谱或从医学影像中诊断疾病,数据的收集过程既廉价又快速,通常由容易出错的人群或自动化系统完成。这些错误不仅仅是微小的瑕疵;在依赖信息间连接性的系统中,一个错误的标签可能会像谣言一样传播,腐蚀其邻近节点的理解,并导致整个系统失效。多年来,研究人员一直致力于构建能够有效应对这些错误的机器,他们通常试图忽略坏数据,或者寄希望于足够多的好数据能够压倒噪声。

来自印度理工学院孟买分校(IIT Bombay)的一个研究小组提出了一种处理该问题的新方法,特别适用于以连接点形式存在的数据,例如社交媒体用户或化学分子。他们将这种方法称为 DeGLIF。该方法并非试图基于复杂的模式来猜测哪些标签是错误的,也不假设存在特定类型的错误,而是提出了一个简单且反直觉的问题:“如果我们仅仅移除这个特定的训练数据,会对我们的模型性能产生什么影响?”通过模拟移除单个数据点,并测量模型在少量、可信的干净样本集上的准确率提升程度,他们可以识别出哪些标签很可能是损坏的。如果移除一个节点能让模型变得更聪明,那么这个节点可能是在教导错误的教训。

研究人员开发了一个数学捷径来回答这个问题,而无需经历为每个数据点都重新训练模型的这种不可能完成的任务。他们使用了一种被称为“留一法影响函数”(leave-one-out influence function)的概念,通过观察模型的当前状态来估算一个数据点的影响。在连接网络的情境下,这尤其棘手,因为移除一个点也会切断它与邻居的连接,从而改变所有人的信息流。该团队扩展了现有方法,以解释这些结构性变化,从而能够计算特定节点对模型在干净、可信数据上预测的影响。如果一个节点的存在导致模型在干净数据上的表现变差,系统就会将其标记为噪声。

一旦识别出噪声节点,系统并不会简单地将其丢弃,因为这样做会浪费宝贵的信息。相反,它会尝试纠正错误。对于标签错误的节点,系统会查看模型当前对该节点的预测,并将标签翻转为最可能的正确类别。研究人员从理论上证明,这种纠正标签的过程在数学上优于直接删除节点,因为它在修复身份的同时保留了节点在网络中的结构价值。他们在多个标准数据集(包括大规模科学论文集和产品评论集)上测试了这种方法,并引入了各种水平的随机标签错误。在这些测试中,他们的方法始终优于现有的先进技术,在某些情况下将准确率提高了近 18%。

研究还探讨了该方法在不同条件下的表现。他们发现,即使可信的干净数据集非常小(仅占总数据集的不到 2%),该系统依然表现良好。他们观察到,该方法在不同类型的网络结构(无论是稀疏还是稠密连接)中都具有鲁棒性,并且不需要预先知道存在多少错误或错误的类型。事实上,研究人员展示了可以重复应用该方法:在第一轮清洗之后,数据变得更加干净,第二轮可以通过识别并修复更多的错误。虽然初始计算需要巨大的计算能力来分析网络结构,但研究人员表明,该方法仍能在其他竞争算法因内存限制而失败的大规模数据集上运行。

结果表明,这种方法提供了一种通用的工具,可以在不需要了解噪声来源的情况下清理混乱的数据。通过关注每个数据点对模型成功的实际影响,而不是试图对噪声本身建模,该系统可以有效地将信号与静电(噪声)分离。研究人员指出,虽然该方法在计算上比较密集,但它可以作为一个强大的预处理步骤,与其他的学习技术相结合,以进一步提升性能。在高质量数据昂贵且稀缺的背景下,这种将嘈杂、不可靠的数据集转化为干净、可信数据集的能力,代表了连接数据机器学习领域的重大进步。这项工作有力地证明了,理解单个数据点的影响力可以带来更具韧性和更准确的人工智能系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →