← 最新论文
⚡ electrical engineering

Integrating Implicit and Explicit Relational Biases through Graph-Based Multiple Instance Learning: A Case Study in Skin Lesion Diagnosis

本文提出了一种双层关系框架,该框架结合了通过掩码自编码器进行的隐式块间学习与显式的基于图的模型构建,旨在显著提升在 ISIC 基准测试上的皮肤病变诊断性能,并在 ISIC-2018 数据集上实现了 79.27% 的平衡准确率。

原作者: Rafał Buler (Gdańsk University of Technology), Jakub Buler (Gdańsk University of Technology), Maciej Bobowicz (Medical University of Gdańsk), Michał Grochowski (Gdańsk University of Technology)

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Rafał Buler (Gdańsk University of Technology), Jakub Buler (Gdańsk University of Technology), Maciej Bobowicz (Medical University of Gdańsk), Michał Grochowski (Gdańsk University of Technology)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台计算机仅仅通过观察一张照片,就能识别出某种特定类型的物体,比如一种稀有的鸟类或衬衫上难以察觉的污渍。在人工智能的世界里,这被称为“图像分类”。长期以来,计算机通过观察色彩的小点(像素)并学习它们如何堆叠成形状,在这方面表现得非常出色。但问题在于:现实世界的物体,尤其是像皮肤斑点这样的医学影像,并不只是随机的像素堆。它们具有结构性。一个痣或病变的位置,其边缘与中心之间是存在关联的。

为了帮助计算机理解这些关系,科学家们使用了所谓的“归纳偏置”(inductive bias)。你可以把它想象成一套规则或是一个提示,我们告诉计算机这个世界是如何运作的。其中一种方式是“隐式”学习,即计算机通过观察数百万张图片来自行发现联系,就像你在没有被明确告知哪些特征重要的情况下,学会识别朋友的面孔一样。另一种方式是“显式”学习,即我们直接为计算机绘制一张地图,向它展示图像的哪些部分是邻居,并且应该进行比较。这篇论文探讨了当我们结合这两种方法时会发生什么:让计算机先自行学习基础知识,然后再给它一张特定的地图,以更好地连接这些点。目标是什么?是让医学诊断变得更加准确,这在医学领域至关重要,因为医生需要利用一切可能的优势来及早发现疾病。


论文的故事:教计算机如何与自己“对话”

这篇论文讲述了一组研究人员如何尝试通过混合两种不同的思维方式,使计算机在诊断皮肤病变(可能导致癌症的皮肤斑点)方面变得更加聪明。他们设计了一个小实验,观察计算机是否可以通过先理解图像的“氛围”(vibe),然后再强制它与图像的不同部分进行显式的“聊天”,从而提升工作能力。

首先,他们给了计算机一次“自监督”训练课。想象一下你有一个拼图,但有人盖住了其中一半的碎片,并要求你根据能看到的碎片来猜出下面隐藏的内容。计算机也做了类似的事情:它观察皮肤病变的图像,遮住其中的一部分,然后尝试重建缺失的部分。这教会了计算机理解图像中微小方块(称为“补丁”,patches)之间的局部关系,而无需人类告诉它该疾病是什么。这就是隐式部分——通过玩游戏来学习游戏的规则。

接下来,他们提取了这些学到的“氛围”(嵌入,embeddings),并尝试对皮肤斑点进行分类。他们从一种标准方法开始,即计算机仅仅观察所有的补丁,并根据它们进行投票以决定诊断结果。这是他们的基准线,效果相当不错,在其中一个测试集(ISIC-2018)上达到了 76.17% 的“平衡准确率”。但研究人员并未止步于此。他们想看看通过添加显式部分(即一张地图)是否能做得更好。

他们将补丁组织成不同的“图”(graphs),图就是一种高级网络,其中的点(补丁)通过线(关系)连接在一起。他们尝试了三种类型的地图:

  1. 随机图(Random): 将补丁连接到随机的邻居,就像一个混乱的群聊。
  2. 网格图(Grid): 仅将补丁与其紧邻的邻居连接,就像一个城市街区,你只能和隔壁的房子交流。
  3. k-最近邻图(kNN): 将补丁连接到那些与它们看起来最相似的补丁,无论这些补丁在图像中的位置在哪里,就像一个俱乐部,你只和拥有相同爱好的人混在一起。

随后,他们使用了一种特殊的神经网络(图神经网络,Graph Neural Network),让这些补件沿着地图上的线条向彼此“传递消息”,然后在做出最终决定之前进行处理。

他们的发现

结果非常明确。那个仅仅观察补丁并进行投票的计算机(基准模型)准确率为 76.17%。当他们加入了“隐式”学习(自监督重建)后,准确率跳升到了 77.12%。但真正的魔法发生在加入“显式”地图之后。

表现最好的模型是结合了特定类型的消息传递网络——图注意力网络(GAT)的网格图。这种设置迫使计算机尊重皮肤病变的物理布局,将准确率提升到了 79.27%。这是一个显著的进步!在第二个更大的数据集(ISIC-2019)上,同样的策略——将隐式学习与 kNN 图(连接相似补丁)相结合——将准确率推高到了 60.67%,超过了仅使用隐式学习的 59.84%

研究人员还测试了一个“假设”场景:如果计算机无法从消息中学习,而只是使用一个固定的、预设的地图会怎样?当他们“冻结”图网络的学习部分时,性能骤降至 34.28%。这表明计算机需要主动学习补丁之间是如何关联的;仅仅拥有地图是不够的。学习过程本身才是产生差异的关键。

为什么这很重要

论文指出,秘诀不仅仅在于拥有更多的数据或更强大的计算机,而在于你如何连接这些点。通过将计算机自主学习模式的能力(隐式)与比较图像不同部分的结构化方式(显式)相结合,他们创建了一个比许多以往方法都更准确的系统。事实上,他们的单一模型表现几乎可以媲美一些复杂的“集成”(ensemble)方法,而后者通常结合了多达 90 个复杂模型的预测。

作者总结道,这种方法对于处理医学图像是一个极具前景的方向,因为在这些图像中,病变不同部分之间的关系至关重要。他们发现,虽然隐式学习提供了一个很好的基础,但加入显式的关系建模则为这个基础盖上了一层坚实的屋顶。这提醒我们,在人工智能的世界里,有时你不仅要教计算机看什么,还要教它如何思考所见事物之间的联系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →