← 最新论文
🤖 AI

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks

本文提出并验证了一种通过分析深度学习损失函数序列来识别错误标记医学图像的自动化方法,证明了纠正这些错误能显著提高糖尿病视网膜病变筛查中的数据集质量和模型性能。

原作者: Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别不同种类的水果。你给它看了成千上万张图片,但其中一些图片的标签贴错了。例如,你可能不小心把一张香蕉的照片贴上了苹果的标签。如果你让机器人学习这些错误的标签,它就会感到困惑,并学到错误的东西。

在医学领域,情况正是如此——这发生在分析眼部扫描图的 AI 上。医生必须手动标注数千张图像来训练这些 AI 系统。但医生也是人;他们会疲劳,图像可能会模糊,或者病情看起来非常相似。本文作者估计,这些医学标签中可能有高达 10% 是错误的。

问题所在:“困惑”的学生
研究人员注意到 AI “学习”时的一个有趣现象。当 AI 看到一张带有正确标签的图片时,它会很快变得自信。它的“错误得分”(称为损失函数)会平滑下降,就像一个理解了课程内容并每天成绩都在进步的学生。

然而,当 AI 看到一张带有错误标签的图片时,它会陷入困惑的循环。它尝试学习,失败了;再试一次,又失败了。它的“错误得分”会剧烈波动或保持在高位,就像一个不断被老师的指令搞得晕头转向的学生。

解决方案:倾听 AI 的“心跳”
该论文提出了一种巧妙的自动化方法,可以在不需要人工检查每张图像的情况下找到这些错误的标签。他们是这样做的:

  1. 长跑: 他们让 AI 对数据集进行多次学习(就像进行一场训练马拉松)。
  2. 得分的故事: 他们并没有只看最终结果,而是记录了每次训练 session 后的 AI “错误得分”。这为每一张图像都创造了一个独特的“故事”或序列。
  3. 寻找模式: 他们使用一种数学工具来观察这些故事。他们发现,带有正确标签的图像的故事看起来都非常相似(像是一个平滑的下坡过程)。而带有错误标签的图像的故事看起来则完全不同(颠簸、平坦或混乱)。
  4. 分类: 他们使用一种计算机算法将这些故事分为两堆:“困惑者”(很可能是错误的标签)和“自信者”(很可能是正确的标签)。

实验:清理教室
为了测试这是否有效,研究人员拿了一组完美的 10,788 张眼部图像,并秘密地更换了其中 6%(648 张)的标签,以此模拟现实世界中的错误。

  • 搜寻: 他们用这种新方法处理了这个混乱的数据集。它成功找到了 75% 被调换的标签。
  • 安全网: 至关重要的是,它并没有经常“虚报军情”。它只错误地指责了大约 5% 的正确标签。
  • 清理: 他们将计算机标记出的图像交给资深医生进行审核,并修正了标签。这使整个数据集的错误率从 6% 降低到了 1.5%。

结果:更聪明的 AI
最后,他们使用这个“清理过”的数据集重新训练了 AI。结果是,AI 的工作表现变得更好了。它在测试集上的准确率从 95.93% 上升到了 96.50%。虽然这个数字看起来很小,但在医学 AI 领域,向“完美”分数(即使用原始、未受损数据训练时的 96.57%)迈进是非常了不起的一步。

总结
本文表明,通过倾听 AI 的“错误得分”随时间的变化,我们可以自动识别出那些标签错误的图像。这使得医生可以将精力集中在那些真正需要修正的图像上,从而使最终的数据集更干净,生成的医学 AI 也更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →