← 最新论文
💻 computer science

Data leakage inflates reported accuracy of deep learning for kidney stone detection on CT: a leakage-free, calibrated and uncertainty-aware reassessment across three centers

本研究表明,在用于 CT 肾结石检测的深度学习模型中,图像级的数据划分会因数据泄露导致报告的准确率人为虚高约九个百分点,并提倡采用基于患者、经过校准且具备不确定性感知能力的评估协议,以确保可靠的临床性能。

原作者: Okoi Obeten, Abas Aliu, Omowumi Aliu, Ahmed Jimoh, Zibril Aliyu, Christiana Ezeanya

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Okoi Obeten, Abas Aliu, Omowumi Aliu, Ahmed Jimoh, Zibril Aliyu, Christiana Ezeanya

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学影像领域,计算机正越来越多地被要求执行曾经需要人类肉眼完成的任务。其中一项任务是发现肾结石——这是一种体积微小且会导致剧痛的矿物质沉积,可能会阻塞尿液流动。为了寻找这些结石,医生依赖于计算机断层扫描(CT)技术,该技术会拍摄人体数百张横截面图像。放射科医生必须通过观察这些切片来寻找指示结石的微小亮点,这一过程既耗时又容易出现人为错误。因此,研究人员多年来一直致力于教导人工智能如何自动进行识别。其目标是创造一个数字助手,能够瞬间标记出结石,从而帮助医生工作得更快、更准确。然而,为了让这项技术获得信任,计算机必须证明它能够识别从未见过的结石,而不仅仅是记住已经学习过的图片。

来自尼日利亚研究人员的一项新研究揭示了许多此类计算机程序在测试过程中存在的一个关键缺陷。多年来,各类报告声称人工智能模型检测肾结石的准确率极高,通常引用超过 98% 的成功率。这些数字表明该技术已接近临床应用阶段。然而,研究人员发现,这些高分在很大程度上是一种由测试过程中的错误造成的幻象。当使用一种更严格、更诚实的测试方法对这些相同的计算机模型进行再次测试时,它们的表现显著下降。研究表明,之前的超高分并非代表卓越的智能,而是因为计算机在训练阶段利用了来自测试集的信息。

问题在于数据的准备方式。为了教会计算机识别肾结石,研究人员会对有限数量的真实 CT 扫描图像进行多次轻微改动,从而创建出许多经过处理的副本。他们可能会将图像左右翻转、轻微旋转或调整亮度。这些被称为“增强图像”的变体有助于计算机在不需要数千名独特患者的情况下学习结石的特征。错误发生在将原始图像及其变体混合在一起,然后拆分为训练组和测试组的过程中。如果计算机在训练阶段看到了某张原始图像,然后在测试阶段看到了该图像几乎完全相同的变体副本,它就不需要学习结石长什么样了。它只需识别出已经记住的模式即可。这就像一名学生背下了练习题的答案,然后在参加期末考试时遇到了题目稍作改动的同类题;他会得到满分,但他并没有真正掌握这门学科。

本研究中的研究人员使用了一个包含来自三家不同医院的 201 名患者图像的数据集。他们首先重建了以往研究中使用的测试方法,即在拆分之前将原始图像和增强图像混合在一起。在这种条件下,计算机模型的准确率达到了 99.1%,并在一个以 1.000 代表完美表现的量表上获得了 1.000 的得分。这一结果与早期科学论文中那些赞誉有加的报告相吻合。然而,研究人员随后改变了规则。他们确保在测试阶段,如果计算机已经在训练阶段见过某个患者的任何图像,那么它就绝不会再看到来自该患者的任何图像。这意味着测试集中的每一张图像都来自计算机从未接触过的全新患者。

当模型被迫面对这种更严格的挑战时,结果发生了剧烈变化。准确率降至 90.5%,性能得分降至 0.946。虽然这仍然是一个很强的结果,但远非此前备受赞誉的近乎完美的水平。近 9 个百分点的差距代表了报告数据与真实情况之间的巨大鸿沟。研究表明,之前的高分并不是反映计算机诊断疾病的能力,而是反映了一种允许计算机在训练期间利用测试集信息的测试协议。这一发现表明,医学人工智能领域看到的许多令人印象深刻的统计数据可能都因同样的错误而被夸大了。

研究人员还调查了是否需要更复杂的计算机架构来解决这个问题。他们将自己的主要模型(结合了两种不同类型的先进计算结构)与一个更简单的标准模型进行了对比。他们发现,在公平测试的情况下,复杂的模型并没有比简单的模型提供实质性的优势。事实上,一个仅依赖于复杂结构的模型在没有标准基础的情况下,表现几乎不比随机猜测好多少。这表明,成功的关键不在于设计的创新性,而在于测试方法的诚实性。研究还观察了计算机如何处理不确定性。他们发现,模型往往过于自信,在实际出错时仍声称自己很确定。通过教导模型在不确定时承认自身的不确定性,并将困难病例提交给人类医生,它所回答病例的准确率上升到了 95.2%。这表明,这类工具最有用的角色不是取代医生,而是作为一对知道何时寻求帮助的“第二双眼睛”。

这项工作的意义不仅限于肾结石。该研究是对整个医学人工智能领域的警示。它证明了如果测试存在缺陷,一个模型可以在研究论文中显得才华横溢,但在面对现实世界的患者时却表现失败。研究人员强调,为了让这些工具在医院中安全有效,必须使用真正代表新患者的数据进行测试。他们还指出,他们使用的数据集存在局限性,例如缺乏详细的患者信息,以及图像的处理方式移除了一些医生用于决策的原始数据。尽管存在这些局限性,但核心信息是明确的:通往可靠医学人工智能之路需要严谨且无数据泄露的测试。在业界采用这些更严格的标准之前,这些技术的报告成功率仍将是高估的,这可能会导致人们对尚未准备好进入临床的工具产生虚假的信心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →