← 最新论文
📄 radiology and imaging

Label-Free Threshold Selection for Out-of-Distribution Detection in Liver CT Segmentation

本文提出了一种无需标签的框架,通过对成对表面 DSC 分数进行对数 t 分布拟合,用于校准肝脏 CT 分割中的分布外检测阈值,从而在不需要专家标注的失败数据的情况下,实现具有统计学原理的失败风险分类。

原作者: Nielsen, M., Castelo, A., Altaie, M., Bennett, J., Anthony, A., Siddiqi, N. S., Gupta, A. C., Brock, K. K., Woodland, M.

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Nielsen, M., Castelo, A., Altaie, M., Bennett, J., Anthony, A., Siddiqi, N. S., Gupta, A. C., Brock, K. K., Woodland, M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在现代医院中,计算机正越来越多地被要求执行一项精细的任务:在人体内部绘制器官的精确轮廓。当患者接受计算机断层扫描(CT)时,机器会生成数千张横截面图像,软件必须识别出肝脏,将其从周围组织中分离出来,以便医生能够规划治疗方案或测量肿瘤。虽然这些自动化系统在处理典型扫描时表现得非常出色,但面对与最初训练数据不同的异常解剖结构或罕见图像质量时,它们可能会出错。如果计算机画错了边界而无人察觉,医生可能会基于错误的信息做出治疗决策。为了防止这种情况,研究人员开发了标记这些不确定时刻的方法,本质上是让计算机有一种表达“我对这个不太确定”的方式。目前的挑战在于,如何能够在不需要人类专家先审查数千张图像的情况下,准确地找出何时发出警报,因为这种人工审查过程缓慢、昂贵,且在失败案例极少发生时往往难以实现。

德克萨斯大学 MD 安德森癌症中心的一个研究小组提出了一种新方法来设置这些安全警报,而无需依赖人工标签来教导系统什么是失败。在他们的研究中,他们专注于肝脏扫描,并探讨了计算机是否可以通过观察自身成功工作的模式,来学习识别自身的错误。他们并没有向系统展示数千个坏扫描的示例以学习如何避免,而是让系统研究一组正常、成功的扫描所给出的评分。他们发现,优秀扫描的评分遵循一种可预测的数学形状,就像人群中人们的身高往往聚集在平均值附近一样。通过描绘出这种“成功的形状”,他们可以识别出任何落在预期模式之外的新扫描。

研究人员在一组包含五百份肝脏扫描的集合上测试了这个想法,这些扫描包括来自他们自己医院以及来自全球七个国家、七十多个不同医疗机构的图像。他们使用了一种将计算机生成的轮廓与其自身进行多种方式对比的方法,从而生成一个代表系统置信度的单一评分。当应用这种新方法时,他们发现可以将这些扫描分为三组:低风险、中风险和高风险。低风险组包含那些看起来与系统研究过的成功案例非常相似的扫描;高风险组包含那些看起来非常奇怪的扫描。至关重要的是,中风险组旨在捕捉任何可能出现的问题。当他们检查结果时,发现后来被人类专家判定为失败的所有扫描,都被归入了中风险或高风险类别。事实上,该系统捕捉到了所有的失败案例,敏感度达到了100%,这意味着它没有遗漏任何一个,同时还能正确地将近80%的良好扫描识别为安全。

这种方法比以往的方法具有显著优势,以往的方法通常需要专家手动审查数百张图像,以决定在安全扫描和危险扫描之间划定界限。那种人工过程是一种沉重的负担,尤其是因为坏扫描很罕见;寻找足够的示例来教导系统通常需要很长时间。这种新方法完全绕过了这种需求。通过拟合一条曲线来对应成功扫描的评分,研究人员创建了一个作为“常态标准”的参考点。任何产生的评分远离这一标准的扫描都会被标记以供审查。研究表明,即使用于构建标准的扫描组中包含少量错误的示例,该方法依然有效,这表明该系统对于数据并不完美的现实世界应用具有鲁棒性。

研究人员还探索了如何处理不同类型的评分系统。虽然其中一种评分类型完美符合他们预期的数学形状,但另一种则不符合。对于不符合的那种,他们使用了另一种技术来重新排列数据使其符合模式,证明了他们的框架对于各种衡量置信度的方式都具有足够的灵活性。他们发现,通过使用两个不同的阈值,可以使系统适应不同的需求。一个阈值被设定得非常敏感,即使意味着会将一些好的扫描也标记为可疑,也能捕捉到每一个可能的失败。另一个阈值则更为严格,能识别出一组几乎可以肯定出错的扫描,这有助于医生在时间有限时优先处理重点关注对象。

最终,这项工作证明了计算机可以在没有被明确教导什么是错误的情况下,学会识别自身的局限性。该系统并不是要取代医生,而是提供了一个清晰的、基于数据的信号,告知哪些扫描值得进一步查看。通过将复杂的数字转化为简单的风险类别,研究人员创造了一个工具,可以帮助医院更安全、更高效地部署自动化影像工具。研究结果表明,随着人工智能在医学领域变得越来越普遍,我们可以依靠其自身成功的模式来保护我们免受其罕见失败的影响,确保这项技术成为患者护理中可靠的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →