← 最新论文
⚡ electrical engineering

Calibrated Selective Prediction Using Deep Ensembles for ROI-Based Thyroid Nodule Ultrasound Classification Under Dataset Shift: A Retrospective Evaluation

本研究提出了一种用于甲状腺结节超声分类的经过校准的深度集成框架,该框架实现了强大的内部性能和有效的选择性分诊,但在数据集偏移下表现出有限的外部泛化能力,凸显了在临床部署前进行局部重新校准和前瞻性验证的必要性。

原作者: Md. Sadibul Hasan Sadib, Md. Mohayminul Mukit, Rahmatul Kabir Rasel Sarker, Tahmid Alam Tamim, Md. Monir Hossain Shimul

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Md. Sadibul Hasan Sadib, Md. Mohayminul Mukit, Rahmatul Kabir Rasel Sarker, Tahmid Alam Tamim, Md. Monir Hossain Shimul

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由五名侦探组成的超级智能机器人团队,他们专门负责观察甲状腺结节的超声图像,并做出判断:“这是一个无害的肿块,还是应该用针刺(FNA)来检查是否为癌症?”

这篇论文讲述了如何构建这样一个机器人团队,教导他们如何在感到困惑时承认自己的困惑,并观察他们是否真的能在不犯危险错误的情况下为医生提供帮助。

侦探团队及其“置信度计”

研究人员使用一种名为 ConvNeXt-Tiny 的智能架构构建了一个由五名 AI 侦探组成的团队。但其中的转折在于:他们不仅希望团队能做出猜测,还希望他们能诚实地表达自己的确定程度。

为了实现这一点,研究人员给团队配备了一个特殊的“分歧计”,称为互信息(Mutual Information, MI)。你可以这样理解:如果五名侦探观察一张图片后都说:“没错,那绝对是个坏蛋,”那么计数值就会保持在低位。但如果侦探 A 说“坏蛋”,侦探 B 说“好人”,而其他侦探则在一旁抓耳挠腮,那么计数值就会升高。

当计数值升高时,系统有一条严格的规则:“停下!不要瞎猜。把这张图片发给人类医生。” 这被称为选择性预测(selective prediction)。其目标并非对每一张图片都做出决定,而是仅在团队非常有信心且达成一致时才做出决策。

大考:实验室内部 vs. 现实世界

该团队在一个名为 TN5000 的庞大数据集上进行了训练,该数据集包含 5,000 张图像。在这个受控的实验室环境中,该团队表现出色:

  • 在区分好坏的评分上(分值为 0 到 1,1 为完美),他们得到了 0.9395 分。
  • 他们具有高度的校准性,这意味着他们预测的概率与实际结果非常吻合,误差率极小,仅为 0.88%
  • 当他们使用“分歧计”过滤掉棘手案例时,他们可以安全地针对 7.2% 的案例建议“无需穿刺”,针对 39.9% 的案例建议“需穿刺”,同时将剩余的 52.9% 交由人类医生处理。
  • 至关重要的是,在这个特定数据集中,他们抓住了 99.83% 的所有癌症病例。

然而,论文提出了一个非常重要的观点:这种成功仅限于实验室内部。 作者明确指出,本研究的目的不是为了取代临床评估或估算现实世界中的活检规避率,而是为了测试该系统能否识别出自动化建议不可靠的情况。

现实检查:当团队遇到新城市

为了测试这个团队在现实世界中是否能够工作,研究人员将这个被“冻结”且不可更改的机器人团队(仅在 TN5000 上训练)送到了一个完全不同的数据集 TN3K 中。这个新数据集拥有不同的机器、不同的医生和不同类型的图像。

结果是,机器人团队踉跄了:

  • 他们的“聪明度”得分从 0.9395 降至 0.7870
  • 他们的诚实度(校准性)变得混乱。他们开始在实际概率远低于预期时仍说“有 90% 的概率”,误差率跃升至接近 19%
  • “分歧计”失效了。因为新的图像看起来截然不同,团队变得更加困惑。
  • 当他们尝试使用实验室中的相同规则时,83.7% 的新图像必须被送往人类医生处。机器人团队仅在 16.3% 的案例中感到有信心做出决定。
  • 更糟糕的是,他们所做的“需穿刺”建议中,只有 76.6% 是正确的,远低于实验室中的 95% 目标。

论文说了什么(以及没说什么)

作者非常谨慎,没有过度吹捧。他们明确表示,该系统目前还不具备在现实医院中取代医生或停止活检的条件。

  • 它证明了: 他们证明了机器人团队可以被训练得对自己的不确定性保持诚实,并且如果图像看起来与它学习到的图像完全一致,它可以安全地建议“无需穿刺”或“需穿刺”。
  • 它排除了: 他们排除了“只需将一个在某医院数据上训练的模型直接应用到另一家医院,并期望其同样奏效”的可能性。这种“冻结”的策略无法很好地迁移。
  • 它暗示了: 它表明使用“分歧”作为安全开关是一个好主意,但你需要在每次使用新的医院数据时,都重新校准机器人的置信度计。

总结

可以将这个机器人团队想象成一名优秀的学生,他在自己的教室里(TN5000)考试拿了高分,但当他走进一所拥有不同教材和老师的不同学校(TN3K)时,却感到不知所措。

这项研究表明,该学生足够聪明,能够说出“我不了解这个,让我问问老师”,这是一个极好的安全特性。但除非我们教会这个学生如何应对每一种新学校的教学风格,否则我们不能让他们独立批改试卷。论文得出结论,虽然“选择性预测”的想法很有前景,但在我们可以信任它做出真正的医疗决策之前,我们需要更多的局部测试和校准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →