← 最新论文
💻 computer science

Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge for early detection of Barrett's neoplasia

RARE25 挑战赛通过引入反映真实世界发病率的大规模基准数据集和评估框架,揭示了现有计算机辅助检测系统在低发病率巴雷特食管癌前病变筛查中因忽视患病率而导致的阳性预测值偏低问题,并旨在推动开发更具临床适用性的鲁棒检测系统。

原作者: Tim J. M. Jaspers, Francisco Caetano, Cris H. B. Claessens, Carolus H. J. Kusters, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Jacques J. Bergman, Peter H. N. De With, Martijn R. Jong, Albert J
发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tim J. M. Jaspers, Francisco Caetano, Cris H. B. Claessens, Carolus H. J. Kusters, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Jacques J. Bergman, Peter H. N. De With, Martijn R. Jong, Albert J. de Groof, Fons van der Sommen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 RARE25 的医学人工智能挑战赛,它的核心任务是:教 AI 在茫茫大海中,精准地找到那几条极其罕见的“坏鱼”(早期癌症病变)。

为了让你轻松理解,我们可以把这个过程想象成一场**“大海捞针”的超级大考**。

1. 背景:为什么这很难?(大海与针)

想象一下,医生在做胃镜检查时,就像在一片巨大的、平静的蓝色海洋(正常的食管组织)里寻找几根极细的金色针(早期的巴雷特食管癌病变)。

  • 现实情况:在真实的检查中,99% 甚至 99.9% 的画面都是正常的“大海”,只有极少数画面里有“针”。
  • 过去的难题:以前的 AI 训练就像是在一个人工制造的鱼缸里练手。训练师为了公平,把“针”和“海”的数量强行摆成 1:1。AI 在这种环境下表现完美,因为它习惯了“针”到处都是。
  • 真正的挑战:一旦把 AI 放到真实的“大海”里,它就会发现“针”少得可怜。这时候,AI 往往会因为太紧张,把很多普通的“海草”(正常组织)误认为是“针”(假阳性),导致医生被大量的误报搞得精疲力竭,甚至产生“狼来了”的疲劳感。

2. RARE25 挑战赛:一场真实的“大海捞针”考试

为了解决这个问题,研究团队组织了 RARE25 挑战赛

  • 出题思路:他们不再给 AI 看人工平衡的鱼缸,而是直接扔给它真实的海洋数据
    • 训练集:给了大家 3000 多张图片(其中只有 158 张是“针”,其余全是“海”)。
    • 考试卷(测试集):藏起来的 25,000 多张图片,完全按照真实世界的比例,绝大多数是“海”,只有极少数是“针”。
  • 评分标准:不再只看 AI 能不能把“针”找出来(灵敏度),还要看它会不会乱报警(阳性预测值)。如果 AI 找了 100 个“针”,结果 99 个都是假的,那它在临床上就是不合格的。

3. 参赛队伍的表现:高手过招

来自 7 个国家的 11 支顶尖团队参加了这次比赛,他们用了各种“独门秘籍”:

  • 大模型“搬砖”法:有些队伍(如 IMSY 队)直接搬来了在海量医学数据上预训练好的“超级大脑”(基础模型),然后针对这次考试进行微调。他们就像是用一个见过世面的老猎人,专门训练他找这种特定的“针”。
  • 人海战术(集成学习):很多队伍(如 agaldran 队)派出了 25 个甚至 40 个 AI 模型组成“智囊团”。大家各自看一遍,然后投票决定哪张图有问题。这就像让 40 个专家一起看,总有一个能发现别人漏掉的细节。
  • 换个角度看世界:有的队伍(如 Jmees-inc 队)不直接分类,而是先教 AI 把“针”画个圈(分割任务),然后再判断。这就像先让 AI 学会“描红”,再让它“认字”。

4. 比赛结果:进步了,但还不够完美

  • 谁赢了? IMSY 队 获得了第一名。他们的 AI 在真实的大海里,每发现 100 个疑似目标,大约有 3.5 个是真的(阳性预测值 3.5%)。
  • 这算高吗? 说实话,3.5% 依然很低。这意味着医生每收到 100 个警报,可能只有 3 个是真的,剩下的 97 个都需要人工去复核。
  • 关键发现
    1. 以前的指标骗人:如果只看传统的“准确率”或"ROC 曲线”,大家的成绩都很好,看起来像满分。但一旦放到真实比例下,很多 AI 就“露馅”了,误报率飙升。
    2. 最难的是“微针”:对于那些非常明显的大块病变,所有 AI 都能认出来;但最难的是那些极细微、几乎和正常组织混在一起的早期病变,这是目前所有 AI 的短板。

5. 未来的启示:我们需要新的“捕鱼网”

文章最后提出了一个深刻的观点:

目前的 AI 大多还是**“分类器”(非黑即白:有病/没病)。但在“大海捞针”的场景下,也许我们需要“异常检测器”**。

  • 比喻:与其教 AI 认识所有种类的“针”(因为针的种类太多且罕见),不如教 AI 彻底记住什么是“完美的海”。
  • 新思路:只要看到任何不像海的东西,就标记为可疑。这样就不需要那么多“针”的样本了,也能更好地应对那些从未见过的新型病变。

总结

RARE25 就像是一次给 AI 医生的“实战演习”。它告诉我们:

  1. 实验室里的完美不等于临床上的好用
  2. 在罕见病筛查中,减少误报比单纯提高检出率更重要。
  3. 未来的 AI 需要更聪明,不仅要学会找“针”,还要学会如何在大海里不把自己吓死(不过度报警)。

这项研究为未来开发真正能帮到医生、能安全投入医院使用的 AI 系统,打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →