✨ 要点🔬 技术摘要
这篇文章介绍了一个名为 RARE25 的医学人工智能挑战赛,它的核心任务是:教 AI 在茫茫大海中,精准地找到那几条极其罕见的“坏鱼”(早期癌症病变)。
为了让你轻松理解,我们可以把这个过程想象成一场**“大海捞针”的超级大考**。
1. 背景:为什么这很难?(大海与针)
想象一下,医生在做胃镜检查时,就像在一片巨大的、平静的蓝色海洋 (正常的食管组织)里寻找几根极细的金色针 (早期的巴雷特食管癌病变)。
现实情况 :在真实的检查中,99% 甚至 99.9% 的画面都是正常的“大海”,只有极少数画面里有“针”。
过去的难题 :以前的 AI 训练就像是在一个人工制造的鱼缸 里练手。训练师为了公平,把“针”和“海”的数量强行摆成 1:1。AI 在这种环境下表现完美,因为它习惯了“针”到处都是。
真正的挑战 :一旦把 AI 放到真实的“大海”里,它就会发现“针”少得可怜。这时候,AI 往往会因为太紧张,把很多普通的“海草”(正常组织)误认为是“针”(假阳性),导致医生被大量的误报搞得精疲力竭,甚至产生“狼来了”的疲劳感。
2. RARE25 挑战赛:一场真实的“大海捞针”考试
为了解决这个问题,研究团队组织了 RARE25 挑战赛 。
出题思路 :他们不再给 AI 看人工平衡的鱼缸,而是直接扔给它真实的海洋数据 。
训练集 :给了大家 3000 多张图片(其中只有 158 张是“针”,其余全是“海”)。
考试卷(测试集) :藏起来的 25,000 多张图片,完全按照真实世界的比例,绝大多数是“海”,只有极少数是“针”。
评分标准 :不再只看 AI 能不能把“针”找出来(灵敏度),还要看它会不会乱报警 (阳性预测值)。如果 AI 找了 100 个“针”,结果 99 个都是假的,那它在临床上就是不合格的。
3. 参赛队伍的表现:高手过招
来自 7 个国家的 11 支顶尖团队参加了这次比赛,他们用了各种“独门秘籍”:
大模型“搬砖”法 :有些队伍(如 IMSY 队)直接搬来了在海量医学数据上预训练好的“超级大脑”(基础模型),然后针对这次考试进行微调。他们就像是用一个见过世面的老猎人,专门训练他找这种特定的“针”。
人海战术(集成学习) :很多队伍(如 agaldran 队)派出了 25 个甚至 40 个 AI 模型组成“智囊团”。大家各自看一遍,然后投票决定哪张图有问题。这就像让 40 个专家一起看,总有一个能发现别人漏掉的细节。
换个角度看世界 :有的队伍(如 Jmees-inc 队)不直接分类,而是先教 AI 把“针”画个圈(分割任务),然后再判断。这就像先让 AI 学会“描红”,再让它“认字”。
4. 比赛结果:进步了,但还不够完美
谁赢了? IMSY 队 获得了第一名。他们的 AI 在真实的大海里,每发现 100 个疑似目标,大约有 3.5 个是真的(阳性预测值 3.5%)。
这算高吗? 说实话,3.5% 依然很低 。这意味着医生每收到 100 个警报,可能只有 3 个是真的,剩下的 97 个都需要人工去复核。
关键发现 :
以前的指标骗人 :如果只看传统的“准确率”或"ROC 曲线”,大家的成绩都很好,看起来像满分。但一旦放到真实比例下,很多 AI 就“露馅”了,误报率飙升。
最难的是“微针” :对于那些非常明显的大块病变,所有 AI 都能认出来;但最难的是那些极细微、几乎和正常组织混在一起 的早期病变,这是目前所有 AI 的短板。
5. 未来的启示:我们需要新的“捕鱼网”
文章最后提出了一个深刻的观点:
目前的 AI 大多还是**“分类器”(非黑即白:有病/没病)。但在“大海捞针”的场景下,也许我们需要 “异常检测器”**。
比喻 :与其教 AI 认识所有种类的“针”(因为针的种类太多且罕见),不如教 AI 彻底记住什么是“完美的海”。
新思路 :只要看到任何不像海 的东西,就标记为可疑。这样就不需要那么多“针”的样本了,也能更好地应对那些从未见过的新型病变。
总结
RARE25 就像是一次给 AI 医生的“实战演习”。它告诉我们:
实验室里的完美不等于临床上的好用 。
在罕见病筛查中,减少误报 比单纯提高检出率更重要。
未来的 AI 需要更聪明,不仅要学会找“针”,还要学会如何在大海里不把自己吓死 (不过度报警)。
这项研究为未来开发真正能帮到医生、能安全投入医院使用的 AI 系统,打下了坚实的基础。
1. 研究背景与问题定义 (Problem)
核心挑战:低患病率效应 (Low-Prevalence Effect)
在巴雷特食管的常规监测中,早期新生物(neoplasia)的检出率极低(通常低于 1%)。
现有的 CADe 系统大多在平衡数据集 或富集数据集 上训练和评估,导致模型在真实世界部署时面临严重的患病率偏移 (Prevalence Shift) 。
后果 :在真实低患病率场景下,即使模型具有极高的灵敏度,也会产生大量的假阳性 (False Positives) ,导致临床医生产生“警报疲劳”,增加工作负担,甚至降低系统的临床实用性。
现有研究的不足 :
缺乏大规模、反映真实患病率分布的公开基准测试。
评估指标往往过于依赖 AUROC 或 AUPRC 等排名指标,而忽略了在特定临床操作点(如高召回率下)的阳性预测值(PPV)。
大多数方法仍采用全监督分类,未充分利用“正常数据丰富、异常数据稀缺”这一特性进行异常检测(Anomaly Detection)或单类学习。
2. 挑战赛设计与方法论 (Methodology & Challenge Design)
RARE25 挑战赛由荷兰埃因霍温理工大学(TU/e)和阿姆斯特丹大学医学中心(Amsterdam UMC)联合组织,作为 MICCAI 2025 的一部分。
2.1 数据集构建
公开训练集 :包含 3,095 张内镜图像(2,937 张非异型增生 BE 图像,158 张确诊新生物图像)。这是目前最大的公开巴雷特食管图像集。
特点 :数据来自两家荷兰医疗中心,包含压缩伪影,反映了真实临床采集的多样性。
私有测试集 :包含超过 25,000 张图像(23,176 张非异型增生,3,232 张新生物)。
关键设计 :测试集采样严格模拟了真实世界的低患病率 (约 1:100 的负正比),旨在评估模型在部署环境下的表现。
验证集 :包含 1,143 张图像,用于内部验证。
2.2 评估协议
为了克服极端类别不平衡带来的评估偏差,挑战赛采用了以下策略:
Bootstrap 重采样 :进行 1,000 次迭代,在保持所有阴性样本的同时,按 1:100 的比例重采样阳性样本,以估计指标的不确定性。
核心评估指标 :
AUROC :全局判别能力。
AUPRC :检索性能。
PPV@90% Recall (主要指标) :在保持 90% 召回率(即不漏检 90% 的病变)的前提下,计算阳性预测值。该指标直接反映了临床高灵敏度操作下的假阳性负担。
2.3 参赛队伍方法概览
共有 11 支来自 7 个国家的队伍提交方案,主要技术路线包括:
架构多样性 :
CNN :ResNet-50, ConvNeXt (B, V1/V2)。
Transformer :ViT (Base/Large), MaxViT, DeiT, Hiera。
混合架构 :结合 CNN 与 Transformer。
预训练策略 :
领域特定预训练 :利用 GastroNet-5M 等大规模胃肠内镜数据集进行微调(如 IMSY, MEDAI, iRARE)。
通用预训练 :ImageNet-21k, DINOv3。
多阶段预训练 :Jmees-inc 采用了从息肉分割 -> 巴雷特分割 -> 癌症分类的渐进式预训练。
处理不平衡与校准 :
集成学习 (Ensembling) :多数队伍(如 IMSY 的 40 模型集成,agaldran 的 25 模型集成)使用大规模集成来降低方差。
损失函数 :Focal Loss, Asymmetric Loss (ASL), 加权交叉熵。
校准 :部分队伍(IMSY, MEDAI)使用了 Platt Scaling 或仿射重校准来调整概率输出,以匹配预期的低患病率。
数据增强 :几何变换、MixUp、针对内镜图像的特定增强(如 CLAHE 对比度增强)。
3. 关键结果 (Key Results)
3.1 性能表现
冠军队伍 (Team IMSY) :
结合了领域专用模型(ResNet-50 基于 GastroNet-5M)和基础模型微调(DINOv3 ViT-Large via LoRA)。
采用了 40 模型集成和仿射重校准。
PPV@90% Recall :在 Bootstrap 中位数为 0.035 (即在高召回率下,每 100 次报警中仅有约 3.5 次是真实的),在完整测试集上达到 0.320 。
AUROC :0.920。
其他表现 :
Team UT (MaxViT-Tiny) 在 AUPRC 指标上表现优异(Bootstrap 中位数 0.532)。
所有参赛队伍在 PPV@90% Recall 指标上均表现较低(大部分低于 4%),这直观地展示了在真实低患病率下,即使最先进的模型也会产生大量假阳性。
性能差距 :
第一名与第五名在 PPV 指标上有显著差距(约 52% 的提升),表明该基准尚未饱和,仍有改进空间。
排名指标(AUROC/AUPRC)与临床操作指标(PPV)的排序存在不一致,强调了单一指标评估的局限性。
3.2 定性分析
模型在明显病变上的表现普遍较好。
主要失败案例集中在极早期、视觉特征模糊 的病变上,这正是临床监测中最具挑战性的部分。
4. 主要贡献 (Key Contributions)
首个大规模、患病率感知的巴雷特食管 CADe 基准 :
提供了目前最大的公开训练集(>3,000 张)和严格模拟真实患病率的私有测试集(>25,000 张)。
重新定义评估标准 :
确立了以 PPV@90% Recall 为核心的评估体系,强制要求模型在临床高灵敏度要求下评估其假阳性负担,而非仅看排序指标。
引入了 Bootstrap 方法以量化评估结果的不确定性。
揭示方法论差距 :
发现所有参赛队伍均依赖全监督分类 ,无人采用异常检测 (Anomaly Detection) 或 单类学习 (One-class Learning) 。这表明在“正常数据丰富、异常数据稀缺”的场景下,现有研究可能偏离了最优解。
开源与可复现性 :
发布了大规模数据集和详细的评估代码,促进了该领域的可复现研究。
5. 意义与未来展望 (Significance & Future Directions)
临床意义 :
证明了在低患病率场景下,单纯追求高灵敏度会导致不可接受的假阳性率。未来的 CADe 系统必须将临床工作流整合 (如作为辅助筛查而非二元决策)和概率校准 作为核心设计目标。
强调了在开发阶段就考虑部署环境患病率的重要性,避免“实验室性能”与“临床性能”的巨大鸿沟。
技术启示 :
异常检测范式 :由于正样本稀缺,未来研究应更多探索基于“正常分布建模”的异常检测、自监督学习或半监督方法,这些方法可能对患病率偏移更具鲁棒性。
校准的重要性 :显式的后处理校准(Post-hoc calibration)对于将模型输出转化为临床可用的概率至关重要。
基准的未饱和性 :当前最佳方法的 PPV 仍然较低,表明通过更好的建模、数据利用和校准策略,仍有巨大的性能提升空间。
总结 :RARE25 挑战赛不仅是一个技术竞赛,更是一次对医疗 AI 评估范式的反思。它指出,在低患病率疾病筛查中,“真实世界评估”优于“平衡数据集评估” ,“操作点指标”优于“全局排序指标” ,并呼吁社区探索更适合稀缺异常检测的新兴方法学。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。