How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark
本文介绍了 LiFS,这是一个源自 MICCAI 2025 CARE-Liver 挑战赛的大规模、多中心真实世界基准,旨在系统评估当前人工智能在肝纤维化分期方面相对于放射科医生的水平,并识别阻碍其临床部署的关键数据与技术挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象肝脏是一座繁忙的城市。当这座城市随时间推移受伤时,它会积累“瘢痕组织”(纤维化)。医生需要知道瘢痕的严重程度,从轻微的尘埃覆盖(1 期)到被混凝土完全封锁的城市(4 期,即肝硬化)。通常,唯一能确切知晓的方法是取出一小块城市样本(用针穿刺活检),但这既痛苦又有风险。
多年来,科学家们一直试图教计算机(人工智能)通过查看肝脏的磁共振成像(MRI)扫描来推测瘢痕程度,从而替代使用针头穿刺。但大多数这些人工智能测试都发生在“完美世界”的实验室环境中。
本文介绍了一项名为LiFS(肝脏纤维化分期)的全新、更为严苛的测试,旨在评估人工智能在混乱的现实世界中究竟取得了多大进展。
“现实世界”考试
可以将以往的人工智能测试想象成在模拟器中于一条完美平滑、空旷的赛道上驾驶汽车。而这项新的 LiFS 基准测试,则如同将这些相同的汽车派往一条繁忙的高速公路,那里有不同的天气、不同的路面状况以及不同的交通规则。
研究人员从三家不同医院收集了610 名真实患者的数据,使用了四台不同的 MRI 设备(部分由西门子制造,部分由飞利浦制造)。他们不仅拍摄了一种类型的图像,而是利用不同设置拍摄了整个肝脏的“电影”,包括一种特殊的造影剂,它能点亮并显示肝细胞的实际工作状态。关键的是,他们将人工智能的答案与“金标准”进行了比对:即来自活检的实际组织样本。
他们还邀请了96 支人工智能开发团队参与竞赛。组织者挑选了前 9 支团队,以观察他们最优秀的算法彼此之间以及与人类医生相比表现如何。
结果:人工智能表现如何?
1. 人工智能 vs. 人类医生
研究人员将人工智能与两位人类放射科医生进行了比较:一位拥有 3 年经验(“初级”医生),另一位拥有 8 年经验(“资深”医生)。
- 在“主场”(同一家医院/同一台设备): 最佳的人工智能模型表现令人惊讶地出色。他们的表现大致与资深医生相当,并显著优于初级医生。这就像一名优等生在做他们复习过的完全相同的考题时取得了满分。
- 在“公路旅行”(不同医院/不同设备): 当人工智能尝试诊断来自完全不同医院、使用不同设备的患者时,情况变得不稳定。人工智能的平均表现下降,通常回落至初级医生水平或更低。虽然“最佳”的人工智能有时仍能与资深医生相媲美,但并不稳定。
2. 三大障碍
该论文指出了人工智能在离开实验室后挣扎的三个主要原因:
- “不同相机”问题: 就像照片在 iPhone 和三星手机上的显示效果不同一样,这三家医院的 MRI 图像看起来也各不相同。人工智能对这些拍摄方式的细微变化感到困惑。
- “类别不平衡”问题: 在测试数据中,大多数患者患有严重瘢痕,而患有轻微瘢痕的患者极少。这就像老师出了一份试卷,其中 90% 的问题关于“苹果”,只有 10% 关于“橘子”。许多人工智能开始对所有情况都猜测“苹果”。虽然它们因经常答对而获得了高分,但却未能真正区分不同类型的疾病。
- “特殊造影剂”困境: 特殊造影剂赋予了人工智能观察肝脏工作状态的“超能力”,但同时也引入了更多混乱,因为造影剂在不同设备上的表现各不相同。有时人工智能借助造影剂表现更好;有时则更差。这是一把双刃剑。
3. 技术“秘密武器”
该论文分析了获胜团队构建人工智能的方式,以观察什么方法奏效:
- 3D 与 2D: 一些人工智能将整个肝脏视为 3D 块进行观察,而另一些则观察 2D 切片。3D 模型在主场医院表现出色,但在相机改变时挣扎更多。2D 模型则更具灵活性。
- 配准: 表现最佳的团队通常在分析之前,将不同的 MRI 图像完美地“拼接”在一起,确保肝脏在每张图像中都处于完全相同的位置。
- “Transformer"趋势: 较新的人工智能架构(称为 Transformer)似乎比旧的、标准的架构更能稍微好地处理“不同相机”问题。
结论
该论文得出结论:人工智能已取得巨大飞跃。在受控环境中,它已经能够像一位经验丰富的肝脏专家那样行事。然而,它尚未准备好成为世界各地每家医院中可靠、独立的医生。
人工智能目前就像一名在每次模拟考试中都能取得满分的杰出学生,但当考场发生变化时就会感到紧张。为了使其准备好进入现实世界,我们需要教导它忽略 MRI 设备之间的差异,并处理现实医院中混乱且不平衡的数据。
该基准测试(LiFS)现已可供所有人使用,充当一种“压力测试”,帮助开发者构建能够最终在真实高速公路上安全行驶,而不仅仅是在模拟器赛道上行驶的人工智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。