← 最新论文
🧬 biology

Do Pathology Foundation Models Learn Biology? Uncertainty-Based Evaluation on AML Cytomorphology

本研究表明,尽管通用视觉模型在标准聚类指标上可能优于病理特定基础模型,但后者通过能够区分急性髓系白血病中细胞成熟状态的稳定不确定性模式,展现出了捕捉生物学意义结构的更佳能力。

原作者: Aadil Bhat, Sajad Kawa, Mohammad Munzir

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Aadil Bhat, Sajad Kawa, Mohammad Munzir

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在医学领域,显微镜长期以来一直是理解人体不可见机制的主要工具。当医生怀疑血液疾病时,他们会观察细胞切片,寻找形状、颜色和纹理上的细微差异,以判断细胞是健康还是病态。这项任务要求极高且容易产生人为误差;即使是专家也可能对所见之物产生分歧,且过程缓慢。为了提供帮助,科学家们转向了人工智能,教计算机识别这些模式。最近,新一代强大的计算机程序——被称为“基础模型”的程序——应运而生。这些程序就像是庞大的视觉知识库,通过数百万张图像进行训练以理解世界。有些是基于自然界的普通照片进行训练,而另一些则是专门针对医学切片进行训练。对于医生和研究人员来说,一个重大的问题是:这些对广阔世界有着惊人理解力的通用型程序,是否真的能理解人类细胞特有的复杂生物学特征,还是说它们需要经过医学图像的专门训练才能做到这一点。

一个研究小组决定通过测试三种不同的计算机模型来回答这个问题,测试对象是一种被称为急性髓系白血病的特定类型血液癌症。这种疾病发生于血液细胞无法正常成熟,从而停留在不成熟的状态。研究人员使用了一个包含近 17,500 张单个细胞图像的数据集,这些图像此前已被专家根据其生物发育过程分为 15 个不同的类别。目标是观察计算机模型是否能在没有预先告知答案的情况下,正确地将这些细胞归类。他们测试了一个基于普通图像训练的标准模型,一个使用更先进学习方法训练的基于普通图像的大型模型,以及一个专门基于数百万张医学病理切片训练的专业化模型。

结果揭示了一个令人惊讶的转折。当研究人员观察计算机形成的聚类有多整齐时,那个基于自然照片训练的通用模型表现得最好。它创建了紧密且界限清晰的簇,在理论上看起来非常完美。然而,当研究人员检查这些组别是否真正符合真实的细胞生物学类型时,这个相同的模型却完全失败了。它将那些表面看起来相似但实际上属于完全不同生物家族的细胞归为一类。相比之下,专门基于医学切片训练的模型产生的分组虽然显得较为混乱且在几何形态上不够完美,但这些分组与疾病的实际生物学特征契合度更高。专业化模型理解了对医生而言至关重要的细微差别,而通用模型则被表面的相似性所迷惑。

为了探究发生这种情况的核心原因,研究人员开发了一种新的测试方法:他们测量了计算机对每个细胞的不确定程度。在生物学中,有些细胞定义明确且稳定,而另一些细胞则处于过渡状态,即正在从一个阶段向另一个阶段转变。这些过渡细胞本质上是模糊不清的。研究人员发现,医学训练模型表现出的不确定性恰好出现在它应该出现的地方:即观察这些过渡性的、变化的细胞时。它识别出了这些细胞难以界定。然而,通用模型却没有表现出这种模式;它对所有事物都同样自信,未能感知到生物学的复杂性。事实证明,这种不确定性是衡量真实理解力的一个比分组整洁度更可靠的指标。

这项研究还强调了评估这些工具时的一个关键教训。如果研究人员仅观察衡量分组整齐度的标准评分,他们就会选错模型。那个在标准测试中看起来表现最好的模型,实际上是理解生物学最差的模型。此外,研究人员发现,医学模型的表现可能会因实验起始方式的不同而有所变化,但其感知不确定性的能力保持稳定且可靠。这表明,观察一个模型如何应对歧义,是判断其智能水平的一种比仅仅检查其是否将事物分类成整齐堆叠更好的方法。最终,这项研究表明,通过数百万张医学图像训练计算机,会在其观察世界的方式上留下独特的印记,使其能够理解疾病的生物学现实,而这是仅靠通用知识无法实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →