Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation
本文提出了一个针对乳腺癌中非典型与正常有丝分裂分类的深度学习和视觉基础模型的综合基准,证明了迁移学习和微调技术能有效解决域内及新引入的域外数据集上的分类挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,细胞分裂就像一位面包师揉捏面团,并将其分成两个完美、 identical 的面包。这就是正常的有丝分裂。但有时,面包师笨手笨脚,面团撕裂,或者分出的面包大小不均。这就是非典型有丝分裂。在癌症世界中,发现这些“笨手笨脚的面包师”是一个重要线索,表明肿瘤可能具有侵袭性和危险性。
然而,对于人类病理学家(那些观察显微镜玻片的医生)来说,发现这些“笨手笨脚的面包师”极其困难。它们很罕见,看起来与正常分裂非常相似,甚至专家也常常对所见内容意见不一。这就像试图在一堆不断变色的干草中,找到一根特定且略微弯曲的针。
本文是一场竞赛,旨在看看哪个计算机程序最擅长发现这些“笨手笨脚的面包师”。
参赛者:三种不同策略
研究人员组织了一场竞赛,让三种不同类型的“侦探”(AI 模型)来比拼谁能最好地解决这个难题:
- “从零开始”的侦探(端到端模型):这就像聘请一位聪明的实习生,并用一本特定的教科书从头开始教导他们。他们完全从提供的数据中学习细胞分裂的规则。
- 模型:EfficientNet、Vision Transformer (ViT) 和 Swin Transformer。
- “专家图书管理员”(带线性探测的基础模型):想象一位阅读过数百万本生物学书籍但从未被要求识别“笨手笨脚面包师”的图书管理员。你让他们看一张图片,只需画一条简单的线来回答“是”或“否”。他们利用其广泛的通用知识,但不改变他们的大脑;他们只是在顶部添加一个微小、简单的过滤器。
- 模型:大型预训练模型,如 UNI、Virchow 和 H-Optimus。
- “专业学徒”(带 LoRA 的基础模型):这是同一位图书管理员,但与其只画一条线,你给他们一本小型的专用笔记本(称为LoRA),让他们为这项工作写下具体规则。他们保留其广泛的通用知识,但只需学习足够的新技巧,就能成为识别“笨手笨脚面包师”的专家,而无需重写整个大脑。
试驾:三门不同的课程
为了看看谁真正最优秀,研究人员不仅让他们在所学的同份作业上测试,还给他们安排了三门不同的考试:
- 练习考试(AMi-Br):这是用于训练的主要数据集。它包含数千张人类乳腺癌细胞图像。
- “同城不同区”考试(AtNorM-Br):这使用了来自不同来源(TCGA)的图像。这就像在相同类型的城市测试侦探,但街道标志和照明不同。
- “异国他乡”考试(AtNorM-MD):这是最难的测试。它不仅包括人类乳腺癌,还包括狗的肿瘤和其他人类癌症。这就像将侦探派往一个完全不同的国家,那里有不同的语言和习俗,看看他们是否仍能发现“笨手笨脚的面包师”。
结果:谁赢了?
1. “专业学徒”(LoRA)是明确的赢家。
当基础模型(图书管理员)获得那本小型专用笔记本(LoRA)时,它们表现非常出色。带有 LoRA 的Virchow2模型是冠军,在练习考试中取得了最高准确率。这证明,对庞大的通用 AI 进行微小、特定的调整是一种非常强大的策略。
2. “从零开始”的侦探是强有力的亚军。
从头开始训练的模型(端到端)表现非常好,特别是在“异国他乡”考试中。Swin Transformer在这方面表现最佳,表明有时,专门为这项工作训练的专职团队比通才更能应对新的、奇怪的情况。
3. “专家图书管理员”(线性探测)表现挣扎。
当图书管理员试图在没有专用笔记本(仅使用简单线条)的情况下完成工作时,他们的表现不佳。事实证明,如果没有一些额外的训练,他们广泛的通用知识不足以发现这些特定而微妙的错误。
主要启示
该论文得出结论,虽然识别这些异常细胞分裂是一项艰巨的工作,但AI 可以有效地做到这一点。
最重要的教训是,如何训练 AI 比仅仅拥有一个大型 AI 更重要。
- 仅仅要求一个大型预训练模型进行猜测(线性探测)是不够的。
- 为该大型模型提供一种微小、高效的方式来学习特定任务(LoRA)效果显著。
- 有时,在特定数据上从头开始训练模型仍然是一种非常有竞争力的策略。
研究人员还发布了所有数据和代码,基本上将“考题”和“答案”交给了科学界的其他人,以便每个人都能继续改进这些“侦探”。他们指出,虽然这些模型表现良好,但当“异国他乡”(不同的组织类型或扫描仪)差异过大时,它们仍然会遇到困难,这表明我们仍需要更多样化的数据,以使这些工具适用于各种情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。