Towards Comprehensive Cellular Characterisation of H&E slides
该论文介绍了 HistoPLUS,这是一种高效且具有泛化能力的深度学习模型,该模型是在一个新颖的泛癌数据集上训练而成的,在检测和分类肿瘤微环境中的多种细胞类型(包括研究较少且稀有的细胞)方面显著优于现有的最先进方法,同时提供了更强的跨领域迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你是一名正在试图破解犯罪案件的侦探,但你的犯罪现场不是一个凌乱的房间,而是一小片人类组织。在医学世界里,医生们使用一种被称为 H&E 的特殊染色剂(可以把它想象成一种高对比度的黑白滤镜)将这些组织切片变成色彩斑斓的地图。在这些地图上,不同的细胞呈现出不同的形状和色调。为了了解患者体内正在发生什么——比如一个肿瘤是在顽强抵抗还是正在放弃——医生需要识别并计数那片微小组织中的每一个细胞。这就像是仅仅通过看一张模糊的照片,就要在庞大且拥挤的蚁穴中寻找特定种类的蚂蚁。
长期以来,计算机在这方面表现得很糟糕。它们擅长发现“看起来像细胞的东西”,但很难区分什么是士兵细胞(免疫细胞)、建筑工人细胞(基质细胞)或是坏蛋细胞(癌细胞),尤其是当细胞挤在一起或看起来非常相似时。现有的计算机程序就像是那些只知道识别最常见蚂蚁的侦探;如果它们看到一种罕见或长相奇特的蚂蚁,就会感到困惑或仅仅是瞎猜。这是一个大问题,因为那些罕见的蚂蚁往往掌握着关于疾病行为演变的最重要线索。科学家们一直试图构建更好的“超级侦探”(AI 模型)来解读这些地图,但由于缺乏带有清晰标签的、涵盖所有不同细胞类型的训练数据(尤其是针对那些罕见细胞的),他们一直停滞不前。
这正是新的一组研究人员介入并带来全新方法的地方。他们构建了一个全新的、超级智能的 AI 模型,名为 HistoPLUS。把 HistoPLUS 想象成这样一位侦探:他不仅通过几本教科书学习,还通过研究一个由来自六种不同癌症类型的 108,722 张个体细胞“快照”组成的庞大且经过精心策划的图书馆进行了多年的学习。与使用通用数据的以往模型不同,这个团队使用了一种聪明的“主动学习”策略。想象一下,一位老师注意到学生很难识别红色的甲虫,于是老师不再展示 100 只蓝色的蝴蝶,而是专门找来 50 只红色的甲虫,直到学生掌握为止。该团队对这种方法应用于罕见细胞类型,确保他们的 AI 能够识别出那些其他模型错过的、难以捉摸且研究不足的细胞。
结果令人印象深刻。当他们在全新的、未见过的组织样本上测试 HistoPLUS 时,它不仅仅是做得好一点,而是彻底碾压了竞争对手。它发现细胞的准确度提高了 5.2%,分类能力比目前的顶尖模型高出了 23.7%,同时它的体积和重量还要小 5 倍(使用的计算机“脑细胞”或参数减少了 5 倍)。这意味着它运行起来更快、更便宜。最令人兴奋的是,HistoPLUS 现在可以识别七种此前计算机难以处理的细胞类型,包括特定的免疫细胞和结构细胞。更有甚者,该模型展示了它能够处理两种在训练期间从未见过的癌症类型,证明它不仅仅是在死记硬背答案,而是在真正学习游戏规则。
研究人员认为,虽然规模宏大、复杂的 AI 模型(该领域的“巨人”)很受欢迎,但它们并不总是最好的解决方案。他们的测试表明,这些巨型模型并没有比 HistoPLUS 表现得好多少,却需要多得多的计算能力。HistoPLUS 证明了你不需要超级计算机也能获得卓越的结果;你只需要正确的训练数据和精巧高效的设计。通过免费发布他们的模型和代码,该团队希望帮助其他科学家解锁隐藏在这些组织地图中的新秘密,从而可能为预测患者对治疗的反应反应提供更好的方法。他们并不是在声称已经解决了癌症,而是为医学界递上了一副更清晰的眼镜,让他们能比以往任何时候都更清晰地观察微观世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。