Genome-scale molecular profiling from routine histopathology with a multimodal pathology foundation model
该论文介绍了 Fuji,这是一个基于超过 60,000 张与基因组数据配对的全视野切片图像训练的多模态病理基础模型,它能够直接从常规组织学中推断出基因组规模的分子状态、突变过程和临床结局,从而弥合了组织形态学与底层分子机制之间的鸿沟。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正从一座高塔俯瞰一座城市。从这个高度,你可以看到街道的形状、建筑物的密度,以及社区是如何组织的。仅凭布局,你就能分辨出繁华的市中心还是安静的郊区。现在,想象这座城市里的每一栋建筑实际上都是一个活生生的细胞,而街道则是人体组织。一个多世纪以来,医生们一直攀登着这座高塔,利用显微镜观察这些“城市”(组织),以诊断癌症等疾病。他们称之为组织病理学。这就像是在阅读一张城市的地图,以了解内部正在发生什么。
但转折在于:城市的布局并非随机生成的。它是根据每一栋建筑内部“蓝图”的无形规则建造的——即 DNA。当 DNA 受损或发生突变时,它会改变建筑的建造方式、它们相互交流的方式以及社区的发展方式。长期以来,科学家们认为必须进入每一栋建筑内部去阅读那些蓝图(使用昂贵的 DNA 测序)才能了解出了什么问题。但如果城市的形状本身就能告诉你关于蓝图的一切呢?如果通过观察地图,你就能准确知道哪些基因出了问题,而无需踏入任何一栋建筑呢?这就是这篇论文所探讨的核心问题:肿瘤的视觉“形状”能否揭示其遗传秘密?
论文:《Fuji》——连接形状与代码的翻译官
在这项研究中,一个研究团队介绍了一种他们称为 Fuji 的新型人工智能模型。请不要仅仅把 Fuji 看作是一个图像识别器,而要把它看作是一个超级聪明的翻译官,它学会了同时使用两种语言:图像的语言(肿瘤在显微镜下看起来是什么样的)和代码的语言(细胞内的 DNA 突变和 RNA 信息)。
通常,训练用于医学图像的 AI 模型就像是只学习识别地标的游客。它们可以辨认出“这看起来像肺”或“这看起来像肿瘤”,但它们并不理解肿瘤为什么呈现这种形态。它们将图片仅仅视为一张漂亮的图像。Fuji 则不同。研究人员教会了它观察图像并立即追问:“什么样的遗传代码导致了这种特定的形状?”
为了实现这一点,他们不仅向 Fuji 展示了图片,还为它喂养了一个庞大的库:60,546 幅全切片图像(高分辨率的组织样本数字照片),并将每一张图像都与其对应的遗传数据配对:45,675 份 RNA 图谱(告诉我们哪些基因正在活跃)和 22,683 份全基因组序列(完整的 DNA 代码)。这就像是给 AI 一百万本教科书,每一页的左侧都有一张城市的照片,而右侧则是该城市建造的精确蓝图。
Fuji 如何“看见”基因
研究人员使用了一种巧妙的两步训练法,就像一位大师教徒弟一样。
- 第一步(味觉测试): 首先,他们教 Fuji 识别组织的“基本风味”。他们使用了另外两个强大的 AI 模型(GigaPath 和 CHIEF)作为“老师”。Fuji 学习观察组织并匹配视觉模式,即使这些组织是以两种不同的方式制备的:一些是用化学物质保存的(FFPE,医院的标准做法),另一些是冷冻新鲜的(fresh-frozen,用于研究)。Fuji 学会了忽略组织保存方式带来的差异,转而专注于细胞的真实形状。这至关重要,因为这意味着 Fuji 可以处理医生日常使用的载玻片。
- 第二步(深度探索): 接下来,他们挑战 Fuji 去将形状与代码联系起来。他们同时给了它三个任务:
- 重建图像: 如果隐藏图像的一部分,Fuji 能猜出它原本的样子吗?这让它保持对细节的敏锐观察。
- 重建 RNA: Fuji 能通过观察形状来猜测 RNA 信息在说什么吗?这建立了视觉与分子活动之间的联系。
- 解码突变: Fuji 能通过观察形状来猜出存在哪些特定的遗传“笔误”(突变)吗?这是最神奇的魔术。
Fuji 有何发现
经过训练后,Fuji 证明了肿瘤的“形状”确实是其遗传代码的直接反映。研究人员发现,Fuji 能够以惊人的准确度预测复杂的遗传状态,其表现往往优于以往所有的 AI 模型。
- “不稳定性”侦探: 团队测试了 Fuji 是否能发现肿瘤 DNA 崩溃的情况。他们寻找了四种特定类型的遗传混乱:微卫星不稳定 (MSI)、染色体不稳定性 (CIN)、同源重组缺陷 (HRD) 和 全基因组倍增 (WGD)。Fuji 在这些方面的准确度(AUC)高达 0.98。换句话说,如果人类专家有 80% 的把握,Fuji 则有 98% 的把握。它仅凭观察组织切片,就能分辨出基因组是稳定的还是混乱的。
- “额外的” DNA: 最令人兴奋的发现之一是关于染色体外 DNA (ecDNA) 的。这是一种奇特的、在正常染色体之外漂浮的圆形 DNA,它会让癌症生长得极快。通常,你需要昂贵且复杂的检测才能找到它。然而,Fuji 却学会了识别 ecDNA 在组织结构上留下的独特“足迹”。在低级别胶质瘤和子宫内膜癌患者中,由 Fuji 从切片中预测出的这些“隐形 DNA 圆圈”的存在,是患者预后较差的一个强烈信号。
- “吸烟”与“修复”特征: 研究人员还询问:Fuji 能否分辨出肿瘤是由吸烟引起的,还是由 DNA 修复系统故障引起的?他们发现,烟草相关的突变和 错配修复缺陷会在组织架构上留下独特的、局部的痕迹。这就像吸烟在城市墙壁上留下了一种特定的烟灰,而 Fuji 可以精准地指出烟灰所在的位置。这些模式非常清晰,以至于 Fuji 能在完全不同的患者群体中发现它们,证明了这种模式是真实的,而非偶然。
- 预测未来: Fuji 不仅观察过去,它还观察未来。该模型可以预测肿瘤突变负荷 (TMB)(肿瘤有多少突变)和新抗原负荷(肿瘤对免疫系统的可见程度)。更重要的是,在小规模的肺癌患者群体中,Fuji 对谁会对免疫治疗产生反应的预测优于其他模型。这表明,肿瘤的形状包含了关于免疫系统能否与之抗争的线索。
为什么这很重要
Fuji 最重要的特点在于它可以在医生现有的载玻片上运行。世界上大多数癌症患者使用的是标准的(FFPE)载玻片,这种载玻片是通过化学方法保存的。以前的 AI 模型很难将这些标准载玻片与遗传数据联系起来,因为遗传数据通常来自新鲜冷冻样本。Fuji 通过学习忽略载玻片的“化学气味”,转而专注于“城市布局”,解决了这个问题。
作者指出,这可能会改变癌症的治疗方式。医生可能不再需要等待数天或数周来进行昂贵的遗传检测,而是可以利用 Fuji 在几分钟内通过常规显微镜切片获得一份“基因组报告”。它可以帮助决定哪些患者需要靶向药物,哪些人可能对免疫治疗有反应,以及哪些人的风险更高,而无需先进行 DNA 测序。
当然,论文谨慎地指出,这是一个“概念验证”。虽然结果强大且在不同数据集间保持一致,但关于免疫治疗的预测是基于一小组患者,需要在更大规模的现实临床试验中进行测试,才能让医生真正依赖它们。但核心理念——即肿瘤的视觉形状是其遗传代码的可读地图——似乎是一个坚实的发现。Fuji 已经向我们展示了,只要观察得足够仔细,你就能读懂城市的蓝图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。