想象一下这样一个世界:医生只需观察患者组织的一张标准显微镜载玻片,就能瞬间了解驱动这些细胞的精确分子指令。这就是被称为“空间转录组学”(spatial transcriptomics)的技术所承诺的愿景。几十年来,科学家们一直能够读取细胞的遗传密码,但要在读取的同时,还能追踪这些细胞在肿瘤或大脑等复杂组织中的确切位置,一直是一件极其困难且昂贵的事情。这种被称为空间转录组学的新方法通过将基因活动直接映射到组织的物理结构上解决了这一问题。然而,这项技术由于过于复杂且成本高昂,目前还无法在医院常规使用,也无法用于大规模人群的研究。相比之下,标准病理学中使用的显微镜载玻片价格低廉、速度快,且几乎适用于每一位患者。研究人员面临的一个重大问题是:我们能否教会计算机观察这些普通的载玻片,并准确预测其中隐藏的遗传活动?
一个研究团队开发了一种名为 PaSTel 的新方法来回答这个问题。他们的工作解决了一个先前尝试将组织图像与遗传数据联系起来时存在的特定问题。早期的研究方法通常试图将图像的一个小区域与一组基因进行匹配,但由于它们将每种基因视为同等重要,因此遇到了困难。这意味着计算机经常会被那些在全身各处都活跃以维持细胞生存的普通基因所干扰,而忽略了那些定义特定组织类型或疾病状态的特定基因。此外,这些旧方法孤立地观察每一块微小的组织区域,从而忽略了邻近细胞如何组织成更大结构的宏观图景。研究人员发现,由于忽视了细胞间的空间关系以及基因组的功能角色,以往的模型产生的预测往往模糊且不可靠。
为了解决这个问题,研究人员构建了一个并非仅仅从原始数据中学习,而是从生物学本身中学习的系统。他们设计了一个三步走的过程,旨在教会计算机如何像生物学家一样观察。首先,在载玻片单个位点的层面,该系统学会忽略那些常见的、日常的基因,转而关注那些仅作为该特定位置独特“关键词”的稀有且具有信息量的基因。这类似于图书管理员在搜索特定书籍时,会忽略“的”、“和”等常用词,转而关注那些能区分不同书籍的独特书名和作者。第二,系统会观察协同工作以执行特定功能(如对抗感染或构建组织)的基因组。它利用这些已知的已知功能组作为“锚点”,来理解图像中所呈现的更广泛的生物学故事。最后,系统将相邻的位点进行分组,以理解组织的大型“社区”,从而识别出细胞并非孤立行动,而是属于有组织的共同体。
研究人员使用来自乳腺癌、肾脏组织和大脑样本的数据,将这一新系统与现有方法进行了对比测试。他们发现,该方法始终优于竞争对手。当被要求仅根据图像预测组织样本中哪些基因处于活跃状态时,新模型产生的误差更少,并且比旧模型更准确地捕捉到了复杂的基因活动模式。这在系统学习数据极少的情况下尤为明显,而在现实世界的医学研究中,大型数据集并不总是可获得的。该模型还证明了其在无需预先告知分组情况的情况下,能更好地将组织图像组织成有意义的类别,成功识别出了大脑中的不同层次以及肿瘤内的不同区域。
这项研究表明,通过将人工智能植根于生物学现实——即教会它重视特定基因、理解功能组并尊重组织的空间布局——我们可以创造出功能更强大且更可靠的工具。研究人员证明,这种方法适用于不同类型的组织和疾病状态,使其成为未来医学发现的一种多功能工具。虽然这项技术仍处于研究阶段,但结果指明了一条清晰的前进路径:通过将标准病理学载玻片的视觉细节与对基因如何协同工作的深度理解相结合,我们可能很快就能从医生现有的影像资料中解锁疾病的分子奥秘。
技术摘要:PaSTel
问题陈述
空间转录组学(ST)将组织形态学与分子程序相结合,但其高昂的成本和技术复杂性限制了其在临床和大规模队列设置中的可扩展性。虽然病理切片通常能捕捉到与底层基因表达相关的形态模式,但现有的视觉-组学模型面临两个关键局限:
- 基因选择并非最优: 现有的对齐策略通常依赖于高表达基因(受普遍存在的管家基因信号主导)、高变异基因(捕捉全局而非空间方差)或空间变异基因(强调平滑模式而忽略稀疏的局部标记)。这导致了判别力较弱的表示形式以及较差的局部斑点(spot)级区分度。
- 忽视空间依赖性: 现有的方法通常独立地对齐“斑点-图像块”(spot–patch)对,未能捕捉到对于建模组织结构和中观尺度(meso-scale)结构至关重要的空间依赖性和区域专业化特征。
方法论:PaSTel 框架
作者提出了 PaSTel,一个分层多模态预训练框架,通过在三个不同层面整合生物学先验知识来将组织学图像与基因表达进行对齐。该框架利用 Vision Transformer (Vi-T B/16) 进行图像编码,并使用基于 OpenCLIP 的 Transformer 类文本编码器,其中每个基因被视为一个独立的 token。
1. 斑点级(Spot-Level):基于 TF-IDF 的关键词基因选择
为了构建用于对齐的信息丰富的“基因句子”,PaSTel 使用 TF-IDF 重加权方案 取代了标准的顶端表达量选择。
- 机制: 该方法根据基因在单个斑点内的相对丰度计算词频(TF),并根据基因在所有斑点中的稀有程度计算逆文档频率(IDF)。
- 目标: 这抑制了普遍存在的管家基因,同时强调了具有空间信息量的“关键词”,从而产生稀疏且具有判别力的表示,用于精细的对齐。
2. 功能级(Functional Level):通路级软锚定
为了建模更高层级的函数结构,PaSTel 引入了精选的 KEKG 通路 作为生物学锚点。
- 机制: 对于每个斑点,计算其基因集与通路基因集之间的归一化重叠得分 (ω)。该得分作为一个软监督信号。
- 对齐: 通路原型嵌入(通路基因嵌入的平均池化)通过重叠加权的对比学习与视觉嵌入进行软对齐。这向局部表达模式注入了全局功能语义。
3. 区域级(Regional Level):空间感知聚合
为了捕捉长程空间依赖性,PaSTel 将相邻斑点聚合成连贯的中观尺度区域。
- 机制: 使用结合了空间邻近性(欧几里得距离)和特征相似性(拼接的图像与基因嵌入)的混合距离度量来构建 k-最近邻图。
- 聚类: 应用 Leiden 聚类来分配区域标识符。这些分配在训练期间定期更新,使模型能够逐步优化区域级监督并建模中观尺度的组织结构。
4. 多级对比目标
该框架联合优化一个复合损失函数:
L=λ1Ls+λ2Lp+λ3Lr
- Ls: 用于斑点-图像块对齐的对称 InfoNCE 损失。
- Lp: 基于 KL 散度的目标函数,用于匹配预测相似度与软通路目标。
- Lr: 用于对齐区域原型(聚类内平均嵌入)的对称 InfoNCE 损失。
核心贡献
- 生物学启发式对齐: 一个结合了基于 TF-IDF 的基因选择与通路级监督的框架,提高了斑点表示的特异性和可解释性。
- 区域感知的分层预训练: 一种捕捉中观尺度空间结构的策略,实现了超越独立斑点-图像块对的多尺度组织建模。
- PaSTel 编码器: 一个预训练的视觉-组学编码器,在多种空间转录组任务中展现出强大且一致的性能。
实验结果
模型在 HEST-1K 数据集上进行了评估,并对特定队列(乳腺癌、HER2、DLPFC、肾脏)进行了留出测试以进行下游评估。
- 基因表达预测: PaSTel 一致地优于现有的基于回归的方法(如 ST-Net、HisToGene)和基于检索的方法(如 OmiCLIP、BLEEP)。值得注意的是,在肾脏队列中,PaSTel 达到了 0.2627 的皮尔逊相关系数 (PCC),超过了 OmiCLIP (0.2275)。
- 少样本学习: 在低资源场景(10%–50% 训练数据)下,PaSTel 表现出最大的增益,特别是在 10% 比例下,表明其在有限监督下的卓越泛化能力。
- 零样本空间聚类: 在无需微调或访问基因表达的情况下,PaSTel 在 DLPFC 和 HER2 数据集的层状结构和肿瘤区域聚类方面取得了最佳性能,超越了 CONCH 和 UNI 等基础模型。
- 生物标志物预测: 对于临床相关的基因 IGLL5,PaSTel 准确地恢复了精细的空间表达模式,具有较高的 PCC,而竞争方法仅表现出微弱或负相关的关系。
- 图像-转录组检索: PaSTel 显著提升了检索性能(乳腺癌的 Recall@5% 从 15.63% 提高到 19.88%),这归功于其处理更长基因句子(高达 250 个 token)的能力以及其原子化的基因词汇表,避免了标准子词分词带来的碎片化问题。
意义
论文声称,结合多尺度生物学先验可以产生更具信息量且更具迁移性的空间转录组表示。通过统一局部分子身份、全局功能程序和空间组织结构,PaSTel 解决了当前视觉-组学模型的局限性。结果表明,分层生物学先验对于学习鲁棒的表示至关重要,特别是在数据匮乏和形态学本身不足以解释的异质组织环境中。消融研究证实,每个组件(TF-IDF 选择、通路锚定和区域聚合)都对最终性能做出了实质性贡献。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。