BioM-JEPA: joint-embedding prediction of graph-connected gene blocks in single cells
BioM-JEPA 是一种自监督模型,它通过预测图连接基因块(graph-connected gene blocks)而非单个基因的聚合表示,改进了单细胞表示学习,从而实现了比 scFoundation 等现有方法具有更高有效秩、更优越的扰动响应准确性以及显著更快训练吞吐量的嵌入。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一座宏大而混乱的图书馆,其中的每一本书都是用一种你仅略知一二的语言编写的。在生物学世界中,这座图书馆就是单个细胞,而“单词”就是基因。科学家们使用单细胞 RNA 测序技术来阅读这些细胞,但这就像是在有人不断从你手中抢走书页时试图读书一样。有时你读到的是关于“心脏”的一页,有时是“肝脏”,有时只是随机的一张纸片。因为这种阅读是不完整且混乱的,两个实际上是双胞胎的细胞可能会看起来完全不同,仅仅是因为扫描仪错过了不同的单词。
为了理解这一切,科学家们一直在构建“AI 图书管理员”(模型)来学习生命的隐藏模式。传统的 AI 模型试图通过逐个猜测缺失的单词来学习,就像玩“填词游戏”(Mad Libs)一样。但仅仅因为 AI 擅长猜测单个缺失的单词,并不意味着它理解了整个故事。这篇论文提出了一个大问题:是否存在一种更好的方法,能教 AI 理解细胞的“故事”,而不仅仅是背诵单个的“单词”?答案在于观察那些自然聚集在一起的单词组,而不是孤立地猜测它们。
新策略:猜测群体,而非单词
开发这项研究的科研人员(由 Yuhao Wang 和 Zelin Zang 领导)构建了一个新的 AI 模型,名为 BioM-JEPA。把训练这些旧模型的方式想象成尝试预测句子中被擦除的一个特定单词。如果句子是“猫坐在___上”,AI 猜的是“垫子”。如果它猜对了,它就得一分。但在生物学中,猜对“垫子”可能并不能让你了解整个场景。
BioM-JEPA 改变了游戏规则。它不再猜测单个单词,而是猜测一整块属于彼此的单词。想象一下,这个句子实际上是一张城市地图。与其问“这条街的名字是什么?”,不如问“这是一个什么样的社区?”为了实现这一点,该模型使用了一种特殊的“友谊图谱”(基因图谱),展示了哪些基因是最好的朋友。这些朋友之所以被联系在一起,是因为它们经常在细胞中共同工作,要么是因为它们在物理上接触(蛋白质关联),要么是因为它们通常出现在同一个人群中(共表达)。
当 AI 查看一个细胞时,它会隐藏一整个“好朋友”基因组成的社区。然后,它观察城市的其余部分(它能看到的其他基因),并尝试预测这个隐藏的社区整体看起来是什么样的。它并不试图猜出每一个街道的名字;它猜的是这个社区的“氛围”。
为什么猜测群体更好
论文表明,这种“社区猜测”策略比旧的“单词猜测”方法效果要好得多。当研究人员测试他们的模型时,他们发现 AI 学到了更丰富、更有用的理解。
以下是他们的发现:
- 它看到了大局: 那些猜测单个单词的旧模型往往会陷入僵局。它们可以猜出单词,但它们构建的细胞“地图”是扁平且乏味的。然而,BioM-JEPA 构建了一张具有高“有效秩”(effective rank)的地图,这是一种高级说法,意味着这张地图拥有许多不同的维度,并且可以捕捉复杂的现实世界细节。
- 它忽略了噪声: 在单细胞实验中,你能发现多少基因取决于扫描仪看了多“深”。如果扫描仪很浅,你看到的基因就少。旧模型会被这所迷惑;如果你看到的基因少了,它们的理解就会发生变化。BioM-JEPA 则要顽固得多。它学会了忽略扫描深度,转而关注真实的生物学。
- 它速度极快: 该模型使用了一个巧妙的技巧,称为“线性注意力机制”(linear attention)。想象一下要在人群中寻找一个朋友。旧的方法是向人群中的每一个人介绍你自己,以看看谁认识你的朋友(这需要很长时间)。BioM-JEPA 使用了一个捷径:它先总结人群,然后问:“谁是我的朋友?”这使得该模型的学习速度比著名的竞争对手 scFoundation 快了 5.75 倍,使用所学知识的速度快了 3.76 倍。
它真的理解生物学吗?
最令人兴奋的部分是,这个模型不仅变得更快,它还无需被告知,就学习到了真实的生物学真相。研究人员通过以下几种方式对其进行了测试:
- 细胞身份: 当他们观察哪些基因对于模型识别细胞类型最为重要时,它挑选出了正确的“著名”基因。例如,在胰腺细胞中,它知道 INS 代表“β 细胞”,GCG 代表“α 细胞”,就像人类生物学家一样。
- 预测变化: 他们测试了当细胞受到“扰动”(例如加入药物或关闭某个基因)时会发生什么。BioM-JEPA 在预测细胞如何反应方面表现最好,即使是面对复杂的组合变化也是如此。
- 隐藏的关系: 该模型发现了某些基因对是如何协同工作的,尽管从未被告知它们是一个团队。例如,它意识到两个涉及细胞分化的特定基因是相互关联的,这与科学家们通过多年实验室工作所了解的情况相吻合。
总结
这篇论文表明,要教 AI 关于生物学的知识,我们不应仅仅将基因视为需要背诵的孤立单词。相反,我们应该将它们视为一个相互连接的社区的一部分。通过教 AI 预测一组连接在一起的基因的“氛围”,我们得到了一个更快、更准确、且能更好地理解活生生的细胞之复杂真实故事的模型。这是一种从背诵词典到理解故事情节的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。