JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures
JEPA-DNA 引入了一种与模型无关的持续训练框架,该框架将联合嵌入预测架构(Joint-Embedding Predictive Architectures)与传统的生成式目标相结合,旨在将基因组基础模型从标记级重建转向语义对齐,从而在多种基因组基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,人体就像一座宏大而古老的图书馆。在这座图书馆里,每一条关于构建和运行一个人的指令,都是用仅由 A、C、G 和 T 这四个字母组成的编码写成的。这就是 DNA。长期以来,科学家们一直试图教会计算机阅读这座图书馆,希望如果计算机能理解 DNA 的“语法”,它就能预测我们的身体如何运作、为什么会生病,或者如何修复遗传缺陷。
为了实现这一目标,研究人员使用了被称为“基础模型”(Foundation Models)的技术。把它们想象成超级聪明的学生,已经阅读了数百万本书(DNA 序列),并掌握了这种语言的规则。通常,这些学生通过玩“填空游戏”来学习。如果你遮住句子中的一个单词,学生必须根据周围的词来猜出它是什么。这对于学习句子的局部规则(比如单词如何组合在一起)非常有效。但问题在于:了解语法并不总是意味着你理解了“故事”。一个学生可能知道“猫坐在……”后面通常跟着“垫子上”,但他可能并不理解猫其实是在躲避一只狗,或者整个场景其实是一个更大谜团的一部分。在 DNA 中,这意味着计算机擅长发现微小的模式,但往往会错过不同代码部分如何协同控制生命的宏观图景。
这就是名为 JEPA-DNA 的一项新研究发挥作用的地方。研究人员(来自 NVIDIA 以及以色列和美国的医疗中心团队)决定升级这些阅读 DNA 的“学生”。他们引入了一种新的训练方法,迫使计算机不再仅仅是猜测缺失的字母,而是开始猜测缺失部分的“意义”。与其问“这里应该填什么字母?”,不如问“这段 DNA 这一整块区域的任务是什么?”
该团队在 17 种不同的任务上测试了这种新方法,范围从寻找基因起始位置(启动子)到预测遗传变化如何影响健康。他们尝试将此方法应用于三种不同类型的 DNA 阅读计算机(DNABERT-2、NTv3 和 HyenaDNA),以确保它对所有人(所有模型)都有效。结果令人印象深刻:通过加入这种这种“以意义为中心”的训练,计算机在几乎所有任务上的表现都得到了提升。例如,在一项名为“GUE Promoter”的任务中,新方法的性能提升了超过 11%。在另一项涉及疾病变异的任务中,它识别问题的能力提升了 12% 以上。
论文指出,这种方法之所以奏效,是因为它教会了计算机去观察“森林”而不仅仅是“树木”。虽然旧的方法擅长记忆局部语法(字母的具体顺序),但 JEPA-DNA 帮助模型理解全局功能语境(即那段序列在体内实际起到的作用)。研究人员发现,这种新的学习方式创造了一个生物学的“世界模型”,在这种模型中,计算机理解的是生命的规则,而不只是拼写。他们甚至证明了这种方法比目前现有的最佳模型表现更优,为这些 AI 系统所能达到的成就树立了新的标杆。这就像是将一个擅长拼写的学生,培养成了一位能够同时理解情节、人物和主题的文学评论家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。