Generative Artificial Intelligence in Bioinformatics: A Systematic Review of Models, Applications, and Methodological Advances
本系统综述评估了生成式人工智能对生物信息学的变革性影响,强调了其在基因组学和药物研发等专业应用中的卓越表现,同时指出了数据偏差和可扩展性等关键挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人体就像一座宏大而繁忙的图书馆。里面有数十亿本书,是用一种奇特的代码编写的。有些书是长长的 DNA 卷轴(构建你的说明书),有些是蛋白质食谱(执行实际工作的工人),还有一些是 RNA 便条(传递指令的信使)。几十年来,科学家们试图用僵化的、基于规则的字典来阅读这些书。他们可以找到这里的某个单词或那里的某种模式,但很难理解整个故事,尤其是当这些书显得杂乱无章、残缺不全,或者是由一种无人知晓的语言编写时。
这就是生成式人工智能(GenAI)登场的时候了。请不要把 GenAI 仅仅看作一本字典,而要把它看作一位超级聪明、富有创造力的讲故事的人,他读遍了图书馆里的每一本书,并掌握了这种语言的节奏、语法和风格。GenAI 不仅仅是查找一个单词,它还能预测接下来的内容,编写听起来与原作者完全一致的新章节,甚至构思出完全符合图书馆规则的全新故事。本文探讨了这位新的“讲故事的人”如何正在改变生物信息学——即解码生命图书馆这门学科的游戏规则。它提出了疑问:这种 AI 真的能编写新的蛋白质吗?它能比旧方法更好地理解细胞中复杂的各种故事吗?最重要的是,它准备好帮助我们治愈疾病了吗,还是说它只是一个偶尔会编造事实的高级模仿者?
伟大的生物讲故事者:人工智能在生命科学领域的综述
这是一篇大规模的“系统性综述”,用一种时髦的话说,就是作者们进行了一场穿越数千项科学研究的“寻宝之旅”,以观察生成式 AI 究竟是如何被用于解码生命的。他们不仅仅是看了这一两个酷炫的实验;他们收集了 2021 年至 2026 年间的 82 项高质量研究,以获取全貌。他们的目标是回答关于这些 AI 模型如何运作、它们的优势在哪里以及它们可能在何处出错的六个重大问题。
新的超能力:GenAI 究竟能做什么?
作者发现,GenAI 正在做一些过去不可能完成或需要人类花费数年才能弄清楚的事情。
1. 阅读 DNA 剧本(基因组学)
想象一下,试图在一本单词之间没有空格的书中寻找特定的指令。这就是 DNA 在计算机眼中的样子。旧的方法就像是用放大镜去找一个单词。然而,GenAI 将整个 DNA 序列视为一个句子。像 DNABERT 这样的模型已经如此精通地阅读这种“语言”,以至于它们可以预测基因在哪里开始和结束,或者一个基因可能会如何表现,其准确率极高(在某些测试中达到 91.8% 至 91.9%)。这就像是 AI 学会了生命的语法,现在甚至能在 DNA 句子写出来之前就猜出下一个词。
2. 设计新蛋白质(蛋白质组学)
蛋白质是运行你身体的微型机器。通常,科学家必须等待自然界发明一种新的蛋白质,或者尝试对现有的进行微调。GenAI 通过扮演创意建筑师的角色改变了这一点。像 ProGen 和 ProtGPT2 这样的模型可以从头开始设计全新的蛋白质序列。在一个著名的实验中,一种 AI 设计了一种新的酶(一种加速化学反应的蛋白质),其效果竟然与天然酶一样出色。这就像是 AI 不仅仅是复制了一份蓝图,它还画出了一座与人类建造的房屋一样坚固且功能完备的新房子。
3. 理解细胞的邻里关系(单细胞分析)
你的身体拥有数万亿个细胞,而且它们各不相同。旧工具观察的是整个群体并给出一个平均答案。GenAI 模型如 scGPT 可以观察单个细胞并理解它们独特的“个性”。它们可以预测一个细胞会对药物做出何种反应,或者随着你生病,它会如何变化。这就像是拥有一个翻译员,能够从嘈رح的体育场中听到单个细胞的低语,并准确理解它在说什么。
4. 寻找新药(药物研发)
寻找一种新药就像是在寻找一把能打开锁的特定钥匙,但你却不知道锁长什么样。GenAI 通过生成数百万个潜在的“钥匙”(分子)并进行虚拟测试来提供帮助。像 DrugAssist 这样的工具让科学家可以与 AI 对话,例如说:“为我设计一个能很好溶解在水中并能穿过大脑屏障的分子。”随后 AI 就会进行设计。虽然这些设计很有前景,但论文指出,大多数仍只是数字草图;它们需要在现实世界的实验室中进行测试,以证明它们在人体内确实有效。
核心秘诀:专业化 AI vs 通用型 AI
该论文最大的发现之一是,在生物学领域,专业化 AI 比通用型 AI 更出色。
把通用 AI(比如你在网上聊天的那些)想象成一个读遍了图书馆所有书籍但从未在实验室工作过的优秀学生。他们知道很多事实,但可能会被生物学的专业术语搞糊涂。
相比之下,专业化模型(如用于蛋白质的 ESM-2 或用于 DNA 的 DNABERT)就像是那些一辈子都在实验室度过的学生。它们是专门针对生物数据进行训练的。论文表明,这些专业化模型始终优于通用模型。例如,在预测蛋白质中的突变如何改变其功能时,专业化模型的正确率要高得多。作者认为,虽然通用 AI 在总结文本或编写代码方面很棒,但你需要一个经过“生物学家训练”的 AI 才能真正理解生命那复杂且混乱的语言。
瑕疵:AI 碰壁的地方
尽管令人兴奋,但论文非常谨慎,并未称其为一个“已解决的问题”。作者指出了科学家仍需解决的几个严重局限性:
- “幻觉”问题: 就像创意作家可能会编造一个听起来很真实的假事实一样,GenAI 有时会生成一个在计算机上看起来完美,但在现实生活中无法折叠成有效形状的蛋白质序列。论文警告说,在这些数字产物经过“湿实验室”(即带有试管和细胞的真实实验室)测试之前,我们不能信任它们。
- 数据偏差: AI 是从已经写就的书籍中学习的。但这些书大多是关于人类和老鼠等常见生物的。AI 在理解稀有动物或罕见疾病方面表现很差,因为它读到的相关资料不够。这就像是一个只为数学考试复习了,却忘了看生物章节的学生。
- 大脑的成本: 训练这些庞大的 AI 模型需要消耗大量电力的高性能计算机。论文指出,这既昂贵又会产生大量的碳排放,使得小型实验室难以使用这些工具。
- “黑箱”之谜: 有时 AI 给出了正确的答案,但没人知道 为什么。在医学领域,知道“为什么”与知道答案本身同样重要。如果 AI 说某种药物有效,医生需要理解其推理过程才能予以信任。目前,许多此类模型都是“黑箱”,其内部逻辑是隐藏的。
未来:建立更好的团队
那么,我们该走向何方?作者建议,未来不在于构建一个巨大的、完美的 AI。相反,他们提议采用一种模块化方法。想象一个团队,其中一个通用 AI 担任经理,接收你的问题并向专业的工具委派任务。如果你问:“这个基因如何影响心脏?”,经理 AI 可以询问蛋白质模型以获取结构,询问药物模型以获取相互作用,并询问文献模型以获取以往的研究,然后将答案汇总给你。
他们还强调了效率的重要性。我们需要构建更聪明、更小巧的模型,使其不需要超级计算机也能运行,从而让更多科学家能够使用它们。最后,他们强调了现实世界验证的必要性。论文总结道,虽然生成式 AI 是一个强大的构思和设计工具,但它尚未成为科学方法的替代品。AI 可以编写故事,但我们仍然需要检查这个故事在现实世界中是否真实。
简而言之,生成式 AI 是生物学家工具箱中一个革命性的新工具。它可以比以往任何时候都更快地编写新蛋白质、解码复杂基因并设计药物。但像任何强大的工具一样,它需要被谨慎使用、不断检查,并由人类专家引导,以确保它讲述的故事不仅具有创造力,而且是真实的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。