← 最新论文
💻 bioinformatics

Phenotype-driven de novo molecular design from gene expression signatures

该论文介绍了 Tx2Mol,这是一个转录组引导的框架,它将基因表达特征转化为在化学上合理且在生物学上相关的从头设计分子,并证明了其在保持大块、单细胞及患者来源疾病背景下的表型响应方面优于现有基准模型。

原作者: Xu, Y., Kuang, T., Ge, S., Wu, H., Wang, M., Xu, H., An, F., Ma, Z., Cheng, Q., Ren, Z.

发布于 2026-07-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu, Y., Kuang, T., Ge, S., Wu, H., Wang, M., Xu, H., An, F., Ma, Z., Cheng, Q., Ren, Z.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你是一位试图发明新菜肴的大厨。通常,你会从一个想要突出的特定食材开始,比如“我需要一种尝起来完全像松露的酱汁”。在医学世界中,这就像是设计一种药物,使其能够锁定人体内的特定蛋白质,就像钥匙契合锁一样。这种“基于靶点”的方法几十年来一直是标准配方。但有时,食谱是不完整的。我们可能并不确切知道是哪个蛋白质导致了疾病,或者疾病本身过于混乱,以至于仅仅修复一个“锁”并不能阻止混乱。在这种情况下,科学家们不再只关注单一食材,而是观察整个厨房的“风味轮廓”。他们观察的是基因表达特征(gene-expression signature),这就像是一份庞大的笔记,描述了一个患病者的每一个细胞是如何在呐喊、低语或尖叫的。它是身体内部状态的一个快照。一个巨大的问题是:我们能否利用这种混乱、嘈杂的细胞呐喊列表,自动“烹饪”出一种全新的药物,让这些噪音平息下来,即使我们甚至不知道这种药物究竟要转动哪把“锁”?

这个问题正是由一项引入名为 Tx2Mol 工具的研究所应对的。你可以把 Tx2Mol 想象成一位超级聪明、由 AI 驱动的副主厨,她不仅看单一食材,还能读懂整个厨房的情绪。与其被告知“为这个锁做一个钥匙”,AI 被给予的是一个转录组——一份关于特定疾病或特定药物处理后基因行为的详细报告。目标是生成一个全新的分子(一个新的化学配方),当它被加入混合物时,能产生与该报告相匹配的生物学反应。研究人员在三个不同的“厨房”中测试了它:批量样本(一锅混合了多种细胞的大锅)、单细胞样本(观察单个、带有噪声的细胞)以及真实患者数据。他们发现,Tx2Mol 能够成功“烹饪”出不仅在化学上合理,而且看起来在特定疾病状态下“味道正确”的新分子,它经常能发现与现有药物不同但依然有效的全新结构。

问题所在:当食谱缺失页面时

长期以来,药物研发就像是在只看正门的情况下建造房子。科学家寻找一个特定的蛋白质(门),然后设计一个分子(钥匙)来打开或关闭它。当我们确切知道那扇门的样子时,这种方法效果很好。但许多疾病,如癌症,更像是整个社区陷入了混乱。问题不仅仅是一个坏掉的门,而是交通、噪音和电网都在同时失灵。有时,我们甚至不知道哪个特定的蛋白质才是主要的罪魁祸首。

在这种情况下,科学家可以测量“基因表达特征”。想象一下,这是一个高科技麦克风,记录着细胞内数千个基因的喋喋不ง。如果一个细胞生病了,基因可能会以特定的模式大喊“着火啦!”或“救命!”。如果一种药物有效,它会改变这种模式,使其变得平静。利用这种“喋喋不ง”作为蓝图是一个想法。如果我们能告诉计算机:“制造一个能将这种‘着火!’模式转变为‘平静’模式的分子,”那么即使我们不需要先知道确切的锁钥机制,我们也可能发现新药。

然而,这里有一个陷阱。这些基因特征是混乱的、巨大的,并且高度依赖于环境(例如,是在肝脏还是肺部)。以往尝试使用这些特征来设计药物的方法,通常将特征视为在最开始的一个一次性提示。这就像是告诉厨师,“做点辣的,”然后就让他在剩下的烹饪过程中不再受任何提醒。当菜肴完成时,厨师可能已经忘记了“辣”的指令,转而做出了某种通用的东西。结果呢?分子在理论上看起来不错,但实际上并不能解决特定的生物学问题。

解决方案:Tx2Mol,那位“低语”的厨师

开发 Tx2Mol 的研究人员旨在解决这个“遗忘”问题。他们想要一个在整个烹饪过程中都能时刻记住生物学目标的系统。

他们使用了两个主要技巧来让 AI 保持专注:

  1. “软前缀”低语(The "Soft-Prefix" Whisper): 与其只在开始时给 AI 一个提示,Tx2Mol 在分子创建的每一步都会附带一个特殊的“低语”。想象一下 AI 正在逐个原子地构建分子,就像堆叠乐高积木一样。通过 Tx2Mol,每当它拿起一个新的积木时,它都会收到来自基因特征的温柔提醒:“记住,我们正在努力平息这种特定的疾病。”这确保了最终的分子与生物学目标深度连接,而不仅仅是一个随机的化学结构。
  2. “媒人”训练(The "Matchmaker" Training): AI 还被训练成为一名媒人。它学习将特定的基因特征与修复这些特征的分子配对,使用的是一种称为“对比对齐(contrastive alignment)”的技术。这就像是教 AI 识别:一个来自病态细胞的特定“尖叫”,总是会被药物发出的特定“舒缓之歌”所回应。这有助于 AI 避免制造出那些真正起不到作用的、平庸且通用的分子。

味觉测试:新出的菜肴管用吗?

团队对 Tx2Mol 进行了三次严格的味觉测试,以观察它是否真的能烹饪出有用的药物。

测试 1:大锅里的混合物(标准癌症靶点)
首先,他们在 10 个不同的癌症相关靶点(如 AKT1、HDAC1 和 TP53)上测试了该 AI。他们向 AI 提供在这些靶点功能异常的细胞中的基因特征,并要求它生成新分子。

  • 结果: Tx2Mol 表现得像一位明星主厨。它生成的分子比他们尝试过的任何其他方法都更接近已知的有效药物。平均而言,它将与已知药物的相似度提高了 24.10%。对于一个特定的靶点 HDAC1,提升幅度达到了惊人的 50.67%
  • 检查: 他们不仅查看了相似性,还检查了这些分子是否真正“真实”(化学有效)以及是否具有新颖性(不仅仅是旧药的复制品)。Tx2Mol 表现出色,创造出的分子既高质量又具新颖性。
  • 对接: 他们使用名为 AutoDock Vina 的计算机程序模拟了将这些新分子放入实际蛋白质“锁”中的过程。在许多情况下,这些新分子的结合能力比已知的旧药物更好,这表明它们实际上能够与靶点结合。

测试 2:单细胞噪声(嘈杂的个体细胞)
接下来,他们转向了一个更难的挑战:单细胞数据。这就像是在一个拥挤、嘈杂的房间里试图听到一声低语。数据要混乱得多。他们使用了三种不同细胞系(A549、K562 和 MCF7)接受各种药物处理后的数据。

  • 结果: 即便面对噪声,Tx2Mol 依然稳住了阵脚。它优于那些未使用“软前缀”低语功能的自身版本,证明了在每一步都保持生物学目标的重要性。
  • 模拟: 为了观察这些新分子是否真的有效,他们使用另一个 AI(chemCPA)来预测如果将这些新分子放入细胞中会发生什么。他们发现,Tx2Mol 生成的分子保留了原始药物的“转录反应”。换句话说,如果原始药物使某些基因上升而另一些基因下降,那么 Tx2Mol 的新分子也会做同样的事情。他们甚至在排名前 50 的基因中,在变化方向(上升或下降)上达到了 98% 的匹配率。这表明新分子不仅仅是随机的形状;它们正在模仿真实药物的生物学效应。

测试 3:真实患者(疾病特征)
最后,他们尝试了终极测试:使用来自 12 种不同疾病(包括阿尔茨海默症、乳腺癌和肝硬化)的真实患者基因特征。他们要求 Tx2Mol 生成能够将患者的基因特征从“患病”转变为“健康”的分子。

  • 结果: AI 成功生成了与这些疾病的获批药物非常相似的分子。对于所有 12 种疾病中的每一种,Tx2Mol 都创造出了至少一个与已知获批药物完全相同的分子(Tanimoto 相似度为 1.00)。
  • 探索: 但它并没有仅仅复制药物。它还创造了一个由独特分子组成的“尾部”,在保持在正确领域的同时,探索了新的化学领域。当他们模拟这些分子如何与乳腺癌靶点结合时,许多分子的得分非常高(低于 -8 kcal/mol),这表明它们可能是现实世界测试中的强力候选者。

这意味着什么

这项研究表明,基因表达特征不仅仅是关于细胞出了什么问题的被动报告;它们可以成为设计新药的积极、可操作的蓝图。Tx2Mol 展示了,通过在设计的每一步都牢记生物学目标,我们可以生成在化学上合理、结构上新颖且具有生物学相关性的新分子。

虽然这是一个以模拟为主的研究,且这些分子尚未在真实的实验室或患者身上进行测试,但结果是令人鼓舞的。它为药物研发开启了一扇新的大门:在这种方式下,我们不需要在开始设计“钥匙”之前就知道确切的“锁”是什么。相反,我们可以倾听细胞的求救信号,让 AI 烹饪出一种能让细胞恢复健康状态的解决方案。正如作者所指出的,下一步是将这些数字食谱投入现实世界进行测试,看看它们是否真的能治愈疾病。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →