Additive-input encoding fails operator-level target-held-out prediction on current Perturb-seq screens
本研究表明,当前 Perturb-seq 筛选中使用的加性输入编码模型无法泛化至新的、留出的扰动目标,这揭示了尽管推断出的调控算符在数学上具有可辨识性,但其并未被验证能够预测对未见基因的响应。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一个科学家可以同时关闭细胞中单个基因并观察其反应的世界。这就是被称为 Perturb-seq 的技术所承诺的前景。通过使用一种分子工具来沉默特定基因,然后读取细胞的整个遗传反应,研究人员希望构建一张关于基因如何相互交流的图谱。最终目标是理解生命的隐藏规则:如果你拉动一根线,哪些其他的线会变紧,而哪些会变松?多年来,解释这些大规模实验的标准方法是假设细胞的反应是各部分之和的简单叠加。其观点是,如果你关闭基因 A,它会增加特定量的变化;如果你关闭基因 B,它会增加另一个特定量的变化。如果你两者都关闭,结果应该只是这两个变化的加总。这种“加性”(additive)观点之所以具有吸引力,是因为它在数学上非常简洁且易于计算,使科学家能够推导出细胞内部布线的总控制图。
然而,来自杨百翰大学(Braggam Young University)研究人员的一项新研究表明,当将这种简单的加法规则应用于真实的生物数据时,它在根本上可能是失效的。由 Kyler Fullmer、Dalton Kutzen 和 Tommy W. Terooatea 领导的团队,采用了三项规模最大且最受认可的基因沉默实验,测试了加性模型是否真的能预测研究人员从未见过的基因的变化情况。他们不仅仅是在观察数据,而是建立了一个严密的测试场,以观察该模型是否具有泛化能力。他们提出了一个直截了当的问题:如果计算机从一组已知的基因中学习游戏规则,它能否正确预测一个从未遇到过的新基因的结果?
他们发现答案是否定的。当研究人员尝试使用加性模型来预测未知基因的行为时,该模型完全失败了。事实上,该模型的表现并不比一个仅仅猜测“没有任何变化”的人好多少。为了确保这种失败并非偶然或由于数据混乱,团队创建了一个完美的模拟环境。他们生成了规则被设定为完美加性的虚假数据,正如理论所声称的那样。当他们在这些虚假数据上运行模型时,它运作得非常出色,高精度地恢复了隐藏的规则。这证明了他们的测试方法是可靠的,也证明了计算机具备学习能力。因此,问题不在于数学或数据的噪声,而在于“细胞表现得像简单加总”这一假设本身。
研究人员在三个不同的数据集上测试了这一点:两个涉及在培养皿中生长的真人细胞的大规模筛选实验,以及一个测试不同基因沉默剂量的实验。在每一种情况下,那个假设基因只是简单叠加其效应的模型,都无法预测新基因的结果。误差率如此之高,以至于该模型的预测与随机猜测无异。团队排除了导致这种失败的几种可能原因。他们检查了问题是否由选择了“最容易”研究的基因引起,发现即使他们随机选择基因,模型仍然失败。他们检查了问题是否源于研究基因的数量或基因测量的特定方式,发现无论这些因素如何,失败依然存在。即使他们剥离了关于基因沉默强度的细节,仅观察变化的趋势方向,模型仍然无法预测结果。
有一个小小的例外提供了一丝希望,但这种希望很微弱。在一种特定的细胞集上,该模型预测新基因结果的能力略好于仅仅猜测平均值。然而,即使在这种情况下的最佳表现中,该模型也仅恢复了完美、表现良好的系统所能提供的约 7% 的信息。这在失败的海洋中只是一个微小的胜利。研究人员还测试了更复杂的编码基因信息的方法,包括观察基因在自然状态下如何连接的方法,以及利用机器学习从数据中学习基因“指纹”的方法。这些先进的方法都无法克服根本性的问题。它们在两种细胞类型上都无法预测新基因,而在第三种细胞类型上,虽然取得了一点改进,但也远未达到理论所承诺的高度。
这项研究得出结论,目前解释这些大规模基因沉默筛选的方法很可能是错误的。认为基因是独立开关并简单叠加其效应的假设,在面对未见目标进行测试时并不成立。研究人员提出了两种主要可能性,解释为何会出现这种情况。首先,他们将基因身份转化为数学输入的方式可能丢弃了大部分重要信息,就像试图仅通过一张模糊的照片来描述复杂的景观。其次,生物学现实可能是基因并不以简单的线性方式运作;相反,它们的效应可能会达到饱和或触及阈值,这意味着关闭一个基因并不会产生稳定、可预测的变化。
这项工作并不意味着基因沉默筛选是毫无用处的,但它确实意味着我们目前从这些实验中构建的图谱,在预测针对新基因进行干预时的反应方面,可能并不可靠。研究人员发布了一个新的工具包,旨在帮助其他科学家根据这些严格的标准来检查他们自己的模型,从而确保未来的发现建立在坚实的基础之上。教训是明确的:生物学往往比我们最简单的方程所允许的更加复杂,在我们找到捕捉这种复杂性的方法之前,对于细胞如何对新干预做出反应的预测,仍将是不确定的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。