Context-dependent correlations mislead transcriptomic network inference in bulk and single-cell data
本研究表明,在体量转录组和单细胞转录组数据中,由于生物异质性导致的辛普森悖论,合并后的相关系数经常会通过反转方向来误导网络推断,因此有必要报告特定背景的相关性和异质性统计数据,而非依赖单一的全局估计值。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图通过观察两个人同时微笑的频率,来弄清楚他们是如何关联在一起的。如果他们同时微笑,你可能会猜他们是朋友。这基本上就是科学家研究基因的方式:他们观察成千上万个样本中,两个基因同时“微笑”(开启或关闭)的频率,以此来判断它们是否有关联。
这篇论文指出,科学家长期以来使用的方法就像是通过一个模糊的广角镜头在看人群,把每个人都混在了一起。其结果往往是一个具有误导性的画面。
以下是该研究发现的详细拆解,使用了简单的类比:
“混合奶昔”问题
科学家经常从许多不同的组别中获取数据——比如不同类型的癌症、不同的组织或不同的细胞类型——并将它们全部混合成一个巨大的“奶昔”,以计算出一个单一的平均关系。他们假设这个平均值就能说明整个故事。
论文指出,这样做是危险的,因为这涉及到一个被称为**辛普森悖论(Simpson's Paradox)**的陷阱。想象一下你有两组人:
- A组(高个子): 当他们长得更高时,他们变得更快乐。
- B组(矮个子): 当他们长得更高时,他们变得更悲伤。
如果你把 A 组和 B 组混合在一起,仅仅观察平均值,你可能会看到“越高的人通常越悲伤”,因为 B 组的人数可能更多,或者因为 A 组的平均身高远高于 B 组。你会得出结论说,身高会导致悲伤,从而完全忽略了对于每个特定群体而言,这种关系实际上是相反或不同的。
研究人员的发现
该团队利用来自数千个肿瘤、健康组织和单细胞的真实数据,在大规模范围内测试了这个想法。以下是他们的发现:
- “翻转”效应: 在他们观察的近 95% 的基因对中,基因的行为取决于所属的组别。在某些组中,它们同步移动(正相关);而在另一些组中,它们则向相反方向移动(负相关)。
- 平均值会撒谎: 当他们把所有数据混合在一起时,大约有 13% 的时间,那个“平均”关系呈现出与特定组别内实际情况相反的符号。这就像仅仅因为混合了两个不同的群体,就得出“微笑会导致悲伤”的结论。
- 它无处不在: 这并非罕见的故障。它发生在:
- 癌症数据中: 几乎每一对基因在不同癌症类型中都表现出不同的行为。
- 健康组织数据中: 即使在健康的身体里,混合不同的器官(如肝脏与大脑)也会导致结果翻转。
- 单细胞中: 即使在观察单个细胞时,混合不同的细胞类型(如 T 细胞与 B 细胞)也会产生虚假的关联。
- “经过验证”的目标: 科学家们有一份已知是真实目标(如钥匙与锁)的基因对清单。论文发现,当你混合所有数据时,99.1% 的这些已知关系看起来并不一致。只有当你观察它们所属的具体语境时,它们才会看起来是一致的。
解决方案:不要把苹果和橘子混在一起
论文建议,我们不应该制作一个巨大的奶昔,而是需要分别品尝每种水果的味道。
- 语境至关重要: 如果我们将数据拆分为更小、更具体的组别(例如,将“高个子”和“矮个子”分开,或者将“乳腺癌 A 型”与“乳腺癌 B 型”分开),那些误导性的翻转就会消失。
- 例如,当他们观察乳腺癌患者并按特定的分子亚型进行分类时,误导性翻转的数量从 5.5% 降到了几乎为零。
- 新的报告规则: 作者认为我们不应只报告一个单一的数字(例如“这些基因是相互关联的”)。我们需要报告:
- 在每个特定组别内部,这种连接看起来是什么样的。
- 各个组别之间存在多少差异(异质性)。
- 进行一项检查,以确认这种连接是真实的,还是仅仅是由于混合组别而产生的伪影。
底线结论
论文得出结论,描述基因如何相互作用的单一、“一刀切”的数字往往是错误的,因为它掩盖了基因在不同语境下行为各异的事实。为了获得真相,我们必须停止将一切平均化,开始观察基因实际生活的特定“社区”。作者甚至提供了一个小型工具(一个 R 语言接口),以帮助其他科学家正确地进行这种分离。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。