Genetic drivers of protein changes over time: Findings, considerations, and approaches in TOPMed cohorts and UK Biobank
本研究利用来自 TOPMed 和 UK Biobank 队列的纵向蛋白质组学数据,旨在证明虽然基线调整模型能够识别出许多导致蛋白质随时间变化的遗传驱动因素,但其中许多发现可能源于诸如碰撞偏倚(collider bias)或回归均值(regression to the mean)等统计伪影,从而强调了采取谨慎建模策略对于准确揭示蛋白质组衰老的真实遗传机制至关重要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
把你的身体想象成一座繁忙的城市。长期以来,科学家们一直在通过拍摄这些城市的“快照”来观察正在发生的事情。他们绘制了人口图谱(你的基因)、统计了建筑数量(你的蛋白质),并记录了交通拥堵情况(疾病)。但城市从未静止不动;它一直在变化。有些建筑变得更高,有些道路变得更宽,而有些则在崩塌。现代科学中的一个巨大谜团是:为什么有些城市能优雅地老去,而有些城市却陷入了破败?我们知道时间对每个人来说都在流逝,但我们生物城市的“变化速率”在不同人之间差异巨大。
为了理解这一点,科学家们观察“蛋白质”。把它们想象成在你身体城市中奔波的工人、建筑队和信使。它们负责重体力活,修理管道,并传递信号。我们也知道我们的 DNA(城市的总蓝图)会影响这些工人的行为。通常情况下,科学家只是查看蓝图,看看在某一特定时刻有多少工人存在。但如果蓝图不仅规定了工人的数量,还规定了这些工人数量随岁月变化的“速度”呢?这就是这项研究试图解决的问题:我们能否找到那些控制我们身体劳动力“变化速度”,而非仅仅控制某一特定时刻“劳动力规模”的遗传指令?
伟大的蛋白质竞赛:谁在加速,谁在减速?
在这项研究中,研究人员决定进行一场长期的“找不同”游戏。他们收集了来自三个不同人群(队列)的数据,这些人在大约 12 到 18 年的时间里,在多次随访中接受了蛋白质水平检测。这就像每隔几年给一名跑步者拍一张照片,看看他是正在加速、减速,还是保持原有的节奏。
团队观察了近 3,000 种不同的蛋白质(即身体的工人),并试图计算出每一种蛋白质的“斜率”。斜率只是一个高级数学术语,代表变化率。如果蛋白质水平随时间稳步上升,它就有一个正斜率;如果下降,则有一个负斜率。核心问题在于:我们的基因是否控制着这些斜率?
“起始值”陷阱
这里出现了棘手的情况,研究人员发现了一个主要的陷阱。当他们最初尝试寻找驱动这些斜率的遗传因素时,他们在数学计算方法上遇到了问题。
想象一下,你正在试图弄清楚某种特定的鞋子是否让人们跑得更快。如果你只观察那些已经穿着快跑鞋的人,你可能会感到困惑。同样,研究人员发现,如果你在试图预测蛋白质变化速度的同时,还试图精确掌握该蛋白质最初的水平,数学计算就会变得混乱。这就像是在试图猜测一株植物一个月内会生长多少,但同时你又强行让数学模型必须考虑到它在第一天时的身高。
当他们进行数学计算而不考虑初始高度(基线)时,发现几乎没有遗传线索——只有 19 种蛋白质显示出与其变化率有明确的遗传联系。但当他们考虑了初始高度后,这个数字瞬间激增到了 600 多种!
“魔法”幻象
研究人员怀疑,这 600 种蛋白质的激增可能是一种视觉错觉,即一种被称为“回归均值”或“碰撞偏差”(collider bias)的统计学幻象。
把它想象成一次课堂测试。如果你挑选那些在第一次测试中得分最低的学生,并告诉他们:“我们要看看你们能进步多少。”你可能会发现他们的分数上升了。但这并不意味着某种特定的基因让他们进步了;这仅仅意味着他们起步较低,自然而然地向平均值靠拢。研究人员意识到,通过调整起始水平,他们可能在无意中制造了一个虚假信号。
为了测试这一点,他们尝试在另外两个群体(UK Biobank 和 CARDIA)中复制他们的发现。
- 那些在不考虑起始线的情况下发现的 19 种蛋白质?它们在其他群体中几乎没有显现。
- 那些在进行调整后发现的 600 种蛋白质?它们确实大量出现,但研究人员对此非常谨慎。他们发现,许多这些信号似乎是数学技巧的结果,而非真实的生物学驱动力。事实上,他们发现“经过调整后的”结果往往指向与“未调整”结果相反的方向,这在科学研究中是一个巨大的警示信号。
结论:情况很复杂
那么,他们究竟发现了什么?
- “真正的”驱动因素非常罕见: 研究表明,寻找那些真正控制蛋白质随时间变化速度的基因是非常困难的。他们只发现了极少数(约 19 个)不依赖于这种复杂的数学调整的强有力候选者,即便如此,这些候选者在其他群体中也很难被证实。
- “虚假的”驱动因素无处不在: 他们在调整起始水平后发现的数百个遗传联系,可能大多只是统计噪声。论文指出,这种方法可能会制造假警报,让我们误以为基因在控制变化,而实际上它们可能只是在对起始位置做出反应。
- 一个令人惊讶的联系: 虽然直接的“斜率”信号很难确定,但研究人员发现,蛋白质的“变化方式”与其“波动程度”(变异性)之间存在强关联。他们发现,在显示出受遗传控制的变异性(variance)的蛋白质中,有 73% 也显示出受遗传控制的变化率(slope)。这表明,那些影响蛋白质波动程度的基因,可能也是那些影响其上升或下降趋势速度的基因,即便“斜率”的数学解释非常复杂。
为什么你应该关心?
研究人员并不是说他们已经解开了衰老的谜团。相反,他们是在敲响警钟。他们是在告诉科学界:“测量变化时要小心!”如果我们使用错误的数学方法,我们可能会误以为找到了减缓衰老的遗传钥匙,而实际上我们只是发现了一个数学幻象。
这项研究强调,虽然我们的基因确实影响着我们的身体,但要精准定位究竟是哪些基因控制了变化的“速度”,比仅仅寻找控制某一时刻蛋白质“含量”的基因要难得多。它提醒我们,在理解衰老的竞赛中,终点线是难以捉摸的,有时看起来跑得最快的选手,其实只是在原地转圈。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。