Does AI-predicted biochemical age predict death? A cross-validated re-examination in NHANES 1999–2018 with linked mortality follow-up
本研究表明,尽管复杂的机器学习模型可以更准确地根据血液化学成分预测生理年龄,但其产生的“年龄加速”指标在预测死亡率方面不如简单模型或直接针对死亡结局进行训练的生物标志物有效,从而揭示了在开发有用的生物学年龄预测指标时,训练目标而非模型复杂度或生物标志物才是关键因素。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图仅凭观察里程表来猜测一辆汽车磨损的速度。在衰老科学领域,有一个流行的概念叫做“生物年龄”。这个理论很简单:两个人的实际年龄(生理年龄)可能相同,但由于身体实际衰老的方式不同,其中一人可能会感觉自己比另一人更老或更年轻。科学家们一直在构建“衰老时钟”来衡量这一点。通常,他们通过训练计算机观察一个人的血液检测结果并猜测其年龄。如果计算机猜出的年龄比你的实际年龄大,那么这种现象就被认为是你正在加速衰老。这种“额外”的年龄被称为“年龄加速”,许多研究人员希望它能预测谁会更早生病或死亡。但这里有一个巨大的疑问:一个非常擅长猜测你年龄的计算机,真的能告诉我们关于你寿命长短的有用信息吗?
由研究员约翰·冯(John Feng)撰写的这篇论文深入探讨了这个问题,使用了来自超过 4.5 万名美国成年人的大规模血液检测数据集。作者试图测试一个特定的说法:即计算机在猜测年龄时所犯的“错误”(例如实际 45 岁却预测为 50 岁)是预测死亡速度的一个信号。为了实现这一点,该研究利用了来自美国国家健康与营养调查(NHANES)的海量数据,追踪了血液化学成分并观察了在接下来的二十年里谁去世了。研究结果对科学界来说是一个带有剧情反转的发现。研究发现,虽然高级人工智能模型非常擅长猜测生理年龄,但它们产生的“年龄加速”实际上是预测死亡的一个糟糕指标。事实上,人工智能在猜测年龄方面表现得越出色,它在预测你是否面临死亡风险方面的作用就变得越小。预测死亡的真正秘密并不在于年龄猜测模型的“错误”,而在于训练计算机直接寻找死亡的迹象。
伟大的年龄猜测实验
把这项研究中的血液检测看作一个 38 片组成的拼图。研究人员提取了这些拼图碎片——比如胆固醇、血糖和白细胞计数——并要求计算机解决一个特定的谜题:“基于这些数字,这个人有多大岁数?”他们尝试了六种不同类型的“计算机大脑”,从简单的数学运算(如直线)到复杂的、具有灵活性的神经网络(如深度思考型人工智能)。
故事的第一部分是复杂人工智能的胜利。当研究人员问道:“谁能最好地猜测年龄?”时,灵活的神经网络和梯度提升模型以压倒性优势胜出。它们在预测年龄方面比简单的线性模型要好得多。表现最好的神经网络得到了一个准确度得分(称为 R²)为 0.557,这意味着它可以解释年龄变化的约 56%。而简单的模型仅能达到约 40%。如果你只是想找一个能通过血液检测猜出你生日的计算机,那么复杂的人工智能将是你的冠军。
转折点:擅长猜测年龄反而不利于预测死亡
故事在这里发生了急转弯。研究人员随后提取了这些年龄猜测计算机产生的“错误”。如果计算机说你是 50 岁,而你实际上只有 45 岁,那么这 +5 的差距就是你的“年龄加速”。人们曾寄希望于这个数字能告诉我们谁会更早死亡。
结果令人惊讶。那些最擅长猜测年龄的计算机模型,反而是预测死亡效果最差的模型。
- 那些较简单的模型(如岭回归),虽然在猜测年龄方面准确度较低,但其产生的“年龄加速”得分在预测死亡方面有微小的提升(为名为 C-index 的统计得分增加了约 0.0124)。
- 而那些超级智能的神经网络,尽管在猜测年龄方面表现最佳,但它们产生的得分对预测死亡几乎没有任何贡献(仅增加了 0.0056)。
研究发现了一个强烈的负相关关系:年龄预测越准确,其产生的“年龄加速”在预测死亡方面的效用就越低。这就像是复杂的 AI 过于忙于记忆血液随年龄变化的细微、特定细节,以至于它不小心过滤掉了那些真正预示危险的信号。论文指出,通过试图完美地猜测年龄,人工智能丢弃了那些对生存至关重要的信息。
真正的赢家:针对正确的目标进行训练
为了证明血液数据中确实包含生死攸关的信息,研究人员进行了第二个实验。他们不再要求计算机问:“这个人有多大岁数?”而是问:“谁更有可能死亡?”他们使用完全相同的 38 项血液检测训练了一个新模型,但这一次,计算机学习的是如何直接预测死亡。
结果如何?这个“死亡训练”模型取得了巨大的进步。它将死亡预测能力提升了 0.0367——比表现最好的年龄训练模型高出三倍多。更具说服力的是,当我们将这个死亡训练得分添加到已经包含了 AI 生成的“年龄加速”得分的模型中时,这个死亡训练得分仍然增加了大量的全新信息。这证明了年龄训练模型不仅丢失了信号,而且是主动丢弃了它。
论文还研究了一个名为“PhenoAge”的著名现有时钟,它是为了预测死亡而构建的。它的表现优于年龄训练模型,但仍不及这个利用相同血液数据构建的全新死亡训练模型。这表明,即使是目前最好的工具,也因为训练目标错误而遗漏了大量有价值的信息。
为什么数字会具有误导性
这项研究还解开了一个谜团:为什么之前的一些论文声称他们的年龄猜测模型极其准确(得分高达 0.78),而本研究中最好的得分仅为 0.557?答案并不是新的 AI 更弱,而是关于测试人群的问题。
研究人员发现,年龄猜测的准确性高度依赖于人群的年龄跨度。如果你把青少年纳入其中,由于他们的身体变化非常迅速,计算机会更容易猜中年龄,因为血液的变化非常剧烈。如果你只观察 20 到 79 岁之间的成年人,变化就会变得缓慢且难以察觉。研究表明,“准确度得分”主要反映的是测试组中年龄范围的宽度,而不是计算机本身有多好。这意味着你不能仅仅通过比较不同研究的准确度得分来判断哪个时钟更好;你必须看它们实际想要预测的是什么。
核心结论
这篇论文的主要启示是关于“专注”的教训。如果你想建立一个预测谁可能更早死亡的工具,不要训练计算机去猜测他们的年龄,然后指望其中的“错误”能告诉你一些东西。那种方法会丢掉大部分有用的信息。相反,应该直接针对你关心的结果进行训练:即死亡。论文总结道,瓶颈不在于血液检测技术或人工智能技术,而在于我们为人工智能设定的目标。通过追逐错误的目标(生理年龄),该领域一直忽略了隐藏在血液中预测死亡率的最强有力信号。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。