← 最新论文
🧬 biology

AI as a Biological Primitive Enables Targeted Inversion Across Disease, Population, and Neuronal Systems

本文证明,将训练好的生物医学人工智能模型视为可查询的生物原语,能够实现针对性的逆向推导,从而在个体、群体和神经元尺度上识别有效的干预策略,并利用源自文献的紧凑型干预向量实现显著的目标状态改善。

原作者: Maurice Antony Ewing

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Maurice Antony Ewing

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

大多数时候,当我们利用人工智能来理解生物学时,我们都在要求它向前看。我们将患者当前健康状况的照片或病毒在城市中传播的快照输入计算机,并要求机器预测接下来会发生什么。血糖会在明天升高吗?感染人数下个月会增加吗?这种前瞻性的方法已成为现代医学和公共卫生的标准。这是一种预测风险的强大方式,但它留下了一个关键问题悬而未决。医生或决策者很少只需要知道“将会”发生什么;他们需要知道“该做什么”才能让不同的事情发生。他们需要知道确切应该给予多少胰岛素,或者封锁措施应该有多严格,才能将一个系统推向特定的、理想的结果。

这就是观察河流流动与知道移动哪些石头来改变其流向之间的区别。几十年来,科学家们一直试图构建“数字孪生”——即能够高度模拟现实生活的患者或人群的虚拟副本,以便对其进行不同治疗方案的测试。然而,这些数字孪生往往因为建立在平均值之上而失败。它们描述的是一个典型的人如何反应,而不是一个特定个体如何对特定行动做出反应。如果一个模型在其训练数据中从未见过某种特定的药物,即使它给出了听起来很自信的答案,它也无法可靠地告诉你这种药物会对特定患者产生什么影响。其结果是一个可能预测得很好但无法安全指导行动的系统。

莫里斯·安东尼·尤因(Maurice Antony Ewing)的一项新研究提出了一种看待这些计算机模型的不同方式。作者并没有构建一个模仿人的孪生体,而是将训练好的 AI 模型视为一种“生物原语”(biological primitive)。这是一个更简单的概念:该模型不是一个人整个历史的副本,而是关于一个系统在过去受到某些行为影响后实际如何反应的学习记录。如果数据显示特定量的运动降低了一组人的血糖,那么模型就学习到了这种特定的关系。随后,研究人员将模型反转过来。与其问“如果我这样做会发生什么?”,不如问模型“需要多大程度的行动才能达到那个目标?”这个过程被称为“定向反转”(targeted inversion),它通过搜索精确的干预水平,以推动系统向目标状态移动,但仅限于数据实际支持的杠杆。

为了测试这个想法在现实世界中是否可行,该研究将此方法应用于三个截然不同的生物系统:一型糖尿病患者的个体生理学、COVID-19 大流行的群体动力学,以及大脑中神经元的微观反应。研究人员首先训练标准的 AI 模型来预测这些领域的未来状态。对于糖尿病数据,模型学会了根据过去的胰岛素、食物和活动来预测未来的血糖水平。对于大流行数据,它们学会了根据封锁和检测率等政策来预测未来的病例数。对于大脑数据,它们学会了神经元如何响应特定的视觉刺激。这些前向模型具有高度的准确性,证明它们已经学习到了数据的底层模式。

一旦模型训练完成,研究人员就开始让它们向后工作。他们设定一个目标——例如,糖尿病患者的安全血糖水平,或城市较低的感染人数——并要求模型找到实现该目标的特定行动组合。在涉及 400 例高风险病例的糖尿病组中,该方法非常有效。当研究人员询问模型单独寻找合适的体力活动量时,它将患者当前状态与目标之间的差距缩小了 76.5%。当他们询问单独使用胰岛素的正确量时,差距缩小了 60.6%。当他们允许模型结合活动和胰岛素,但将建议保持在安全的临床限度内时,差距缩小了 87.8%。如果他们移除这些安全限制并让模型自由搜索,它找到的解决方案可以将差距缩小 96.4%。在几乎所有情况下,模型都找到了让系统向目标移动的方法。

当应用于更大规模的 COVID-19 大流行时,结果略显保守但依然一致。在这里,目标是减少未来病例的负担。当模型寻找合适的封锁措施水平时,它减少了 17.9% 的预期差距。仅靠检测帮助了 5.8%,疫苗接种帮助了 3.8%。然而,当模型结合这三种策略时,它减少了 25.1% 的差距。这一差异凸显了一个关键发现:虽然单一行动会有所帮助,但大流行的复杂动态是由许多因素共同作用形成的。该方法表明,人口层面的问题需要多种干预措施的组合,而非单一的灵丹妙药。

研究中最令人惊讶的部分或许在于,研究人员无需搜索每一种可能的行动组合就能取得如此大的成就。在现实世界中,存在着成千上万种潜在的治疗方案或政策,但其中许多并不受现有数据的支持。研究测试了一种“紧凑型”(compact)方法,即模型被限制为仅在已知合理且实际记录在案的干预措施清单中进行搜索。对于糖尿病病例,这种紧凑型列表恢复了实现目标可能性的 79.0%。而全量、无限制的搜索仅增加了 2.2% 的改善。对于大流行数据,紧凑型列表恢复了 85.9% 的改善,而全量搜索仅多增加了 0.5%。这表明,我们不需要进行疯狂的猜测或在数百万个不可能的选项中搜索以寻找有效的解决方案。我们只需要关注那些我们已知存在且有数据支撑的行动即可。

该研究还展示了这种方法的一个关键安全特性:模型拒绝发明它无法支持的解决方案。在糖尿病组中,研究人员尝试要求模型寻找涉及某些药物(如二甲双胍或 GLP-1 类药物)的解决方案。由于这些患者的原始数据中不包含这些特定药物的记录,模型直接跳过了它们。它没有产生幻觉或假装知道会发生什么,而是返回了一个平淡的答案,表明它无法针对这些特定的杠杆进行操作。这与许多当前的 AI 系统形成了鲜明对比,后者可能会在从未见过相关数据的情况下,自信地建议某种治疗方案。“原语”方法植根于数据实际包含的内容,使其成为一种更安全的决策工具。

同样的逻辑也被应用于大脑。利用包含超过 120 万次观察(记录了神经元如何响应光刺激)的艾伦脑科学观测站(Allen Brain Observatory)数据,研究人员构建了一个学习特定细胞如何对刺激做出反应的原型。他们能够询问模型什么样的刺激水平能将神经元推向特定的放电模式。这表明该方法不仅适用于整个人或整个群体,也适用于最小的生物单元。神经元、患者和城市都被视为对输入做出反应的系统,而模型学习的是这些反应的映射图。

作者谨慎地指出,这是一种探究方法,而非最终的处方。结果来自于回顾历史数据,而非运行新的临床试验。模型识别出能将系统推向目标的干预水平,是基于过去的行为,但它并不证明这些干预措施在新的现实环境中一定会奏效。它是一种缩小可能性范围并找到最有前景路径的方法。研究认为,通过将 AI 视为可以进行逆向查询的生物原理,科学家可以超越简单的预测。与其仅仅询问将会发生什么,不如询问需要多大程度的行动才能使某事发生,前提是必须遵循数据所支持的杠杆。这种从“猜测未来”到“针对当下”的转变,为在医学和公共卫生领域使用人工智能提供了一种更具落地性、更务实的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →