← 最新论文
🤖 machine learning

Automatic Construction of Clinical Scoring Systems with LLM Agents

本文介绍了 AgentScore,这是一个大型语言模型智能体框架,它通过结合语义规则生成与数据驱动的验证,自动构建可部署的、具有单位权重的临床评分系统,在达到与灵活模型相当的性能的同时,严格遵守常规临床使用所需的严格可解释性和工作流约束。

原作者: Silas Ruhrberg Estévez, Christopher Chiu, Mihaela van der Schaar

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Silas Ruhrberg Estévez, Christopher Chiu, Mihaela van der Schaar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名医生,正匆忙穿过繁忙的急诊室。你需要快速评估患者的风险等级,但没有时间掏出计算器、打开复杂的应用程序,或记住一个包含五个不同数字并乘以不同权重的公式。你需要一份简单的检查清单:“如果患者有症状 A,加一分;如果有症状 B,加一分;如果总分达到 3 分或以上,立即呼叫援助。”

这就是临床评分系统:医生在床旁使用的简单、易记的检查清单。

然而,现代人工智能(AI)擅长预测风险,但它通常像一个“黑箱”,依赖复杂的数学运算,无法在脑海中完成。本文作者 Silas Ruhrberg Estévez 及其同事发现了一个缺口:我们拥有强大的 AI,却难以将其转化为医生实际使用的简单清单。

他们通过一种名为AgentScore的创新方法解决了这一问题。

问题所在:“厨师”与“品尝者”的矛盾

通常,当科学家试图构建这些清单时,他们要么:

  1. 请专家手动制定规则(速度慢且难以更新);
  2. 利用 AI寻找模式,但 AI 提出的往往是复杂的数学公式(例如“年龄 × 0.4 + 血压 × -0.2"),难以在真实医院环境中使用。

作者意识到,要构建一份优秀的清单,需要两方面的协同工作:

  • 创造力:有人能构想出新颖、巧妙的症状组合(例如:“如果我们比较心率和血压会怎样?”)。
  • 严格测试:有人能严格验证该想法是否基于真实数据有效,而非仅仅是运气。

解决方案:AgentScore(AI 团队)

本文介绍了AgentScore,它像一个由多个专用 AI 智能体组成的小团队,协同从零开始构建这些清单。

这就像一场烹饪比赛,目标是创造一份完美、简单、任何人都能遵循的食谱。

  1. “厨师”智能体(LLM 提议者)
    这是一个大型语言模型(就像生成这段解释背后的 AI)。它的任务是发挥创造力。它查看患者数据后提出:“嘿,如果我们检查患者呼吸是否快于每分钟 30 次会怎样?”或者“如果我们检查肾功能是否下降了 20% 会怎样?”

    • 关键规则:“厨师”不能查看患者的真实姓名或私人记录。它只能看到数据的摘要(例如“平均心率为 80")。这确保了患者隐私安全。
    • “厨师”会提出一份潜在的清单“规则”列表。
  2. “品尝者”智能体(确定性验证器)
    这是一个严格的数学计算机程序。它接收“厨师”的想法,并用真实数据对其进行测试。

    • 这条规则真的能预测谁会生病吗?(如果不能,则被剔除)。
    • 这条规则是否只是另一条规则的复制?(如果是,则被剔除以保持列表简短)。
    • 这条规则是否简单到可以写在一张纸上?(如果太复杂,则被剔除)。
  3. “主厨”智能体(组装者)
    一旦“品尝者”筛选出一组经过验证的优质规则,该智能体就会挑选最佳组合。它构建最终的清单,确保项目数量有限(便于记忆),并且每个项目恰好计为一分

为什么“一分”至关重要

本文强调,最佳的清单是单位加权的。这意味着列表中的每一项都恰好值1 分

  • 糟糕的清单:“年龄 > 65 岁得 3 分,但低血压得 -2 分。”(难以心算)。
  • AgentScore 清单:“年龄 > 65 岁?+1 分。低血压?+1 分。总分 > 2?呼叫援助。”(易于心算)。

作者发现,这些简单的"1 分”列表具有惊人的效力。它们在预测结果方面几乎与复杂、数学密集的 AI 模型一样准确,但真正可供人类使用。

结果:超越专家

团队使用真实的医院数据,在八项不同的医疗任务(如预测心力衰竭、肾衰竭或 ICU 死亡)上测试了 AgentScore。

  • 优于旧方法:AgentScore 创建的清单比以往试图将复杂 AI 强行转化为简单清单的方法更准确。
  • 优于标准指南:在两项具体测试中,AgentScore 构建的清单在识别高危患者方面,实际上优于医院目前使用的官方长期医疗指南。
  • 医生认可:当将结果展示给 18 位真实医生时,医生们 overwhelmingly 更倾向于 AgentScore 清单。他们表示,AI 生成的列表感觉更自然,更便于在床旁使用,并且更符合医生的实际思维方式。

核心结论

本文指出,我们并不总是需要更大、更复杂的 AI 来挽救生命。有时,最好的 AI 是能够将复杂知识转化为简单、纸笔清单的 AI,让疲惫的医生能在瞬间使用。

AgentScore 证明,通过利用 AI提出想法并用严格数学验证它们,我们可以自动构建这些简单、救命的工具,而无需人类专家手动编写每一条规则。

重要提示:作者非常明确,这些是研究工具。它们尚未获准在真实医院中用于患者治疗。它们是一个概念验证,展示了一种构建既智能又简单的医疗工具的新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →