← 最新论文
💬 NLP

Human-AI Co-design for Clinical Prediction Models

本文介绍了 HACHI,这是一个迭代的人机回环框架,它利用 AI 智能体通过专家反馈来快速探索和提炼临床笔记中的可解释概念,从而在加速开发更准确、更具泛化能力的临床预测模型的同时,强调了人类监督在引导 AI 方面所起的关键作用。

原作者: Jean Feng, Avni Kothari, Patrick Vossler, Andrew Bishara, Lucas Zier, Newton Addo, Aaron Kornblith, Yan Shuo Tan, Chandan Singh

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jean Feng, Avni Kothari, Patrick Vossler, Andrew Bishara, Lucas Zier, Newton Addo, Aaron Kornblith, Yan Shuo Tan, Chandan Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个终极且易于使用的清单,让医生能够预测患者是否会生病。传统上,构建这种清单就像是在蒙着眼睛组装一件复杂的家具,还得有一群专家在旁边争论该用哪颗螺丝、要把螺丝拧多紧以及应该遵循哪套说明书。这不仅耗时漫长,还需要庞大的团队,而且最终成品往往过于复杂,无法在繁忙的医院中实际使用。

这篇论文介绍了一种构建这些清单的新方法,称为 HACHI。把 HACHI 想象成一场“人类 + AI”的舞蹈搭档。它不是由人类承担所有重活而 AI 只是坐在那里看,而是通过一个循环让两者协同工作:由 AI 进行大量的探索,而人类则负责掌舵。

以下是 HACHI 这种合作伙伴关系的工作方式,使用了简单的类比:

问题所在:“无限图书馆”

医生可以接触到数百万页非结构化的笔记(例如手写涂鸦或打字段落),这些笔记包含了关于患者为何生病的潜在线索(概念)的“无限图书馆”。

  • 旧方法: 一个人类团队试图阅读这些笔记并猜测哪些线索重要。他们可能会错过最重要的线索,或者选了一些在理论上看起来不错但在现实中行不通的线索。
  • 仅靠 AI 的方法: 你可以让一个超级聪明的 AI(大语言模型)阅读所有笔记并挑选线索。但 AI 可能会产生困惑,挑选一些奇怪的线索(比如“医生是用蓝色墨水写的”而不是“患者发烧了”),或者因为它不理解医学背后的“为什么”而忽略了大局。

解决方案:HACHI 之舞

HACHI 通过让 AI 和人类在循环中轮流接力来解决这个问题。

  1. AI 智能体(侦察兵): AI 被派往“无限图书馆”中的笔记中。它的任务是快速扫描、寻找潜在线索,并将它们转化为简单的**“是/否”问题**(例如:“记录中是否提到患者有头痛?”)。然后,它会测试这些问题,看看哪些问题能最好地帮助预测疾病。
  2. 人类团队(教练): 人类观察 AI 的结果。他们扮演教练的角色。他们可能会说:
    • “嘿,你选了一个关于‘笔记书写风格’的线索,这属于作弊。我们只看患者实际的症状。”
    • “你漏掉了手术类型!那是一个巨大的因素。去寻找那个线索。”
    • “这个线索太模糊了。让我们把问题变得更具体一些。”
  3. 循环: 人类给出反馈,AI 根据新的指令回到库中寻找更好的线索。他们重复这个过程几次(通常是 3 到 4 轮),直到清单趋于完美。

论文中的现实案例

团队在两个特定的医疗问题上测试了这一点:

1. 预测儿童脑损伤 (TBI)

  • 目标: 决定哪些头部受伤的儿童需要进行 CT 扫描(这涉及辐射),哪些不需要。
  • AI 的第一次错误: AI 最初认为“记录中是否提到格拉斯哥昏迷量表?”是一个好的线索。人类说:“不!那是关于医生如何写笔记的线索,而不是关于患者状况的。”他们还发现 AI 意外地使用了来自其他医院已进行过扫描的患者数据(数据泄露)。
  • 修复: 人类告诉 AI 忽略笔记书写风格,并剔除这些特定的患者。
  • 结果: 最终的清单简单、准确,甚至发现了一个旧方法错过的线索:“孩子是否有正常的步态?”(如果孩子在头部撞击后走路正常,他们很可能没事)。

2. 预测术后急性肾损伤 (AKI)

  • 目标: 预测患者在接受普通外科手术后是否会出现肾损伤。
  • AI 的第一次错误: AI 只关注患者的身体情况(如体重或血压),而忽略了手术本身。
  • 修复: 人类告诉 AI:“停!手术类型同样重要。此外,让你的问题更具体一些,以便不同的医生能以相同的标准进行解读。”
  • 结果: 最终的清单包括了诸如“手术是否紧急?”以及“患者心率是否超过 100?”等内容。它比之前的模型要准确得多。

为什么这很重要

论文声称 HACHI 比传统方法更快、更好,因为:

  • 它很快: 团队每轮只需花费约 1-2 小时来审查 AI 的工作。
  • 它很清晰: 最终的模型只是简单的“是/否”问题列表,任何医生都能理解并在无需计算机的情况下使用。
  • 它很可靠: 因为人类参与其中,他们能在模型完成前捕捉到 AI 的错误(如数据泄露或奇怪的相关性)。

简而言之,HACHI 就像拥有一个超级快速、超级聪明的实习生(AI)负责所有的研究工作,而资深医生(人类)则引导这位实习生,以确保最终报告准确、公平且真正有用。论文表明,这种伙伴关系创造出的医疗预测工具,比人类或 AI 单独构建的工具都要优秀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →