Improving Rare Medication Recommendation with Counterfactual Data Augmentation and Large Language Models
本文介绍了 GenRxR,这是一个利用大语言模型生成反事实医疗数据并对协同推荐药物关系进行建模的新型框架,从而显著提升了与现有基线相比的稀有药物推荐预测性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个超级智能机器人医生帮助真实医生决定给患者服用什么药物的世界。这并非科幻小说,而是一个正在发展的领域,称为基于人工智能(AI)的药物推荐。这些系统会查看患者的历史记录——他们过去的疾病、手术经历以及曾经服用过的药物——以此来推测最合适的药物。可以把它想象成一个非常先进的食谱应用,它比你更了解你的口味偏好和过敏原。但问题在于:就像一位只会在烹饪中使用盐和糖等常见食材的厨师一样,这些 AI 机器人很难处理“稀有”食材。在医学领域,这些是给极少数人使用的药物,通常用于治疗奇怪或严重的疾病。因为 AI 在其训练数据中很少见到这些稀有药物,它往往会完全忽略它们,这对于那些迫切需要它们的患者来说是非常危险的。
正是这个问题,由来自 KAIST 和韩国大学的研究团队在他们的新论文中提出了。他们注意到,虽然 AI 擅长建议常用药物,但在建议稀有药物时却表现得很糟糕。为了解决这个问题,他们构建了一个名为 GenRxR 的新系统。他们没有仅仅等待更多的现实世界数据(由于隐私规则,获取这些数据非常困难),而是利用了大语言模型(LLM)的一种“时间旅行”技巧——也就是那种可以写故事或与你聊天的同类超智能 AI。他们要求 AI 构思“如果……会怎样”的情景:“如果这个患者曾经被给予了这种稀有药物,他们的故事会发生怎样的变化?”通过生成这些虚构但符合医学逻辑的故事,他们创建了一个庞大的全新示例库。他们还教会了 AI 更加关注不同药物如何协同工作,就像一位指挥家确保管弦乐团中的每种乐器都能和谐演奏一样。
结果如何?他们的系统 GenRxR 成为了一个更出色的预测者,专门应对那些棘手的稀有药物。在测试中,它不仅表现良好,而且彻底击败了竞争对手。它的表现优于其他 14 种方法,包括其他使用类似“大容量大脑”模型的 AI 系统。最令人印象深刻的是,在处理其他系统经常完全忽略的稀有药物时,GenRxR 将预测准确度提高了高达 30.9%。他们不只是在猜测;他们通过数据证明,通过使用这些“如果……会怎样”的故事并教会 AI 像医生一样进行推理,我们可以让药物推荐变得更安全、更准确,即使是对那些患有最罕见疾病的人也是如此。
问题所在:AI 的“常识”偏差
想象一下,你正在尝试学习玩一款电子游戏,但你只能重复玩第一关一百万次。你会成为那一关的大师,但如果有人突然要求你玩一个只在极少数情况下才会出现的隐藏关卡(秘密 Boss 关卡),你就会不知所措。这正是目前的 AI 药物系统所面临的情况。
研究人员发现,这些系统存在“长尾”问题。在现实世界中,少数药物会被频繁开具(“常用”药物),而数千种其他药物则被极少开具(“稀有”药物)。因为 AI 从历史医院记录中学习,它会反复看到这些常用药物,因此对它们变得非常精通。但那些稀有药物呢?它们就像数据中的幽灵。由于样本太少,AI 基本上会忘记它们的存在。
这不仅仅是一个小故障。许多这类稀有药物是“孤儿药”,专为治疗非常特定、严重或罕见的疾病而设计。如果 AI 忽略了它们,需要的患者可能会面临没有治疗方案的困境。研究人员还注意到,现有的 AI 系统往往无法理解药物是如何“协同工作”的。开具一种稀有药物通常意味着它是特定药物组合的一部分。如果 AI 不理解这些药物之间的关系,它就无法做出安全的推荐。
解决方案:利用“如果……会怎样”故事进行时间旅行
为了解决这个问题,该团队创建了 GenRxR,这是一个以两种巧妙方式使用大语言模型(LLM)的框架。
1. “如果……会怎样”机器(反事实数据增强)
第一个重大障碍是数据的缺乏。如果你手里只有一个法拉利,你无法教学生如何驾驶法拉利。因此,研究人员使用 LLM 来创造“更多”法拉利。他们并没有胡乱编造数字,而是利用 AI 的医学知识来编写“反事实”故事。
其运作方式如下:
- 团队从真实的医院记录中挑选一名并未接受特定稀有药物治疗的患者。
- 他们询问 LLow(LLM):“想象一下,如果这个患者确实接受了这种稀有药物,为了使这一情况符合逻辑,他们的医疗史还会发生哪些变化?”
- LLM 扮演着一位拥有医学学位的创意作家。它可能会说:“好吧,如果他们服用了这种稀有药物,他们可能还患有一种特定的感染,经历了一场特定的手术,并且正在服用另一组辅助药物。”
- AI 随后生成一条全新的、合成的患者记录,其中包含了这种稀有药物以及所有与之相关的逻辑变化。
这就像是给了 AI 一台时间机器,让它去访问那些使用了稀有药物的平行现实。通过在这些成千上蝠个全新的、真实的“如果……会怎样”故事上进行训练,AI 终于学会了稀有药物是什么样的,以及何时使用它们。
2. “团队成员”(指令微调)
第二个拼图碎片是确保 AI 理解“语境”。稀有药物很少是单打独斗的,它是团队的一部分。为了帮助 AI 理解这一点,研究人员使用了**指令微调(instruction tuning)**技术。
他们教会了 LLM 以一种能够突出患者病情与所需药物之间联系的方式来总结医疗记录。他们向 AI 提供了具体的指令,让它扮演临床推理专家的角色。AI 不再只是看一份药物清单,而是学会了观察全局:“这个患者有这些症状,因此这种特定的药物组合是合理的。”这一步确保了当 AI 推荐一种稀有药物时,它不仅仅是在猜测,而是在通过临床语境进行推理,就像人类医生一样。
结果:一次巨大的飞跃
该团队将 GenRxR 与其他 14 种方法进行了对比测试,其中包括五种同样使用大语言模型的系统。结果显而易见:GenRxR 是冠军。
- 整体性能: 它在预测正确药物方面击败了几乎所有其他方法。
- 稀有药物奖: 最令人兴奋的发现是关于稀有药物的。当其他系统甚至难以猜中正确的稀有药物时,GenRxR 的表现提升了高达 30.9%(相比于最强的基准模型)。
- 安全第一: 至关重要的是,提高对稀有药物的预测能力并没有损害其推荐常用药物的能力。它成为了一个更全能的“医生”,同时没有丢掉基础技能。
研究人员不仅声称这有效,还使用了真实的医院数据(来自 MIMIC-III 和 MIMIC-IV 数据集)进行了衡量。他们证明了通过使用“如果……会怎样”的故事来填补空白,并教会 AI 通过临床语境进行推理,我们可以解决医疗 AI 的一个主要盲点。
为什么这很重要
这篇论文并不声称解决了医学中的所有问题,但它提供了一个强大的新工具。它表明,我们并不总是需要更多的现实世界数据来训练 AI;有时,我们只需要更聪明地利用现有的数据。通过让 AI 想象“如果……会怎样”的情景,我们可以让它为现实世界中发生的那些罕见、困难的病例做好准备。对于患有罕见疾病的患者来说,这意味着未来 AI 医生在面对他们时,能像面对普通感冒一样准备充分。他们现在公开了代码和生成的数据,邀请整个社区基于这种“如果……会怎样”的方法进行开发,从而让医疗保健变得更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。