Large Language Models as Unified Multimodal Learners for Clinical Prediction
本文表明,将多样化的电子健康档案模态转换为单一的自然语言序列,并对预训练大语言模型进行端到端微调,其临床预测性能可达到或超过专门的多模态架构及已部署的梯度提升系统,从而消除了对复杂、特定任务融合设计的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,医疗数据世界就像一座巨大且混乱的图书馆。在其中一个书架上,你拥有整齐、有序的账本,里面填满了数字:心率、血压、化验结果和患者年龄。而在另一个书架上,你拥有医生手写的、凌乱的日志,充满了故事、观察以及对患者感受的描述。几十年来,试图预测健康结果的计算机不得不雇佣两位不同的图书管理员:一位只理解数字,另一位只理解故事。这两位图书管理员会在不同的房间里工作,尝试总结各自的发现,然后必须由第三个人尴尬地将这些总结缝合在一起,才能做出决策。这既缓慢又复杂,而且每一个新的医疗问题都需要从头开始构建一套全新的图书馆系统。
大语言模型(LLM)应运而生。把它们想象成超级聪明、求知欲极强的读者,它们已经吞噬了图书馆中几乎所有的书籍。它们对人类语言的理解如此精深,以至于它们能读懂一个故事,并能瞬间理解用文字表达出来的数字含义。研究人员一直在追问的一个重大问题是:我们能否直接把所有的数据——那些整齐的账本和凌乱的日志——交给这位单一的“超级读者”,将一切都转化为一个简单的故事,然后让它找出答案?如果这行得通,我们就无需为每一个新的医疗问题去构建复杂的、定制化的图书馆。我们可以直接使用一个通用的翻译官。
这篇题为《大语言模型作为临床预测的统一多模态学习者》的论文,深入探讨了这一构想。研究人员(来自德国人工智能与医疗中心的团队)测试了是否可以将所有不同类型的患者数据——生命体征、化验结果和医生笔记——简单地转换成一个单一的长句子或段落。他们并没有使用专门设计的、用于融合数字与文本的复杂计算机架构,而是直接将这个“超级故事”喂给标准的预训练 AI 模型(如 Llama、Gemma 等),并让它们预测患者会发生什么。
结果令人惊讶地有效。该团队在三个截然不同的医疗挑战上测试了这种“单一故事”方法:预测患者是否会在重症监护室(ICU)内死亡、猜测肾脏移植是否会失败,以及判断急诊就诊的紧急程度。在每种情况下,这种将数据转化为文本并让 AI 阅读的简单方法,表现得与目前医生使用的复杂、定制化系统一样出色,甚至更好。事实上,在肾脏移植预测方面,他们的新方法击败了目前正在德国一家真实医院运行的特定计算机程序。
论文指出,我们不需要为每一个医疗难题都发明一台新的、华丽的机器。相反,我们可以将一切都转化为 AI 已经能够流利表达的一种语言。虽然作者也提到,将海量数据转化为文本有时会导致“故事”变得非常长(这可能会让 AI 阅读起来有些吃力),但他们的研究结果表明,这种统一的、基于文本的方法是一种强大且更简单的方式,能帮助计算机理解患者健康的完整图景。这是一种从“为每项工作打造定制工具”向“使用一个极其全能、能处理所有工作的工具”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。