← 最新论文
🤖 AI

Automatic Extraction of Structured Information from Brain MRI Reports Using an Open-Weight Large Language Model

这项研究表明,开源权重大语言模型 LLaMA 3.1 能够高效地从荷兰语脑部 MRI 报告中提取结构化信息,在类别变量和病灶提及方面具有极高的准确率,且少样本提示(few-shot prompting)能显著提升其在数值数据提取方面的表现。

原作者: Kaouther Mouheb, Amos Pomp, Antoine Manenti, Romy de Haan, Farog Faghir, Joy Martens, Harro Seelaar, Francesco Mattace-Raso, Meike W. Vernooij, Frank J. Wolters, Stefan Klein, Esther E. Bron

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaouther Mouheb, Amos Pomp, Antoine Manenti, Romy de Haan, Farog Faghir, Joy Martens, Harro Seelaar, Francesco Mattace-Raso, Meike W. Vernooij, Frank J. Wolters, Stefan Klein, Esther E. Bron

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:将杂乱的笔记本变成电子表格

想象一下,一家医院拥有一个包含数千份脑部 MRI 报告的海量图书馆。多年来,这些报告一直由医生以自由格式的日记条目形式编写。它们充满了有价值的信息,但由于是以非结构化的句子书写的,想要快速搜索它们或将它们转化为整洁的科研电子表格是非常困难的。

研究人员想看看一个聪明的计算机程序(一个名为 LLaMA 3.1 的“开源大语言模型”)能否充当一名超级快速的图书管理员。他们的目标是阅读这些杂乱、类似手写风格的荷兰语报告,并自动提取出 30 个特定的事实——例如“是否存在肿瘤?”或“大脑上有多少个斑点?”——并将它们整理成整洁的结构化格式。

挑战:语言不通

这些报告是用荷兰语编写的,但该计算机模型主要是基于英语进行训练的。这就像是要求一位英语精通的翻译员去阅读一份复杂的特定荷兰语方言法律文件。

团队测试了两种方法:

  1. 直接阅读: 让计算机直接阅读原始的荷兰语报告。
  2. 先翻译再阅读: 先将荷兰语报告翻译成英语,让计算机阅读,然后再将结果翻译回荷兰语。

结果: 计算机在阅读原始荷兰语报告时表现得更好。当他们尝试先翻译报告时,计算机会对特定的医学术语感到困惑。例如,荷兰语中有一个非常具体的词,用来描述一种非常细小的、呈条状的脑损伤(“splinterinfarcten”)。当它被翻译成英语时,变成了通用的“小梗死”(small infarct),计算机因此丢失了正确计数所需的具体细节。

“小抄”策略(少样本提示/Few-Shot Prompting)

起初,计算机被要求在没有任何准备的情况下完成这项任务(零样本/Zero-Shot),这意味着它必须自己摸索规则。它表现尚可,但在计数(比如“有多少个斑点?”)方面会出错。

随后,研究人员尝试了一种新技巧,叫做少样本提示(Few-Shot Prompting)。想象一下你正在教一名学生如何批改试卷。与其只给他们规则,不如向他们展示三个已经批改正确的试卷范例以及对应的答案。你要说:“看我们是怎么处理这个的;现在请用同样的方式处理下一个。”

研究人员测试了挑选这三个范例的不同方式:

  • 随机选择: 随机挑选任何三个例子。
  • 固定选择: 每次都挑选相同的三个例子。
  • 结构相似性: 挑选在外观和读音上与当前正在阅读的报告最相似的三个例子。

胜出者: 结构相似性方法效果最好。通过向计算机展示与当前正在阅读的报告非常相似的例子,其准确率显著提升。这就像是给学生展示了一份看起来与他们即将参加的正式考试完全一致的练习卷。

表现如何?

研究人员将计算机的工作成果与人类专家(医学生和放射科医生)进行了对比。

  • 好消息: 对于清晰的标准评分(如“大脑是否在萎缩?”),计算机的表现几乎与人类不相上下。它的正确率达到了 90–96%
  • 难点: 计数特定的数字(如“到底有多少个微小的出血点?”)更具挑战性。计算机在没有任何提示时正确率约为 66%,但在使用了“小抄”(少样本提示)后,提升到了 81–92%
  • “缺失”带来的困惑: 计算机有时会混淆“医生说没有斑点”和“医生根本没提到斑点”这两者。它很难区分“负面发现”与“信息缺失”。

总结

这项研究证明,一个开源、免费使用的 AI 模型可以成功阅读复杂的荷兰语医学报告,并将其转化为有组织的资料,而无需将患者信息发送到外国公司的服务器。

  • 它在以下情况表现最好: 让它阅读原始语言(荷兰语),而不是进行翻译。
  • 它变得更聪明的方法是: 在开始工作前,给它几个类似的例子作为参考。
  • 它尚未完美: 特别是在处理棘手的计数或非常罕见的病症时,但它是一个强大的工具,可以帮助研究人员比仅靠人力更快地将数千份杂乱的报告转化为有用的数据。

研究结论认为,只要人类对棘手部分进行复核,这项技术已经准备好协助组织科研数据了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →