← 最新论文
💬 NLP

Hallucination Mitigating for Medical Report Generation

本文提出了 KERM,这是一个通过集成基于 MedCLIP 的检索、上下文净化模块以及细粒度强化学习,来减轻幻觉并提高医学报告生成临床准确性的知识增强框架。

原作者: Ruoqing Zhao, Runze Xia, Piji Li

发布于 2026-01-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoqing Zhao, Runze Xia, Piji Li

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个高度智能、博学多才的机器人医生(一种大型视觉语言模型,即 LVLM),它通过观察 X 光片并尝试为人类医生撰写报告。这个机器人非常聪明,但它有一个坏习惯:它喜欢胡编乱造。

在医学领域,这被称为**“幻觉” (Hallucination)**。这就像机器人明明看到一颗健康的心脏,却自信地写道:“患者有轻度心脏肥大”,仅仅是因为这样听起来很像那么回事。在现实生活中,这可能会导致患者接受错误的治疗。

这篇论文的作者 Ruoqing Zhao 及其同事构建了一个名为 KERM 的新系统来解决这个问题。你可以把 KERM 想象成一个针对我们这位机器人医生的三步走“事实核查与教练”系统。

1. “图书管理员”步骤(知识增强)

在机器人观察 X 光片之前,系统会充当一名超快速的图书管理员。

  • 问题: 机器人可能无法记住关于某种罕见病症的所有特定医学事实。
  • 解决方案: 系统会搜索一个庞大的、经过精心整理的医学事实库(“知识语料库”),寻找与该 X 光片相匹配的句子。例如,如果 X 光片显示了一种特定类型的肺部斑点,图书管理员就会从医学教科书中找到一段精确描述该斑点的文字。
  • “净化”过滤器: 有时图书管理员带回的书籍太多,其中一些并不符合特定患者的情况(比如他们的病史或症状)。系统拥有一个“净化模块”,它扮演着严格编辑的角色,剔除无关的事实,只保留那些与患者当前情况完美匹配的事实。这确保了机器人开始工作时拥有正确的上下文背景。

2. “严厉教练”步骤(细粒度奖励)

一旦机器人写出一份报告草案,它得到的不仅仅是“做得好!”或“做得不好!”。它会被一位严厉的教练(使用 GPT-3.5 等 AI 工具和医学分类器)在两个特定层面上进行评分:

  • 第一层:疾病清单(疾病级奖励): 教练会检查:“你提到肺炎了吗?你是不是漏掉了骨折?”如果机器人虚构了一个并不存在的疾病,它会受到惩罚;如果它漏掉了一个真实的疾病,它也会受到惩罚。这就像老师在批改一份关于准确性的选择题测试。
  • 第二层:句子流利度(句子级奖励): 即便事实是正确的,句子也可能听起来很奇怪或不自然。教练会阅读句子并询问:“这听起来像是一个真正的医生会说的话吗?逻辑通顺吗?”如果机器人写的句子在技术上是正确的,但听起来很怪异或格格不格,它会得到较低的分数。

3. 训练循环

机器人从这些评分中学习。它不再只是靠猜测,而是利用一种数学方法(强化学习)来调整自己的大脑。它学会了:“当我看到这种类型的 X 光片时,我应该从图书馆中查找那个特定的事实,并且我应该写出能从教练那里获得高分的句子。”

结果

作者在两个巨大的真实 X 光片和报告数据库(IU-Xray 和 MIMIC-CXR)上测试了这个系统。

  • 结果: KERM 系统撰写的报告比以往的方法更加准确。它犯的错误(幻觉)更少,并且使用的医学语言听起来更自然、更可靠。
  • 类比: 如果说之前的模型像是那些只背诵了几个事实然后靠猜来应付的学生,那么 KERM 则像是一个翻开着教科书、对照着评分标准检查自己的作业,并在交卷前接受严厉老师评分的学生。

重要局限性(论文中所述)

作者坦诚地说明了他们的系统目前还不能做到的事情:

  • 它依赖于图书馆: 如果他们构建的医学库缺失了某个罕见事实或包含过时信息,机器人仍然可能会出错。
  • 它并不完美: “净化”过滤器可能无法捕捉到复杂患者病史中的每一个微小细节。
  • 它成本很高: 运行这个系统需要强大的计算机,这对于目前的小型医院来说可能难以负担。

简而言之,KERM 是通过给 AI 医生一本可以查阅的参考书和一个严格评分的老师,从而防止它们“胡编乱造”,从而实现更安全、更准确的医学报告。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →