← 最新论文
💻 computer science

Counterfactual Anatomy-guided Spatial-Temporal Decoding for Annotation-Free Hallucination Mitigation in Medical VLMs

该论文提出了反事实解剖引导的时空(CAST)解码,这是一种无需标注的推理框架,通过利用反事实干预自动识别具有因果相关性的解剖区域,并应用统一的对比解码来增强空间定位与生成动态,从而缓解医学视觉语言模型中的幻觉问题。

原作者: Yifan Lu, Adinath Dukre, Abhijit Das, Ziyun Zou, Haolin Yang, Yutong Xie, Imran Razzak

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Lu, Adinath Dukre, Abhijit Das, Ziyun Zou, Haolin Yang, Yutong Xie, Imran Razzak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,一种被称为医学视觉语言模型的新型系统应运而生。这些系统能够观察 X 光片或 MRI 等医学图像,并用自然语言回答有关图像的问题。这些工具具有巨大的潜力,可以辅助医生,提供一种快速解读复杂扫描结果并向患者解释发现的方法。然而,像任何强大的工具一样,它们并不完美。一个被称为“幻觉”的持续性问题困扰着这些系统,即模型生成了流利、听起来很有信心的答案,但这些答案完全没有图像证据的支持。在医学语境下,一个自信但错误的关于患者病情的陈述可能是危险的,可能会误导临床医生或延误治疗。研究人员面临的挑战在于,如何在不从头开始重新训练这些庞大模型的情况下修复这种凭空捏造事实的倾向,因为重新训练的过程通常过于昂贵且耗时。

为了解决这个问题,一个研究团队开发了一种名为 CAST 的新方法,它在模型生成答案的过程中充当实时引导者。该系统并不依赖于昂贵且往往过于宽泛而难以发挥作用的人体解剖预标注图,而是教会模型寻找对给定问题而言最重要的特定微小区域。研究人员发现,通过自动识别这些紧凑的区域并使用两步纠正过程,他们可以显著减少模型产生的错误说法。该方法完全在模型思考时运作,不需要额外的训练,也不需要人类专家预先绘制器官轮廓。

核心问题在于这些模型目前处理视觉信息的方式。当被问及一个问题时,它们通常会同时观察整个图像,这会导致它们关注无关细节,或者依赖于它们记忆中的通用知识,而非实际可见的内容。以往的修复尝试涉及使用“地面真值”(ground truth)标注,即由人类专家在相关的身体部位周围绘制精确的轮廓来引导 AI。然而,研究人员发现,这些人工绘制的轮廓通常过于庞大,覆盖了过多的图像区域,从而稀释了回答问题所需的特定视觉线索。这就像是试图通过指向整堆干草来寻找其中一根特定的针,信号会在噪声中丢失。

CAST 框架通过首先利用一个独立的、专门的分割工具提出各种潜在的解剖区域来解决这一问题。随后,它扮演一个选择器的角色,测试每个候选区域,以确定哪一个区域真正对答案负责。它通过模拟一个“如果……会怎样”的情景来进行:它暂时隐藏或模糊每个候选区域,并观察模型的答案置信度下降了多少。如果隐藏某个特定的微小区域会导致模型失去确定性,那么该区域就被识别为关键证据。系统专门寻找那些既足够大到能包含相关证据,又足够小以避免包含干扰背景信息的紧凑区域。这一过程使系统能够在无需任何人类标签的情况下,自动发现 X 光片或 MRI 上持有问题的关键位置。

一旦确定了最相关的区域,系统就会通过一种统一策略来引导模型的生成过程,同时纠正两类错误。首先,它确保模型正在关注正确的地方。它通过比较模型在看到完整图像时的预测与在关键区域被隐藏时的预测来进行。通过放大这两种视图之间的差异,系统迫使模型将注意力集中在特定的解剖学证据上,而不是根据剩余图像进行猜测。其次,它在答案书写过程中调节信息的流动。系统会将当前生成的词汇与前一步进行比较,抑制那些似乎偏离视觉证据的词汇,并强化那些牢牢扎根于模型所见内容的词汇。这种双重方法确保了模型在构建整个句子时都能锚定在图像上。

研究人员在三个不同的医学 AI 模型上测试了这种方法,使用了包含数千张胸部 X 光片和其他医学扫描图像的两个主要数据集。结果显示,准确率得到了持续且显著的提升,特别是在需要明确回答“是”或“否”的问题上。在一项特定测试中,该方法将一个领先模型在封闭式问题上的准确率从大约 61% 提升到了 81% 以上。这一进步是在没有任何底层模型重新训练且没有任何人工标注的情况下实现的。研究还将其方法与依赖于人类绘制的地面真值掩码的方法进行了对比。令人惊讶的是,自动选择的紧凑区域比人类绘制的掩码提供了更好的引导,因为后者往往过于粗糙且覆盖面积过大。数据表明,当引导掩码覆盖超过 40% 的图像时,性能实际上会下降,这证实了精准度和紧凑性比宽泛的覆盖范围更有价值。

除了数字之外,研究人员还检查了该方法成功而其他方法失败的具体案例。在一个涉及胸部 X 光片的案例中,一个标准模型和一个使用人类绘制框的方法都未能检测出一个细微的医疗器械,因为引导区域太大,模糊了器械尖端的特定细节。而 CAST 系统通过隔离器械周围一个极小的精确区域,正确识别了它的存在。在另一个涉及脑部扫描的案例中,模型需要识别包含该器官的身体部位。虽然其他方法错误地聚焦于器官本身,但新系统通过选择一个突出显示周围颅骨特征的紧凑掩码,正确识别了头部为所在位置。这些例子证明,动态选择正确区域的能力对于应对医学影像中的细微差别至关重要。

整个过程设计得既快速又高效,能够无缝融入模型生成答案的时间内。初始区域的提议被缓存起来,且选择过程仅涉及简短的评估,为整个系统增加了微不足道的延迟。这使得该方法在实际部署中具有可行性,提供了一种在不承担沉重的重新训练负担或不需要大量专家标记数据的情况下,让医学 AI 变得更加可靠和值得信赖的方法。通过教会模型如何自行在干草堆中寻找那根针,研究人员为减少错误并确保 AI 生成的医学见解始终牢牢基于其面前的视觉证据提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →