VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering
本文提出了一种名为 VIHD 的新型医疗视觉问答幻觉检测方法,该方法通过识别视觉主导的解码器层并应用针对性的视觉令牌掩码来校准语义熵,从而改进了现有方法,更有效地检测缺乏视觉证据的幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位高度智能的医疗 AI 助手,它能够查看 X 光片或 MRI 扫描图像,并回答你关于这些图像的问题,例如“这张图像中的肿块是什么?”或“是否存在骨折?”这就是多模态大语言模型(MLLM)。尽管这些模型极其聪明,但它们有一个危险的习性:有时会“产生幻觉”。
将幻觉想象成一个自信的骗子。AI 可能会说:“我看到一个肾囊肿”,即使图像中除了健康组织外什么都没有。这句话在语法上完美无缺,但完全是编造的。在医院里,这可能导致医生基于谎言做出错误的决定。
本文介绍了一种名为VIHD(基于视觉干预的幻觉检测)的新工具,旨在在谎言造成麻烦之前将其识破。以下是其工作原理,通过简单的类比进行解释:
问题所在:“黑盒”侦探
以往的方法试图通过反复向 AI 提出相同的问题,或轻微修改问题(例如,问“有囊肿吗?”与“有肿瘤吗?”)来识破这些谎言。
- 缺陷: 这就像询问证人:“你看到那辆红色的车了吗?”然后再问“你看到那辆蓝色的车了吗?”,以此观察他们是否会感到困惑。这有点像猜测。它并没有真正深入 AI 的“大脑”内部,去查看它是否真的在观察图像,还是仅仅基于以往听到的内容在编造。
解决方案:VIHD(“聚光灯”方法)
VIHD 则不同。它不仅仅是提问,而是对 AI 的思维过程进行“手术”,以观察它在多大程度上真正依赖图像。它分为三个步骤:
1. 寻找“眼睛”(视觉依赖探测)
想象 AI 的大脑由许多层神经元组成,就像一座多层建筑。当它回答问题时,它会在某些“房间”里查看图像,而在其他“房间”里则忽略图像。
- VIHD 的做法: 它穿梭于这座建筑之中,找出 AI 实际查看图像的具体楼层(解码器层)。这就像找到侦探正盯着犯罪现场照片的那个特定房间,而不是那个侦探只是在白日做梦的房间。
2. “蒙眼”测试(视觉干预解码)
一旦 VIHD 找到了正确的房间,它就会进行一项针对性的实验。它识别出 AI 正在聚焦的图像特定部分(例如 X 光片上的某个暗斑),并暂时“致盲”AI,使其无法看到这些部分。
- 类比: 想象你在描述一张猫的照片。如果你遮住猫的耳朵,然后问“这是什么动物?”,你仍然自信地回答“猫”,那没问题。但是,如果你遮住猫的脸,而 AI 突然开始猜测“这是一只狗!”或“这是一个烤面包机!”,那就是一个巨大的红色警报。
- 目标: VIHD 会遮蔽(隐藏)AI 所使用的最重要的视觉线索。如果 AI 的回答发生剧烈变化或变得困惑,就证明 AI 确实在查看图像。如果即使图像被隐藏,AI 仍然给出同样自信的答案,那就意味着 AI 只是在凭记忆猜测(产生幻觉)。
3. 测量“困惑度”(校准语义熵)
最后,VIHD 将 AI 的原始答案与其在“蒙眼”状态下给出的答案进行比较。
- 指标: 它计算一种称为“校准语义熵”的数值。你可以将其视为一个困惑度评分。
- 低困惑度: 无论图像是否存在或被隐藏,AI 都给出相同的答案。这对于检测来说实际上是好的,因为这意味着 AI 是一致的;但如果答案从一开始就是错的,系统也会将其标记出来。
- 高困惑度: 当图像被隐藏时,AI 的答案剧烈波动。这种高“波动”或“离散度”是 AI 依赖不稳固视觉证据的信号。VIHD 利用这一高分来发出警告:“警告:此答案很可能是幻觉。”
为何更优
该论文在三个不同的医疗数据集(涵盖 CT 扫描、MRI 和 X 光片)和两个不同的 AI 模型上测试了该方法。
- 结果: VIHD 在识破谎言方面比以往的方法出色得多。它不需要在新数据上进行重新训练(即“无需训练”),也不需要调用第二个 AI 来检查工作。
- 类比: 以往的方法就像保安检查访客的身份证。而 VIHD 则像测谎仪,检查访客在查看证据时心率是否飙升。
总结
简而言之,VIHD 是一种通过暂时隐藏图像中最关键的部分并观察 AI 的回答是否崩溃,从而识破医疗 AI 幻觉的工具。如果 AI 确实在查看图像,隐藏部分图像会改变它的判断。如果 AI 只是在编造,它将察觉不到差异,而 VIHD 会将其标记为潜在错误。这有助于确保当 AI 提供医疗建议时,它确实在查看患者的扫描图像,而不仅仅是在猜测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。