← 最新论文
💻 computer science

VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs

该论文提出了一种无需训练的 VGS-Decoding 方法,通过计算视觉 grounding 分数来动态调整解码概率,有效抑制了医疗视觉语言模型在推理过程中因过度依赖语言先验而产生的幻觉,并在多个基准测试中显著提升了生成内容的准确性与召回率。

原作者: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 VGS-Decoding 的新方法,专门用来解决医疗人工智能(AI)在“看图说话”时容易胡编乱造(幻觉)的问题。

为了让你轻松理解,我们可以把医疗 AI 想象成一位刚入职的实习医生,而 VGS-Decoding 就是他的**“防忽悠听诊器”**。

1. 问题:实习医生为什么会“胡编乱造”?

现在的医疗 AI(视觉语言模型)非常聪明,能看懂 X 光片、CT 片,并回答医生的问题。但是,它们有一个致命的弱点:太依赖“死记硬背”的常识,而不是真正“看”图片。

  • 比喻:想象这位实习医生背过一本厚厚的《医学题库》。当病人问:“心脏在左边还是右边?”
    • 正常情况:医生会看 X 光片,确认心脏位置,然后回答。
    • 幻觉情况:如果 X 光片有点模糊,或者医生走神了,他可能会想:“哎呀,99% 的人心脏都在左边,书上也是这么写的。”于是,即使图片里心脏在右边,他也会自信地回答“在左边”。
    • 后果:在医疗领域,这种“自信的错误”可能导致误诊,非常危险。

2. 核心发现:如何识别“胡编乱造”?

作者发现了一个有趣的现象:真正看图得出的结论,和图片质量有关;而靠死记硬背得出的结论,和图片质量无关。

  • 比喻
    • 看图说话(靠谱):如果你把 X 光片弄脏一点、模糊一点(比如加层噪点),医生就看不清了,他回答“心脏在右边”的信心就会下降
    • 死记硬背(胡编):如果医生是背答案,哪怕你把图片涂成黑块,他依然会自信满满地回答“心脏在左边”,因为他的答案来自脑子里的“题库”,而不是眼前的图片。

3. 解决方案:VGS-Decoding(防忽悠听诊器)

作者发明了一种不需要重新训练 AI,就能在 AI 回答问题时实时“纠错”的方法,叫 VGS-Decoding

它的工作流程就像这样:

  1. 双重检查:当 AI 准备回答一个问题时,系统会同时做两件事:
    • 让 AI 看原图
    • 让 AI 看一张被人为弄脏、模糊的“坏图”(加了噪点)。
  2. 计算“视觉依赖分” (VGS)
    • 系统比较 AI 对这两个图给出的答案概率。
    • 如果 AI 看“坏图”时,某个词(比如“肿瘤”)出现的概率大幅下降,说明这个词是真的看图看出来的(得分高,靠谱)。
    • 如果 AI 看“坏图”时,某个词(比如“左肺”)出现的概率没变甚至更高,说明这个词是瞎编的(得分低,危险)。
  3. 动态调整
    • 系统会像一个严厉的导师,放大那些“看图看出来的”靠谱词汇的概率。
    • 同时压制那些“瞎编乱造”的词汇概率。
    • 对于那些无关紧要的词(比如“是”、“的”),保持原样。

4. 为什么这个方法很厉害?

  • 不用重新培训:就像给现有的 AI 戴上一副“防忽悠眼镜”,不需要花几个月去重新教它,直接就能用。
  • 精准打击:以前的方法像“大锤砸核桃”,不管三七二十一,把可能错的词都删掉,结果把对的词也删了。VGS-Decoding 像“手术刀”,只切掉那些真正“不靠谱”的词,保留正确的。
  • 效果显著:在测试中,这个方法让几款主流的医疗 AI 准确率提升了 9% 左右。更重要的是,以前的方法有时候会让 AI 变得更笨(准确率下降),但这个方法对所有的 AI 都有帮助,没有副作用。

总结

简单来说,VGS-Decoding 就是给医疗 AI 装了一个实时质检员

当 AI 想回答“这是什么病”时,质检员会悄悄把图片弄模糊一下,看看 AI 是不是真的“看清”了。如果 AI 在模糊图片下依然坚持某个答案,质检员就会说:“嘿,你这是在背答案吧?别乱说!”然后强行修正 AI 的回答。

这让医疗 AI 在临床应用中变得更加诚实、可靠,减少了因为“过度自信”而导致的医疗风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →