← 最新论文
💻 computer science

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

该论文提出了一种名为置信度感知注意力校准(CAAC)的无训练框架,通过视觉令牌校准和自适应注意力重缩放两种策略,有效解决了大型视觉语言模型在开放域和长文本生成中因空间感知偏差和模态偏差导致的幻觉问题,并在多个基准测试中显著优于现有基线方法。

原作者: Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CAAC 的新方法,旨在解决大型视觉 - 语言模型(LVLM)的一个致命弱点:“幻觉”

简单来说,就是这些 AI 看图说话时,经常自信满满地胡说八道,描述图片里根本没有的东西。

为了让你更容易理解,我们可以把 AI 想象成一个**“有点健忘且爱脑补的导游”,而 CAAC 就是给这位导游配的一个“智能纠错耳麦”**。


1. 问题出在哪?(导游的两大毛病)

现在的 AI 导游在看图说话时,主要有两个坏习惯,导致它开始编故事:

  • 毛病一:管中窥豹(空间感知偏差)

    • 比喻:想象导游手里拿着一张巨大的地图(图片),但他只盯着地图上的某一个小红点看,完全忽略了周围的其他区域。哪怕那个红点只是地图上的一个噪点,他也会对着它滔滔不绝,而把真正的风景(比如一只猫、一棵树)给漏掉了。
    • 后果:AI 过度关注图片的某一部分,导致它“瞎编”其他部分的内容。
  • 毛病二:顾头不顾尾(模态偏差)

    • 比喻:导游刚开始介绍时,还老老实实看着地图(图片)。但聊着聊着,聊得久了,他就不看地图了,开始凭自己的记忆和想象接着编。他说:“刚才我们看了猫,接下来肯定还有一只狗……"其实图片里根本没有狗。
    • 后果:生成的内容越长,AI 越容易脱离图片,开始“自嗨”,导致长篇大论全是假话。

2. CAAC 是怎么解决的?(智能纠错耳麦)

作者设计了一个叫 CAAC 的框架,它不需要重新训练导游(不需要花钱重新教),而是在导游说话的过程中,实时通过两个步骤来“纠正”他:

第一步:视觉令牌校准 (VTC) —— “把目光拉回全景”

  • 作用:专门治“管中窥豹”。
  • 比喻:当导游死死盯着那个小红点时,CAAC 会轻轻拍一下他的肩膀,说:“嘿,别只盯着那一点,把目光放开阔点,看看整张地图!”
  • 操作:它强行调整导游的注意力,让他均匀地关注图片的各个部分,而不是只盯着某一个地方。这样他就不会漏掉真正的物体,也不会对着噪点瞎编。

第二步:自适应注意力重缩放 (AAR) —— “关键时刻拉回现实”

  • 作用:专门治“顾头不顾尾”。
  • 比喻:CAAC 里装了一个**“自信度探测器”**。
    • 当导游很有信心地说:“这是一只猫”时,CAAC 就让他自由发挥,不打扰他。
    • 当导游有点犹豫,或者开始说一些图片里可能没有的东西(比如“也许旁边还有只狗”)时,CAAC 的探测器就会报警:“等等!你现在的信心指数太低了,你是不是在瞎编?”
    • 这时候,CAAC 会立刻放大导游看图片的“音量”,强行把注意力拉回图片上,迫使他再次确认:“真的吗?图片里有狗吗?如果没有,就别说了!”
  • 操作:它根据 AI 对自己预测结果的“自信程度”,动态地调整它看图片的权重。越不确定,越要看图;越确定,越自由。

3. 效果怎么样?(导游变靠谱了)

作者用了很多测试(就像给导游做各种考试)来验证这个方法:

  • 短对话:AI 说得准,废话少。
  • 长文章:这是 CAAC 最厉害的地方。以前的方法在说长句子时容易“跑偏”,但 CAAC 能像一位负责任的监工,在导游聊了 500 个字后,依然能让他紧扣图片主题,不跑题、不瞎编。
  • 对比:在著名的“找茬”考试(CHAIR, AMBER 等基准测试)中,CAAC 比目前市面上最好的其他方法(比如 OPERA, VCD 等)表现更好,大大减少了胡说八道的情况。

总结

这篇论文的核心思想就是:
AI 看图说话容易“飘”,是因为它要么只盯着一点看,要么聊久了就忘了看图。

CAAC 就像一个实时的智能助手

  1. 一开始就帮它把视野拉宽,别只盯着一个点。
  2. 聊得越久,越在它拿不准的时候,强行把它拉回图片面前确认。

这样,AI 就能在生成很长的描述时,依然脚踏实地,言之有物,不再信口开河。这对于医疗诊断、自动驾驶等需要高度准确的领域来说,是非常重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →