← 最新论文
💻 computer science

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

该论文提出了一种名为 DOP-OBC 的免训练解码策略,通过抑制对视觉主导区域的过度关注并增强对稀有物体的注意力,有效解决了多模态大语言模型中的物体幻觉问题并提升了视觉对齐的公平性与准确性。

原作者: Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 DOP-OBC 的新方法,旨在解决多模态大模型(MLLMs,即能看懂图片并说话的 AI)经常“瞎编”物体(幻觉)的问题。

为了让你轻松理解,我们可以把 AI 看成一个正在描述图片的“解说员”,而这张图片里有很多不同的物体。

1. 核心问题:为什么 AI 会“瞎编”?

想象一下,你让 AI 描述一张照片。照片里有一辆巨大的、显眼的红色摩托车,旁边还有一个穿着白 T 恤的小女孩,她正扶着一辆自行车。

  • 现状(普通 AI): 这个解说员(AI)太关注那辆“大摩托车”了。因为摩托车很大、很显眼,解说员的注意力(Attention)就像聚光灯一样,死死地照在摩托车上,甚至把摩托车的光照得太亮,导致旁边的小女孩和自行车完全被“淹没”在阴影里,看不见也听不见了。
  • 结果: 解说员开始胡编乱造。他可能会说:“看,这有个骑摩托车的人,后面还有一辆卡车(其实没有)。”因为他没看到小女孩,所以为了填补空白,他只能靠“猜”或者靠脑子里的“老经验”(语言先验)来编故事。这就是所谓的物体幻觉

论文发现: 问题的根源不在于 AI“看”不到(它的眼睛是好的),而在于它“分配注意力”的方式不公平。它总是把大部分精力花在那些大物体上,忽略了小物体。

2. 解决方案:DOP-OBC(公平分配注意力)

为了解决这个问题,作者设计了一个不需要重新训练模型的“小插件”,就像给解说员戴上了一副**“公平眼镜”**。这副眼镜有两个神奇的功能:

功能一:DOP(主导物体惩罚)—— “给大明星降降温”

  • 比喻: 当那个“大摩托车”试图霸占所有聚光灯时,DOP 就像一位冷静的导演。它会轻轻按下一点摩托车的音量,或者把聚光灯稍微调暗一点。
  • 作用: 这不会让摩托车消失,但会防止它“喧宾夺主”,从而腾出更多的“注意力空间”给其他物体。

功能二:OBC(异常值提升系数)—— “给小人物加个麦克风”

  • 比喻: 那个“小女孩”虽然小,但 AI 其实已经看清了她(置信度高)。OBC 就像给小女孩递了一个扩音器
  • 作用: 它会专门放大那些“虽然不起眼、但被 AI 确认存在”的物体的声音,确保解说员能听到并描述出她们。

3. 它是如何工作的?(简单版)

在 AI 生成文字的过程中(解码阶段),这个插件会实时做两件事:

  1. 压制那些已经被过度关注的物体(防止它们垄断注意力)。
  2. ** Boost(增强)** 那些稀有但被确认存在的物体(防止它们被忽略)。

这就像是在一场会议中,如果一个人说话声音太大,主持人就稍微压低他的麦克风;如果角落里有个重要的小人物想发言,主持人就立刻把麦克风递给他。

4. 效果如何?

论文通过大量实验证明,戴上这副“公平眼镜”后:

  • 不再瞎编: AI 描述图片时,不再会编造不存在的物体(比如那辆不存在的卡车)。
  • 描述更全: AI 能同时描述出摩托车小女孩,甚至背景里的路牌、树木等细节。
  • 通用性强: 这个方法不需要重新训练模型,可以像“插件”一样直接装在任何现有的 AI 模型上(无论是看图的还是看视频的)。

总结

这篇论文的核心思想是:“眼见为实,但更要公平分配注意力”。

以前的 AI 像个势利眼,只关注大人物(大物体),忽略了小人物(小物体),导致它为了填补空白而撒谎。
现在的 DOP-OBC 方法,通过一种聪明的“平衡术”,让 AI 学会公平地对待图片里的每一个物体。结果就是,AI 变得更诚实、更靠谱,描述出的世界也更完整、更真实。

一句话概括: 给 AI 戴上“公平眼镜”,让它不再只盯着大物体看,而是能看见并描述出画面中所有真实存在的东西,从而不再“瞎编乱造”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →