← 最新论文
💻 computer science

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

本文提出了一种名为 MHSA 的轻量级框架,该框架通过训练一个简单的多层感知机来生成修正后的跨模态注意力模式,从而在不修改底层模型参数的情况下,在多种数据集上实现幻觉抑制。

原作者: Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的图书管理员(即人工智能),他能够查看一张照片并为你讲述其中的故事。这位图书管理员才华横溢,但他有一个坏习惯:有时,他会因为过于兴奋或自信,而开始编造照片中实际上并不存在的细节。他可能会说:“我看到一辆红色的自行车”,而实际上照片拍摄的只是一个没有任何自行车的宁静公园。这种现象被称为幻觉

你提供的论文介绍了一种名为MHSA(通过引导注意力缓解幻觉)的新工具,旨在解决这一问题,而无需解雇这位图书管理员或从头重新训练他。

以下是 MHSA 的工作原理,使用简单的类比来说明:

1. 问题:图书管理员的“目光”

当图书管理员查看照片以回答问题时,他并非一次性审视整张图片。他会将“目光”(称为注意力)聚焦在图像的特定部分,以此决定该说什么。

  • 问题所在:当图书管理员产生幻觉时,他的目光往往是“摇摆不定”的,或者看向了错误的地方。例如,如果他说“我看到一只狗”,他的目光可能正飘过一片看起来像狗的草地,而不是聚焦在真正的狗身上。
  • 以往的尝试:在这篇论文之前,研究人员可以构建一个“保安”(检测器)来发现图书管理员何时在撒谎。但这个保安只能说:“嘿,你在产生幻觉!”它无法实时修正图书管理员的目光。其他方法试图用僵硬的规则强迫图书管理员更努力地看,但这些规则就像试图用一把坏掉的方向盘来驾驶汽车——过于僵硬且缺乏适应性。

2. 解决方案:“方向盘”(MHSA)

MHSA 就像是一个安装在图书管理员目光上的智能、轻量级方向盘。它并不取代图书管理员;它只是在图书管理员的目光开始游移时,轻轻地将其推回正确的方向。

以下是逐步过程:

  • 步骤 1:检查(保安):在图书管理员给出最终答案之前,一个小型的、经过预训练的“保安”(基于名为 DHCP 的先前研究)会快速扫描图书管理员当前的目光。它会问:“图书管理员是否在看正确的东西,还是他在编造内容?”
  • 步骤 2:轻推(生成器):如果保安回答“是的,他们在产生幻觉”,一个微小、快速的计算机程序(一个被称为生成器的简单三层“大脑”)就会介入。
    • 可以将这个生成器想象成一位纠正教练。它观察图书管理员摇摆的目光,并计算出一个微小的调整量。
    • 它不会重写整个故事;它只是轻微地移动目光,使其落在照片中实际存在的物体上。
  • 步骤 3:修正:图书管理员的目光被“引导”到新的、正确的位置,然后他根据此刻实际看到的内容给出答案。

3. 为何这很特别?

论文强调了该方法的三个主要优势:

  • 轻量级(“附加组件”方法):想象你有一座庞大而昂贵的图书馆建筑(即大型 AI 模型)。你不需要将其拆除并重建。MHSA 就像是在入口处添加的一个小型便携式亭子。它训练一个微小、简单的助手来修正目光,而让庞大的图书馆保持原样。这节省了巨大的时间和金钱。
  • 它是学习的,而不仅仅是猜测:旧方法使用固定规则(例如“总是看中心”)。MHSA 则不同;它通过观察成千上万个“坏目光”和“好目光”的示例来学习如何修正目光。它能适应图书管理员当下正在犯的具体错误。
  • 它既适用于“是/否”问题,也适用于故事生成
    • 判别式任务:如果你问“有飞机吗?”,如果实际上没有,MHSA 会帮助图书管理员正确地回答“没有”。
    • 生成式任务:如果你要求图书管理员为照片写一个故事,MHSA 会在他们逐字撰写故事的过程中,帮助他们避免编造细节(例如编造不存在的“罐头食品”)。

4. 结果

研究人员在几种不同类型的聪明图书管理员(如 Qwen、InternVL 和 LLaVA 等 AI 模型)上测试了这个“方向盘”。

  • 结果:图书管理员犯的错误显著减少。他们不再编造不存在的物体,并开始注意到以前忽略的物体。
  • 权衡:该系统非常高效,仅增加了微小的延迟(约为正常速度的 0.4 倍),因为它仅在检测到问题时才“引导”目光。大多数时候,图书管理员的目光本来就在正确的位置,因此方向盘处于闲置状态。

总结

简而言之,MHSA 是一个巧妙、低成本的附加组件,充当 AI 的实时目光修正器。它不是强迫 AI 从头学习一切,而是在 AI 开始做白日梦时,温柔地将其注意力引导回现实,从而在不进行大规模改动的情况下,使 AI 更加可靠和值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →