← 最新论文
🤖 AI

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

本文将“注意力分散”(Attention Distraction)识别为检索增强型大型视觉语言模型中一种新颖的失效模式,即相关的检索文本会抑制视觉注意力,并提出了 MAD-RAG,一种通过将视觉定位与上下文整合解耦来显著缓解这一问题的无需训练的方法。

原作者: Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对论文 "When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs" 进行的解析。

核心问题:那位“过度热心”的图书管理员

想象你正在参加一场视觉问答测试。你的面前有一张照片,你需要根据这张照片回答一个问题。

  • 闭卷模式(Closed-Book Mode): 你仅依靠自己的记忆和看到的照片来回答。
  • RAG(检索增强生成): 一位图书管理员递给你一叠参考书(检索到的文本),来帮助你回答问题。

通常,我们认为图书管理员总是乐于助人的。但本论文发现了一个奇怪的漏洞:有时,即使书里的信息是正确的,图书管理员反而会导致你答错。

作者将这个漏洞称为**“注意力分散”(Attention Distraction, AD)**。它以两种特定的方式发生:

1. 跨模态分散(“忽略图片”效应)

当图书管理员把那些书递给你时,你的大脑突然停止观察照片。你变得过于专注于阅读文本,以至于忘记了观察视觉证据。

  • 类比: 想象你正试图在停车场里识别一辆车。图书管理员递给你一本关于汽车引擎的手册。你开始非常投入地阅读手册,结果停止了对车辆本身的观察。你可能通过书本正确猜出了引擎类型,但你却忽略了那辆车实际上是一辆摩托车。文本“分散”了你的注意力,让你看不见图像。

2. 图像内分散(“看错照片部位”效应)

即使你在看照片,文本的存在也会让你看向照片中错误的部分。你不再关注问题提到的重要物体,而是将目光转向背景或无关的细节。

  • 类比: 问题是“球员手里拿着什么?”在照片中,球员手里拿着一只球棒。但因为你正在阅读一段关于棒球规则的文本,你的目光漂移到了背景中的观众或草地上。你错过了球棒,因为你的注意力被“分散”到了关键视觉线索之外。

为什么会发生这种情况?

论文解释说,大型视觉语言模型(LVLMs)通过为不同的单词和像素分配“注意力”(重要性)来工作。

  • 闭卷模式下,模型会对与问题相关的图像 Token(标记)投入高度注意力。
  • RAG 模式下,来自图书管理员的长文本会“挤占”图像的空间。模型的内部机制会被大量的文本搞混,导致它抑制了视觉专注力。这就像是在一个安静的房间里交谈(闭卷)与在嘈闻的音乐会上交谈(RAG)的区别:噪声(文本)淹没了微弱的信号(视觉细节)。

解决方案:MAD-RAG

为了解决这个问题,作者创建了一种名为 MAD-RAG(缓解检索增强生成中的注意力分散)的方法。这是一个“无需训练”(training-free)的技巧,意味着你不需要重新训练 AI 模型,只需在测试期间改变其处理信息的方式。

MAD-RAG 使用了两个聪明的策略:

1. “双问题”设置(分工协作)

与其在展示图像和文本后只问 AI 一个问题,MAD-RAG 会在不同的位置询问同一个问题两次

  • 问题 1(图像问题): 紧跟在图像之后。它的唯一任务是观察图片并寻找视觉线索。

  • 问题 2(上下文问题): 放在图书管理员的书籍之后。它的任务是阅读文本并将信息与答案结合起来。

  • 类比: 想象你有两个助手。

    • 助手 A 站在照片旁边。你告诉他:“只需告诉我你从照片中看到了与这个问题相关的什么内容。”
    • 助手 B 站在书本旁边。你告诉他:“阅读这些书,并将这些信息与助手 A 看到的内容结合起来。”
    • 通过分离角色,助手 A 不会被书籍分散注意力,而助手 B 则能获得一份清晰的视觉报告来辅助工作。

2. 注意力混合(融合两者的精华)

AI 往往会随着阅读文本的增加而逐渐忘记图像(这是一个被称为“近因偏差”的问题)。MAD-RAG 强制要求 AI 将助手 A 的“视觉专注力”融入到助手 B 的“文本推理”中。

  • 类比: 这就像是将浓咖啡(视觉证据)与牛奶(文本语境)混合在一起。如果你只喝牛奶,味道太淡;如果你只喝咖啡,味道太冲。MAD-RAG 确保最终的这杯饮品拥有正确的平衡,从而让 AI 在阅读文本时不会忘记视觉线索。

实验结果

论文表明,这个简单的技巧效果显著:

  • 它修复了错误: 在那些“没有书时正确,有了书反而出错”(即注意力分散案例)的情况下,MAD-RAG 修复了高达 74.68% 的错误。
  • 它很快: 它几乎不增加额外的处理时间(仅比标准方法慢约 10%)。
  • 它优于其他修复方法: 它明显优于其他试图解决类似问题的现有方法,领先幅度很大。

总结

简而言之,这篇论文指出,给 AI 过多的文本有时会使其对它本应分析的图像变得“失明”。MAD-RAG 通过将任务拆分为两个部分——一个专注于“看”,一个专注于“读”——然后仔细地融合结果,从而确保 AI 不会丢失对图片的观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →