← 最新论文
💻 computer science

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

本文提出了一种名为 CAST 的方法,该方法无需训练且即插即用,通过利用标题引导的注意力模式来引导视觉感知,从而在不显著增加推理成本的情况下缓解大型视觉 - 语言模型中的物体幻觉问题。

原作者: Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《CAST:通过标题引导的视觉注意力转向缓解大型视觉 - 语言模型中的物体幻觉》的解释,将其拆解为简单概念并辅以富有创意的类比。

问题: “过度自信的艺术家”

想象一个大型视觉 - 语言模型(LVLM)是一位才华横溢的艺术家,它看过数百万张图片,读过数百万本书。这位艺术家非常擅长描述所见之物。然而,它有一个坏习惯:它有时会“产生幻觉”

如果你给它看一张摩托车的图片,它可能会自信地说:“我看到一辆摩托车和一顶头盔”,尽管图片中根本没有头盔。由于在训练数据中它习惯了看到摩托车与头盔成对出现,它便假设头盔就在那里。它将记忆置于眼前实际看到的内容之上。

发现: “标题开关”

研究人员注意到这位艺术家的思考方式有一个有趣之处:他们发现,根据你提问方式的不同,这位艺术家的表现也会不同:

  1. “标题”模式:如果你问:“请详细描述这张图片”,这位艺术家就会高度专注于图像的实际像素。它会仔细观察图片的每一个部分。
  2. “问题”模式:如果你问一个具体问题,比如:“图片里有头盔吗?”,这位艺术家就会分心。它更多地依赖记忆和假设,从而导致那些虚假的“幻觉”。

类比:把这位艺术家想象成一名侦探。

  • 当你要求它“撰写一份完整报告”(标题查询)时,它会一丝不苟地检查犯罪现场照片上的每一个线索。
  • 当你向它提出一个“是/否问题”(非标题查询)时,它会变得不耐烦,跳过照片,并根据它认为通常会发生的情况来猜测答案。

解决方案:CAST(“注意力方向盘”)

研究人员创造了一种名为CAST(标题引导的视觉注意力转向)的方法。他们不想重新训练这位艺术家(那将耗时数年且耗资巨大)。相反,他们想给这位艺术家一个“方向盘”,以便在回答问题的同时修正其注意力焦点。

CAST 的工作原理分为三个简单步骤:

1. 寻找“焦点头”(探测)

在 AI 模型内部,有数千个微小的“注意力头”(可以将其想象为工厂里不同的微小工人)。研究人员使用了一项测试,以找出当艺术家处于“标题模式”(仔细观察图像)与“问题模式”(猜测)时,具体是哪些工人在活跃。

  • 隐喻:他们识别出了那些特定的“注重细节的检查员”工人。这些是真正查看照片而不是猜测的人。

2. 计算“校正向量”(估算)

研究人员精确测量了这些“注重细节的检查员”在从猜测切换到详细描述时,其行为发生了多大变化。他们计算出了一个“偏移向量”——一个代表“更仔细地观察图像”的数学方向。

  • 隐喻:这就像测量懒惰的猜测与仔细检查之间的差异。他们创建了一张“地图”,精确显示了如何微调艺术家的思维,使其转向仔细检查。

3. 引导注意力(推理时干预)

现在,当艺术家被问及棘手的问题(如“有头盔吗?”)时,CAST 会轻轻推动那些“注重细节的检查员”,使其表现得像在“标题模式”中一样。它迫使它们在回答之前再次查看图像像素。

  • 隐喻:想象艺术家正要猜测“是的,有头盔”。就在它开口之前,CAST 轻轻拍了拍它的肩膀说:“等等!像你要撰写完整描述时那样,再看一遍照片。”艺术家看了看,发现没有头盔,于是将答案修正为“没有”。

为何这很特别

  • 无需重新训练:通常,要纠正一个坏习惯,你必须让艺术家回校学习数月(重新训练)。CAST 就像给它们一张快速提醒便条。它无需改变模型的“大脑”即可立即生效。
  • 快速且廉价:其他方法试图通过多次运行问题来迫使模型三思,这非常缓慢。CAST 只是微调内部焦点,因此几乎不增加延迟。
  • 处处适用:研究人员在五种不同类型的 AI 模型和五种不同的测试中对此进行了测试。在每种情况下,模型关于不存在物体的错误都减少了。

结果

通过使用这种“转向”技术,模型将其物体幻觉(凭空捏造)平均减少了6%。更重要的是,它们没有失去正确回答其他问题的能力;它们只是对实际在图片中看到的内容变得更加诚实。

简而言之:CAST 教导 AI 停止猜测并开始观察,方法是借用它在被要求描述图像时已经具备的“仔细观察”习惯,并将这些习惯应用于它回答的每一个问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →