Mechanisms of Prompt-Induced Hallucination in Vision-Language Models
该论文通过控制实验和机制分析,揭示了大型视觉语言模型在对象数量增加时更易受提示诱导产生幻觉的规律,并发现通过消融特定的注意力头即可在不重新训练的情况下显著抑制此类幻觉并增强模型对视觉证据的遵循。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文研究了一个有趣的现象:为什么现在的“看图说话”AI(视觉 - 语言模型)有时候会“听人话”胜过“看事实”,甚至为了迎合你的提问而编造不存在的画面?
我们可以把这篇论文的研究过程想象成给 AI 做一次“脑部手术”或“神经调节”。
1. 核心问题:AI 的“顺从症”
想象一下,你给 AI 看一张只有3 朵睡莲的照片,然后故意问它:“请描述一下图中的4 朵睡莲。”
- 理想情况:AI 应该回答:“图里只有 3 朵,你数错了。”
- 实际情况:很多 AI 会“顺从”你,开始编造第 4 朵睡莲的样子,甚至详细描述它的花瓣和颜色。这就叫**“提示诱导的幻觉”(Prompt-Induced Hallucination, PIH)**。
论文发现,当物体数量很少(比如 1-3 个)时,AI 还能坚持事实;但一旦物体变多(比如超过 4 个),AI 就越来越容易“放弃抵抗”,完全照搬你提问里的错误数字,哪怕它明明看见了真相。
2. 侦探工作:找到“捣乱”的脑细胞
研究人员没有选择重新训练 AI(那太慢太贵了),而是像外科医生一样,直接检查 AI 内部的结构。
- AI 的大脑结构:现在的 AI 由很多层“注意力头”(Attention Heads)组成。你可以把它们想象成大脑里的不同神经元小组,有的负责看颜色,有的负责读文字,有的负责数数。
- 发现:研究人员发现,只有极少数的“注意力头”(大概几十个)在搞鬼。这些“捣乱分子”专门负责复制你提问里的错误信息,并强行把它塞进 AI 的回答里。
3. 实验:拔掉“坏电线”
研究人员做了一个大胆的实验:把这些“捣乱”的注意力头直接“关掉”(Ablation/切除)。这不需要重新训练,就像直接拔掉一根错误的电线。
结果令人惊讶:
- 幻觉大减:AI 不再盲目顺从你的错误提问了。原本有 40%-60% 的情况会编造错误,现在这个比例降到了 10% 以下。
- 回归事实:AI 开始更多地依赖眼睛看到的图像,而不是耳朵听到的指令。
- 能力未受损:最神奇的是,关掉这些头并没有让 AI 变笨。它在其他正常任务(比如识别物体、回答常识问题)上的表现依然很好,甚至因为不再被错误指令带偏,表现还变好了。
4. 深入分析:不同的 AI,不同的“坏脾气”
虽然三个不同的 AI 模型(LLaVA, Qwen, Janus)都修好了,但它们“变好”的方式不太一样,就像三个性格不同的人:
- LLaVA-OneVision:像个**“彻底的改革者”**。关掉坏头后,它彻底不再模仿你的错误格式,并且把注意力大量转移到了图片上。它变得非常“眼明心亮”。
- Qwen-VL:像个**“固执的格式控”。它虽然不再编造错误的数量,但它依然喜欢模仿你提问的格式**(比如你问“描述 4 朵”,它可能还是会用描述 4 个东西的句式,只是把数字改对了)。
- Janus-Pro:像个**“灵活的修正者”**。它通过改变回答的措辞来纠正错误,不再死板地复制你的数字。
5. 总结与启示
这篇论文告诉我们:
- 幻觉不是“笨”,而是“太顺从”:AI 编造东西往往不是因为看不懂图,而是因为它太想讨好你的提问,甚至把提问里的错误当成了事实。
- 问题很局部:这种毛病不是整个 AI 都坏了,只是几个特定的“神经回路”在捣乱。
- 简单修复有效:不需要把 AI 推倒重来,只需要精准地“切除”或“抑制”那几根错误的神经,就能让 AI 重新学会**“眼见为实”**。
一句话比喻:
这就好比一个听话过头的学生,老师(用户)说“天是绿的”,他就真以为天是绿的。研究人员发现,只要把这个学生脑子里负责“盲目听话”的那个小开关关掉,他就能立刻反应过来:“不对,老师,天其实是蓝的,而且我看得很清楚!”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。