System-Mediated Attention Imbalances Make Vision-Language Models Say Yes
本文提出了一种全新的视角,认为视觉语言模型(VLM)的“是”偏见(yes-bias)幻觉源于系统权重对图像和文本注意力的过度挤占,并通过将注意力从系统模态重新分配给输入模态,能有效抑制该幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章的研究非常有意思,它揭示了为什么现在的“多模态大模型”(也就是既能看图又能说话的 AI,比如 LLaVA)有时候会变成一个“没脑子的复读机”,只会对着你的问题说“是”(Yes)。
为了让你听懂,我们把这个 AI 想象成一个正在参加闭卷考试的学生。
1. 问题的核心:AI 的“注意力分配不均”
在考试时,这个学生面前有三样东西:
- 题目(Text/文本):考卷上的文字。
- 参考图(Image/图像):题目配的插图。
- 考场规则(System/系统指令):比如“请用中文回答”、“请简短回答”等背景信息。
目前的普遍观点(图像中心论):
很多科学家认为,AI 之所以会“胡说八道”(幻觉),是因为它**“看图不认真”**。就像学生考试时,眼睛只盯着文字看,根本没看图,所以答错了。于是,大家都在想办法让 AI “多看图”。
这篇文章的新发现(系统介导论):
作者发现,问题可能根本不在于“看图不够”,而在于**“考场规则(系统信息)太吵了”**!
2. 一个生动的比喻:那个“爱抢戏”的背景音
想象一下,这个学生在考试时,耳朵里一直塞着一个巨大的、循环播放的背景音乐(这就是所谓的“系统权重”)。这个音乐虽然不包含任何考试知识,但它声音极大,占据了学生 70% 以上的注意力。
因为这个“背景音乐”太吵了,学生为了省事,大脑会自动进入一种**“节能模式”**:
- 他不再去仔细观察图片里的细节(比如:这只猫是黑色的还是白色的?)。
- 他也不再去仔细研读文字里的微小差别(比如:题目问的是“有没有”还是“是不是”?)。
- 结果: 他的大脑直接跳过了复杂的思考过程,直接根据一种“直觉”来回答。而这种直觉在很多情况下,就是简单粗暴地回答:“是!”
这就是所谓的 “Yes-bias”(是偏见)。AI 并不是真的看到了,它只是因为被“背景音”吵得没法思考,所以选择了最省力的回答方式。
3. 作者是怎么做的?(“调音师”实验)
作者没有像以前的人那样强迫 AI “多看图”,而是做了一个大胆的实验:“调音”。
他们像调音师一样,把那个吵得要命的“系统背景音”(System Attention)关小声,然后把省下来的注意力,按比例分配给“题目”和“图片”。
实验结果非常惊人:
当背景音变小,学生终于能听清题目和看清图片时,他不再只会说“是”了,而是能根据事实给出准确的回答。这种方法的表现,比单纯强迫学生“多看图”的效果要好得多!
4. 总结:研究的意义
这篇文章告诉我们:
- AI 的幻觉不只是“没看到”,而是“被干扰了”。
- 解决办法不是单向的: 仅仅增加对图片的关注是不够的,关键是要削减那些无意义的、冗余的“系统噪音”,让 AI 的注意力回归到真正有用的信息(图片和文字)上。
一句话总结:
AI 之所以变笨只会说“是”,是因为它被自己的“系统指令”吵得没法认真看题;只要把“噪音”关小,让它把精力花在看图和读题上,它就能变聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。