← 最新论文
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

该论文提出了 HEAL,这是一个通过分析协同头(synergy heads)中的信息分布漂移,并应用动态校准以将输出引导向事实证据,从而识别并缓解多模态大语言模型中幻觉问题的创新框架。

原作者: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

多模态大语言模型是一类强大的新型人工智能,旨在同时实现视觉与语言的处理。与处理文本或图像的孤立传统系统不同,这些模型可以观察照片并进行描述、针对照片回答问题,或根据所见内容讲述故事。它们通过将两种截然不同的信息流编织在一起来工作:来自图像的视觉数据和从海量文本中学习到的语言模式。为了使这些系统在医疗影像或自动驾驶等高风险领域真正发挥作用,它们必须具备可靠性。然而,它们经常受到一种被称为“幻觉”的问题困扰。当模型生成的响应听起来自信且合理,但在视觉世界中却是事实错误时(例如,声称一张猫的照片包含一只狗,或者虚构图像中根本不存在的细节),就会发生这种情况。

长期以来,研究人员一直认为这些错误是由于模型过度关注其内部语言知识,而对实际图像关注不足造成的。普遍观点认为,随着模型生成答案的过程,它会偏离图像,过度依赖仅基于文字所预期的内容。为了解决这个问题,以往的尝试侧重于强迫模型更努力地观察图像,或者通过从头开始重新训练整个系统。这些方法通常将模型视为一个“黑盒”,仅从外部调整其行为,而不理解产生错误的内部机制究竟是什么。

深圳先进技术研究院的一个研究小组现在深入观察了这些模型的“引擎内部”,以寻找一个不同的解释。他们提出,幻觉并非由简单的缺乏图像注意力或模型完全忽略图像引起的。相反,他们发现,当模型内部特定处理网络中的视觉与语言信息之间的平衡变得不稳定时,错误就会发生。研究人员开发了一种名为 HEAL 的方法,即“头级信息解耦与校准”(Head-lEvel information disentAnglement and caLibration),用于实时识别并纠正这种不平衡。

他们的核心发现在于模型处理信息的方式。在这些大型模型内部,存在许多被称为“注意力头”(attention heads)的小型处理单元。可以将这些“头”想象成一组协同工作的专家团队,用以理解一个句子。有些专家纯粹关注单词,有些纯粹关注图像,而第三组专家则致力于将两者融合在一起。研究人员发现,负责融合这两股信息的这组专家——他们称之为“协同头”(synergy heads)——正是问题产生的源头。当模型正常工作时,这些协同头能维持健康的平衡,使视觉信息和语言信息保持稳定的比例。然而,当模型开始产生幻觉时,这种平衡就会发生偏移。这些融合头内部的信息分布会偏离健康的平衡状态,导致模型失去对视觉证据的锚定。

至关重要的是,研究人员排除了这样一种观点,即幻觉的发生是因为观察图像的专家不够多,或者图像专家的力量太弱。他们的分析表明,无论模型是在陈述事实还是在撒谎,专注于视觉的注意力头数量保持不变。问题不在于视觉注意力的匮寡,而在于融合专家处理信息混合的方式发生了漂移。当模型生成正确的描述时,协同头会让视觉输入和语言输入保持稳定的比例。当模型产生幻歇时,该比例会发生倾斜,通常过度倾向于语言模式,而视觉连接则随之减弱,尽管图像仍然存在。

为了解决这个问题,该团队创建了一种动态校准策略,其作用类似于一个实时调节器。HEAL 并不通过重新训练模型或改变其架构来干预,而是在生成过程中进行干预。它监测流经协同头的信息,并检测平衡何时开始发生漂移。一旦检测到漂移,系统就会注入一个校准因子,轻轻地将视觉和语言信息推回正确的平衡状态。这个过程是持续且具有自适应性的;它不会强迫模型忽略语言或过度关注图像,而是将内部表示引导回视觉证据与语言语境能够得到正确权衡的状态。

研究人员在包括 LLaVA 和 Qwen 版本在内的几种最先进模型上测试了这种方法。结果在不同系统和任务中表现一致。通过应用这种动态校准,模型在保持流畅度和创造性的同时,显著减少了幻觉的产生。在旨在衡量模型发明图像中不存在物体的测试中,这种新方法比以往试图单纯提升视觉注意力的技术更有效地降低了错误率。这项研究表明,这类系统实现可靠性的关键不仅在于让它们更努力地观察图像,还在于确保视觉与语言的内部融合保持稳定。

这项工作为人工智能如何理解世界提供了新的视角。它表明,可靠性不仅取决于拥有足够的数据或强大的硬件,还在于维持不同类型信息之间微妙的内部平衡。通过识别这种平衡破裂的具体点并提供一种简单的恢复方式,研究人员为构建更值得信赖的多模态系统开辟了一条路径。该方法具有轻量化特征,不需要重新训练所需的巨大计算资源,这使其成为提高“看与说”类 AI 准确性的实用工具。研究结果表明,未来提升 AI 可靠性的方向可能在于微调这些内部关系,而非从头开始构建更大、更复杂的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →