← 最新论文
💬 NLP

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

本文揭示了多模态大语言模型中的任务无关文本通过在决策边界中诱导一种可预测的仿射变换,系统性地使二元视觉判断产生偏差,并将此效应表征为一种可估计的几何失真而非无结构的噪声。

原作者: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的版图中,出现了一类全新的系统,它们能够同时进行视觉观察与语言表达。这些多模态模型经过训练,可以观察图像并回答相关问题,或者详细描述一个场景。它们是功能强大的工具,能够识别物体、阅读图片中的文字,并对复杂情况进行推理。然而,这些系统并非在真空中运行。在现实世界的应用中,它们通常会在图像之外接收额外的辅助信息:例如用户的历史消息、检索到的文章或数据库条目。这些额外的文本旨在帮助模型更好地理解图像。但如果这些额外的文本与图像毫无关系,会发生什么?模型是会忽略这些噪声,还是会感到困惑?这个问题正是近期一项研究的核心,该研究探讨了当这些智能系统的注意力在视觉场景与无关词汇之间分配时,它们是如何处理信息的。

研究人员通过一项受控实验,旨在测试正是这样的场景。他们选取了一系列图像和问题,例如询问照片中的狗是否正在跳跃障碍物。随后,他们为每个问题创建了两个版本的输入。在第一个版本中,模型只能看到图像和问题。在第二个版本中,模型看到了相同的图像和问题,但在提示词中插入了一段完全无关的文本。这段文本是来自书籍或文章的随机句子,比如一个关于某人前往法国旅行的故事,与那只狗或障碍物没有任何联系。研究人员想要观察这种随机噪声是否会改变模型的判断。

结果令人震惊。当加入无关文本时,模型并不仅仅是忽略它。相反,它们一致地改变了答案。更重要的是,它们的改变并非随机的。模型变得显著更有可能回答“否”,即使图像清晰地展示了“是”的情况。例如,如果一个模型原本很有信心认为狗正在跳跃,那么加入无关文本往往会让它产生犹豫,并将答案反转为狗并未跳跃。这种转变发生在不同类型的图像和不同的模型身上,表明这是一个系统性的缺陷而非随机的故障。模型不仅仅是准确度下降了,它们是被推向了一种特定的错误类型——即怀疑自己所看到的视觉证据。

为了理解发生的原因,研究人员深入挖掘了模型做出决策前的内部置信度得分。他们发现模型处理信息时存在一种非常特定的模式。当模型仅看到图像时,它们对答案有一定的置信度。当加入无关文本时,这种置信度并没有消失或变得混乱。相反,它以一种可预测的、数学化的方式发生了偏移。新的置信度水平是原始水平的一个扭曲版本,被压缩并被推向了一个特定的方向。这就像是额外的文本充当了一个过滤器,挤压了模型的确定性,并将天平向不利于视觉证据的方向倾斜。

这一发现排除了模型仅仅是被额外文字搞混了,或者文本充当随机静态噪声的假设。如果真是随机噪声,错误应该是分散且不可预测的。然而,这些错误遵循着严格的规则。研究人员将这种规则描述为一种一致性的偏移,即模型的内部判断被文本的存在所拉伸和移动。他们发现这种偏移是可以被测量甚至被预测的。通过理解这种偏移的模式,他们能够创造出一种简单的修正方法。这种方法可以部分抵消无关文本造成的损害,恢复模型信任其所见图像的能力。

研究还揭示了文本呈现方式的重要性。当无关文本被框架化为可能与图像相关时,这种扭曲会变得更加强烈。模型似乎将这些随机词汇视为线索,试图将它们纳入对图片的理解中,这导致了更大的困惑。这表明模型不仅仅是信息的被动接收者,它们还在积极尝试理解所接收到的所有信息,即便这些信息是毫无用处的。它们难以区分哪些信息对视觉任务是相关的,哪些仅仅是背景噪声。

这些发现为我们看待人工智能如何处理信息提供了一个全新的视角。事实证明,在视觉任务中加入额外的文本不仅仅是增加了音量,它还改变了模型思维的形状。模型对所给出的上下文非常敏感,而这种敏感性会导致它们怀疑自己的眼睛。虽然研究人员已经证明这种效应是可以被测量并得到部分修正的,但根本问题依然存在:这些系统还不够鲁棒,无法忽略无关信息。随着这些技术被整合到更复杂的现实世界系统中,并在其中不断接收数据流,理解它们如何应对噪声至关重要。这项工作提供了一个明确的诊断工具,用于识别这些偏差,并为构建能够专注于图像(即使周围世界充满干扰)的系统奠定了基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →