← 最新论文
🤖 AI

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

本文介绍了 FOCUS,一种无需训练且与架构无关的方法,它通过聚合来自部分掩码输入的逻辑值(logits)并利用仅含噪声的参考进行优化,从而减轻了大型视觉语言模型中的跨图像信息泄漏问题,进而显著提升了在多图像和视频理解任务上的性能。

原作者: Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位非常聪明的艺术评论家(即 AI),擅长描述单幅画作。但当你被要求观察并描述并排悬挂的两幅画中的第一幅时,你会感到困惑。你会不小心开始描述第二幅画,并将两者混在一起,变成一段混乱且错误的描述。

这篇论文识别出了这个特定问题,并提供了一个无需训练的巧妙解决方案:FOCUS

以下是他们发现的问题以及他们如何解决它的拆解,使用了简单的类比:

问题:“视觉汤”效应

当大型视觉语言模型(LVLMs)同时观察多张图像时,它们的内部“大脑”会变得浑浊。它们无法将图像分开,而是像搅拌果昔一样将它们混合在一起。

  • 场景: 想象你向 AI 展示一张装有黄色郁金香的白色花瓶的照片(图像 A)和一张装有红玫瑰的红色花瓶的照片(图像 B)。
  • 问题: “第一幅图像里有什么?”
  • 错误: 困惑的 AI 不会说“黄色郁金香”,而是会说“黄色郁金香和红玫瑰”。它将第二幅图像的信息泄露到了对第一幅图像的回答中。
  • 原因: 论文称之为跨图像信息泄露(Cross-Image Information Leakage)。因为 AI 会一起处理所有图像,所以其“视觉标记”(图像的数字构建模块)会纠缠在一起,使 AI 认为所有东西都是一个巨大的组合场景。

解决方案:“蒙眼”技巧 (FOCUS)

作者意识到,这些 AI 模型实际上非常擅长一次只看一张图像。问题只发生在它们试图同时看很多张图像时。

因此,他们创建了一种名为 FOCUS 的方法(这代表了一个特定的技术过程,但你可以将其理解为“专注于一个清晰的来源”)。它不需要重新训练 AI 或改变其大脑;它只是改变了 AI 在对话过程中观察图片的方式。

以下是 FOCUS 的工作步骤:

  1. 蒙眼(视觉掩蔽/Visual Masking):
    想象你想让 AI 描述图像 A。与其向它清晰地展示图像 A 和图像 B,不如给图像 B 戴上一个“数字眼罩”(随机噪声)。现在,图像 B 只是像没有信号的电视那样的静态噪点。AI 只能清晰地看到图像 A。

    • 类比: 这就像是在第二幅画上盖上一张纸,让评论家只能看到第一幅画。
  2. 切换(逐图像推理/Image-wise Inference):
    AI 对集合中的每一幅图像都执行此操作。

    • 首先,它清晰地观察图像 A(此时图像 B 是模糊的)。
    • 然后,它清晰地观察图像 B(此时图像 A 是模糊的)。
    • 它逐一进行,确保它永远不会因为同时看到两幅清晰的图像而产生困惑。
  3. 噪声过滤器(对比聚合/Contrastive Aggregation):
    即使戴上了眼罩,模糊图像中的一点点“静态噪声”仍可能泄露出来。为了修复这一点,AI 还会观察一个完全空白、充满噪声的屏幕(只有静态噪点,没有图像),以了解“纯粹的混乱”听起来是什么样的。

    • AI 随后会从其答案中减去这种“混乱噪声”。
    • 类比: 如果 AI 说“我在郁金香的图片里看到了一点红玫瑰”,系统会检查:“当我们只看静态噪声时,是否也看到了红玫瑰?”如果是,它就会意识到“红玫瑰”只是一个故障,并将其从最终答案中移除。

结果

当他们在许多不同的 AI 模型和基准测试上测试这种“蒙眼 + 噪声过滤器”技巧时:

  • 准确率提升了: AI 不再混淆图像。
  • 它无处不在: 它适用于小型模型、大型模型,甚至于视频理解(其中视频帧就像是一系列图像)。
  • 无需额外训练: 他们不需要教 AI 任何新知识。他们只是在 AI 回答时的那一刻改变了游戏规则。

总结

这篇论文指出,目前的 AI 模型就像是一个试图同时听两个广播电台的人,最后听到的只是混乱的混合声。FOCUS 是一个简单的技巧,它强迫 AI 一次只听一个电台,同时过滤掉来自另一个电台的静态噪声,从而得到清晰、正确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →