← 最新论文
💻 computer science

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

该论文提出了 Lens,这是一个轻量级的、以问题为条件的框架,通过向无关图像标记中自适应地注入潜在噪声,减少了多模态大语言模型中的视觉冗余,从而在不修改模型主干的情况下,显著提升了细粒度推理和定位性能。

原作者: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解开一个拼图,但有人把一大堆无关的额外拼图碎片直接倒在了你真正需要的那些碎片上面。这本质上就是多模态大语言模型(MLLMs)在观察图像时面临的问题。

这些模型在阅读和交谈方面非常聪明,但当它们看一张图片时,它们会将所有内容都视为一长串微小的碎片(即 token)。如果你问:“天空中有多少架飞机?”,模型能看到飞机,但它也会看到云朵、鸟类、背景中的树木以及草地的纹理。所有这些“干扰项”碎片都会混杂在一起,使得模型很难专注于回答你的问题所需的特定线索。

目前大多数解决方案试图通过为其推理过程增加更多步骤来帮助模型“思考得更努力”或“思考得更久”。这就像是在告诉一个困惑的侦探:“只需写一份关于你所看到的一切的长篇报告。”但论文指出,这样做效果并不好,因为侦探仍然淹没在无关的细节中。

LENS(潜在噪声掩码)登场了。

请不要将 LENS 视为一种增加信息的工具,而应将其视为模型眼睛的智能降噪耳机。

以下是它的工作原理,使用了一个简单的类比:

1. “透镜证据标记”(智能观察员)

想象模型有一个微小的、临时的助手(称为透镜证据标记LET),它会同时观察图像和问题。

  • 任务: 这个助手快速扫描图像,并给图像中的每一个碎片打分。
  • 结果: 如果图像的一个部分是飞机(且你问的是关于飞机的),助手就会给它一个高分(绿灯)。如果一个部分是云朵或树木,它就会给一个低分(红灯)。
  • 关键点: 这个助手不会改变图片;它只是根据你的提问对碎片进行排序。

2. “潜在噪声掩码”(音量旋钮)

一旦助手完成了对碎片的排序,LENS 并不会把那些“低分”的碎片丢弃掉。丢弃东西是有风险的;如果助手犯了错,模型可能会丢失关键线索。相反,LENS 使用了一个音量旋钮

  • 高分碎片(证据): 这些碎片保持原样。它们清晰且响亮。
  • 低分碎片(干扰项): LENS 会向这些碎片添加一种特殊的“静态噪声”或“噪声”。它不会删除它们,但会让它们变得模糊且不可靠。这就像调低背景杂音的音量,让模型只能听到重要的声音。

为什么这更好?

论文声称,与其试图教模型“思考得更久”(这会增加更多杂乱信息),不如清理它已经看到的内容。

  • 无需手术: 模型的“大脑”(其骨干网络)保持完全不变。我们没有切除图像的一部分,也没有改变模型的构建方式。
  • 软抑制: LENS 不是激进地删除图像的部分,(因为如果它猜错了,这可能会破坏模型),而是温柔地“静音”干扰项。
  • 高效性: 它只增加了极少量的额外工作,就像助手的快速瞥视一样,但结果是为模型提供了一幅更清晰的图像来解决问题。

实验结果

当研究人员在各种任务上测试这种“降噪”方法时:

  • 视觉问答 (VQA): 模型在回答特定问题(如计数物体或读取图像中的文本)方面表现得显著更好,因为它们不再被背景所干扰。
  • 定位 (Grounding): 模型在精准指出图像中物体位置方面表现得更好,因为附近类似物体的“噪声”被消除了。

简而言之: 论文表明,要让 AI 更擅长观察,我们不应该仅仅给它更多思考的时间;我们应该帮助它忽略噪声,从而专注于信号。LENS 就是那个调低无关图像部分音量的工具,让模型能够清晰地听到答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →