← 最新论文
💻 computer science

Listening makes Vision Clear for VLMs

本文介绍了提示词视觉标记激活图(Prompt-Vision Token Activation Map, PV-TAM),这是一种新颖的评估方法,它利用提示侧语义并过滤掉结构性偏差,通过解决传统回答侧方法中固有的解码漂移和注意力失配问题,从而更准确地衡量大型视觉语言模型中的视觉-语言一致性。

原作者: Yiyang Chen, Yixin Tan, Binrui Shen

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyang Chen, Yixin Tan, Binrui Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手(视觉语言模型),它能够观察一张图片并描述它所看到的内容。你问它:“鸭子的脖子在哪里?”它便指向了图片中的一个位置。

核心问题是:机器人是真的在看脖子,还是仅仅根据它认为鸭子通常长什么样来进行的猜测?

问题所在:机器人会被自己的“喋喋不休”分散注意力

过去,研究人员试图通过检查机器人在开始回答后的注意力来观察它在看哪里。他们认为:“让我们看看机器人在说出‘脖子’这个词的过程中,注意力集中在哪里。”

这篇论文的作者发现这种方法存在缺陷。他们称之为**“解码漂移”(decoding drift)**。

可以这样理解:想象你正在人群中寻找一个特定的人。

  1. 旧方法: 你要求机器人开始描述那个人。随着机器人说着“我看到一个人,他戴着帽子,而且……”它陷入了自己的句子中,开始指向人群中错误的人。机器人的前文(如“帽子”、“人”)开始遮蔽它的视线,使其失去了对你所询问的具体部分(脖子)的关注。
  2. “结构性噪声”: 论文还注意到,机器人用来分隔图像和文本的特殊“胶水词”(例如 <start of image><end of image>)就像是嘈杂的静电。它们抓取了机器人的注意力,使机器人看向图片的随机部分,仅仅是因为这些词的存在,而不是因为它们很重要。

解决方案:“先听”后“说”

作者提出了一种名为 PV-TAM(提示词-视觉标记激活图)的新方法。其核心思想很简单:不要等机器人开始回答后再去看它看到了什么。要在它开口说话之前,观察它看到了什么。

他们称之为**“倾听让视觉更清晰”**。

以下是他们的新系统是如何运作的,使用了一个简单的类比:

1. “提示词侧”策略(固定的问题)

他们不再要求机器人生成答案然后再检查其焦点,而是将问题本身视为引导。

  • 类比: 想象你在机器人开始描述任何内容之前,拿着一把手电筒(问题词“脖子”)直接照向图片。因为问题是固定的,尚未发生变化,所以机器人的注意力是纯净的,还没有被它之前的句子所干扰。

2. “降噪耳机”(结构化去噪)

机器人的注意力图仍然存在前文提到的来自“胶水词”的“静电”。

  • 类比: 作者构建了一个过滤器(就像降噪耳机一样),它监听来自胶水词的静电并将其减去。这便留下了唯一的“音乐”——即与“脖子”一词相关的实际视觉信息。

3. 新的评分标准(更好的指标)

旧方法只是检查机器人的“聚光灯”是否与正确区域重叠(就像检查两个圆是否接触)。作者认为这还不够;聚光灯需要在脖子的位置达到“最亮”。

  • 他们创建了新的评分工具(TGR、TDR、Min-Dist),这些工具不仅测量机器人的目光是否看向了正确的地方,还测量它在忽略背景噪声的情况下,对特定部分的关注程度和精准度有多高。

实验结果

当他们在不同的机器人模型(如 Qwen 和 InternVL)上测试这种新方法时:

  • 旧方法: 当被问及脖子时,机器人经常会指向鸭子的翅膀,因为它被自己的句子结构搞混了。
  • 新方法 (PV-TAM): 机器人始终能准确地指向脖子。它在不同类型的图像和不同的机器人模型上都表现得更好。

核心结论

该论文声称,通过在检查机器人的视觉之前阻止它“说话”,并清理掉其中的静电噪声,我们可以更清晰地看到机器人到底在看什么。事实证明,机器人从读到问题的瞬间起,就已经知道“鸭子脖子”在哪里了,但它生成答案的习惯掩盖了这个事实。

简而言之: 要想看得清晰,不要让机器人自身的喋喋不休分散它的注意力。先看问题,过滤掉静电,你就能看到机器人究竟在看哪里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →