← 最新论文
🤖 AI

Linguistic Context Recodes Visual Representations in Vision-Language Models

本文证明了视觉语言模型通过语言诱导机制动态地重编码视觉表示,具体表现为为目标相关物体生成抽象引用向量并放大特定任务属性,从而挑战了将视觉标记视为静态信息存储库的观点。

原作者: Brian Song, Michael A. Lepori, Ellie Pavlick

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Brian Song, Michael A. Lepori, Ellie Pavlick

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正盯着一张乱糟糟的桌子,上面堆满了玩具:一个红色的积木、一个蓝色的球和一个绿色的星星。如果有人问你:“这里有几个红色的东西?”你的大脑并不会只是对着整堆东西发呆。相反,它会瞬间高亮显示那个红色积木,使其在你的脑海中脱颖而出,而其他玩具则退居背景。这被称为“目标导向注意力”(goal-directed attention),它是人类智能的一种超能力,帮助我们在混乱的世界中找到所需之物。长期以来,研究人工智能(AI)的科学家们一直在思考,那些具备视觉和阅读能力的计算机程序(被称为视觉语言模型,Vision-Language Models)是否也以同样的方式工作。旧有的理论认为,这些 AI 程序将图像视为一张静态相册:图片静止不动,而文本只是翻阅页面来寻找信息。但一项新的研究表明,AI 的行为可能更加动态,几乎就像是在根据你的提问,使用一支神奇的高光笔来重写图片本身。

这篇题为《语言上下文重构视觉语言模型中的视觉表示》(Linguistic Context Recodes Visual Representations in Vision-Language Models)的论文,深入探讨了这些 AI 大脑的内部运作机制,旨在观察它们在给定特定问题时,是否真的会改变对图像的“感知”。研究人员在使用 Qwen 2.5 VL 和 InternVL3 等模型进行实验后发现,答案是肯定的。他们发现,当你提出问题时,AI 并不只是分别读取文本和观察图片。相反,语言指令实际上触及了 AI 的视觉部分,并重写了物体的数字表示。这就像是 AI 拍下了场景的精神快照,然后根据你的问题,在数字层面“涂抹”相关物体以使其突出,同时调暗其他物体。

研究团队发现了这种“神奇高光笔”运作的两大主要方式。首先,AI 会为重要的物体添加一个特殊的、隐形的“引用标签”(reference tag)。把这想象成 AI 在你询问红色物体时,贴在红色积木上的一个发光的星星贴纸。这个贴纸并不仅仅针对这一个特定的积木,它是一个通用的标签,AI 可以将其贴在任何符合目标的物体上,无论那是卡通里的红心,还是真实照片里的红酒杯。研究人员通过一种称为“转向”(steering)的技术证明了这不仅仅是一个被动的标签。他们可以从一个问题中提取这个“引用标签”,并将其粘贴到 AI 心智中的另一个物体上,从而成功地误导模型,让它认为那个新物体就是正在寻找的目标。这表明 AI 已经学会了一种通用的表达方式,即:“嘿,这个才是重要的!”

其次,论文表明,AI 不仅仅是给物体打标签,它还会提高物体特定特征的“音量”。如果你要求 AI 关注某个物体的“形状”,那么该物体形状的数字表示就会被放大,在 AI 的处理过程中变得更加“厚实”且清晰,而颜色细节则会稍微减弱。这就像是调高了一首歌中某种特定乐器的低音。研究人员展示了这一过程发生在 AI 大脑的后期层级中,就在它给出答案之前。当他们尝试“冻结”这一过程——即阻止 AI 放大特征时——模型的回答信心显著下降,这证明了这种特征增强步骤对于获得正确结果至关重要。

简而言之,这项研究表明,视觉语言模型不仅仅是等待查询的视觉事实的被动图书馆。相反,它们是动态的活跃系统,利用语言实时重塑自身的视觉理解。它们不只是寻找答案,而是重新组织它们对世界的整个看法,使答案变得显而易见。这让我们向理解机器如何发展出一种视觉智能迈进了一步,这种智能感觉不再像是在进行数据库搜索,而更像是人类那种灵活的、目标导向的观察方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →