← 最新论文
💻 computer science

Mechanisms of Object Localization in Vision-Language Models

本文利用机制可解释性工具揭示,视觉语言模型中的物体定位依赖于一种“容器化”机制,该机制由早期至中期或中期至晚期层中一组狭窄的专用注意力头驱动,这些注意力头所定义的空间范围在很大程度上独立于内部词元的语义。

原作者: Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将视觉 grounding 语言模型(VLM)视为一位非常聪明但略显笨拙的艺术评论家。你给它看一张图片,问道:“那是什么,它在哪里?”这位评论家通常能告诉你那是一只“狗”(分类),但它往往难以精确地画出一个框来标出狗站立的确切位置(定位)。

本文就像一名侦探,利用特殊工具窥探这位评论家的大脑,以弄清楚它是如何解决这些谜题的。以下是他们的发现,以简单的方式解释:

1. “容器”技巧

当模型试图寻找物体时,它似乎并不关心物体在框内是如何排列的精细细节。相反,它采用了一种“容器化”策略。

  • 类比:想象你试图在拥挤的房间里找到特定的一群人。模型不需要知道谁站在谁旁边,或者他们穿着什么。它只需要知道所有属于该群体的人都在一个特定的隐形盒子里。
  • 发现:模型收集所有属于该物体的“令牌”(微小的图像数据片段),并将它们视为一个单一包裹。只要这个包裹存在,模型就能在它周围画出框,即使内部片段的排列被打乱了。“是什么”(语义)的重要性不如“在哪里”(容器)。

2. 双镜头相机

模型使用两种不同的方式来观察图像:一种全局视图(模糊的、缩放的缩略图)和一种局部视图(特定区域清晰、高分辨率的特写)。

  • 类比:想象一位摄影师使用广角镜头寻找主体的大致位置,并使用长焦镜头观察其面部的细节。
  • 发现
    • 全局视图是"GPS"。它告诉模型物体在大画面中的位置。如果移除这个视图,模型就会迷失方向。
    • 局部视图是“放大镜”。它帮助模型确认物体是什么,特别是当物体很小时。
    • 它们像一个团队一样协同工作。如果你移除其中一个,另一个仍然能做得不错,但如果你移除两者,模型就会完全失败。

3. 从头重建地图

模型接收到的图像是一长串扁平的数据令牌(像一排长长的多米诺骨牌),但它需要理解图像的二维网格(行和列)。

  • 类比:想象收到一张画有地图的长纸条,但纸条已被切成小方块并打乱成一条线。模型必须仅通过观察纸张的边缘来弄清楚如何重新组装地图。
  • 发现:模型不依赖原始相机的 GPS 坐标。相反,它使用“角锚点”(图像的四个角)作为地标。它利用这些角来推断网格的“线”应该在哪里,从而在处理数据的过程中,在自身大脑内有效地重建二维地图。

4. “特种部队”团队

最令人惊讶的发现是,模型并非动用整个大脑来完成这项工作。它依赖于一小部分精英小队,即特定的注意力头

  • 类比:想象一个拥有数千名工人的巨大工厂。你可能会认为每个人都是造一辆车所必需的。但本文发现,实际上只有大约 10 名特定的工人(注意力头)负责决定车停在哪里。其他 99.9% 的工人只是在旁观或做其他事情。
  • 发现
    • 稀疏路径:只有极少数这些“专家”头同时负责寻找物体和画框。
    • 不同层级:在一种类型的模型(LLaVA)中,这些专家在处理的早期阶段工作。在另一种类型(InternVL)中,它们在中期到后期阶段工作。
    • 操作顺序:模型首先识别物体是什么(分类),然后使用另一组更小的专家来弄清楚它在哪里(定位)。这是一个两步流水线:先识别,后定位。

总结

本文揭示,这些 AI 模型并非像人类那样“看”到物体。相反,它们:

  1. 根据位置将图像片段分组到“容器”中。
  2. 使用广角视图进行定位,使用特写视图获取细节。
  3. 利用角地标重建图像的二维网格。
  4. 依赖一小支专门化的脑细胞团队来执行实际工作,遵循严格的“先识别后定位”序列。

这有助于我们理解,这些模型并非仅仅在猜测;它们构建了特定的、狭窄的路径来解决空间问题,即使这些路径与人类视觉的工作方式大相径庭。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →