← 最新论文
💬 NLP

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM 是一个 40 亿参数的多模态模型,它通过内化元认知控制来动态生成注视令牌,从而增强高分辨率推理能力,使模型能够在不依赖外部裁剪工具或膨胀上下文窗口的情况下,自主模拟主动中央凹注意力并抑制无关视觉特征。

原作者: Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的拼图,但你并非一次性审视整幅画面,而是拥有一副魔法眼镜,能让你在保持对全局把握的同时,放大观察特定的微小碎片。这正是GazeVLM为计算机所做之事。

以下是该论文核心思想的简明拆解,辅以日常类比:

问题:会“模糊阅读”的计算机

当前的视觉 - 语言模型(Vision-Language Models)有点像一名试图在有人对着耳朵大喊一千条随机事实的情况下读书的学生。

  • 它们目前的工作方式: 它们尝试一次性处理整张图像,将每一个像素转化为一个庞大的词元(tokens)列表。当它们开始思考并撰写答案时,所有这些额外词元带来的“噪音”会淹没重要的细节。
  • 结果: 它们常常感到困惑,编造事实(产生幻觉),或遗漏微小但至关重要的细节,因为它们试图同时在大脑中容纳整个世界。

解决方案:“主动凝视”

这篇论文的作者 GazeVLM 希望教会 AI 像人类一样主动地观察图像。

想象一名人类侦探在破解犯罪现场:

  1. 全局视野: 他们首先环顾整个房间,以了解整体布局。
  2. 中央凹聚焦: 他们发现了一些有趣的东西(比如一个泥泞的脚印),并特意将视线聚焦于该点,暂时忽略房间的其他部分。
  3. 回归全局: 一旦检查完脚印,他们会退后一步,观察它如何融入整个场景,然后再转向下一个线索。

当前的 AI 并不自然地执行第 2 步和第 3 步。它要么茫然地盯着整张图像,要么使用笨拙的外部工具(比如机械臂物理裁剪照片的一部分并重新扫描),这既缓慢又昂贵。

GazeVLM 改变了规则: 它教会 AI 在自己的“大脑”内部进行这种“放大”,而无需外部工具。

工作原理:魔法“注视”令牌

研究人员赋予 AI 一套特殊的指令,如同一种秘密语言:

  • <LOOK> 当 AI 意识到需要检查某个具体细节时,它会输入 <LOOK> 并在图像上框出该区域。
  • “静音”按钮: 这是神奇之处。当 AI 说 <LOOK> 时,它实际上并没有裁剪图像。相反,它按下了图像其余部分的“静音键”。它告诉自己的注意力系统:“暂时忽略这个框之外的所有内容。只聚焦于此。”
  • </LOOK> 一旦检查完该点,它输入 </LOOK>,关闭“静音”,从而再次看到整张图像以规划下一步行动。

训练:通过实践(并获得奖励)来学习

你不能仅仅告诉 AI“更努力地看”;它必须学会如何去做。研究人员采用了两步训练过程:

  1. 示教(SFT): 他们向 AI 展示了成千上万张关于如何分步观察图像的示例,教会它 <LOOK><THINK> 的语法。
  2. 游戏(强化学习): 他们与 AI 进行游戏。如果它看对了地方并给出了正确答案,它就会得到“奖励”(treat)。如果它看错了地方、看了太多次,或者只是猜测,它就会受到“禁闭”(惩罚)。

随着时间的推移,AI 学会了获胜的最明智方式并非死盯着整张图像,而是策略性地放大它所需的线索。

结果:更聪明、更快速

该论文声称,这种新方法带来了巨大的改进:

  • 更高的准确性: 在涉及高分辨率图像的困难测试中(如图表上的微小文字或照片中的小物体),GazeVLM 的得分显著高于其他顶级模型。它的得分提高了约 4% 到 5%,这在 AI 领域是一个巨大的飞跃。
  • 更少的浪费: 因为它不需要像其他“放大”工具那样裁剪图像并重新扫描,所以它使用的计算资源要少得多。它生成解决同一问题所需的词元数量减少了约5 倍,使其运行速度更快、成本更低。
  • 内化的技能: 有趣的是,一旦 AI 学会了这项技能,在最终测试期间甚至不需要开启“静音按钮”(偏差)。它已经学会了如此专注的习惯,以至于可以自然地做到这一点,就像人类侦探不需要手册来指导如何聚焦视线一样。

总结

GazeVLM 就像是教会计算机停止试图一次性吞下整个海洋,转而学会从正确的杯子中啜饮一口。通过赋予 AI 利用其内部注意力机制自愿“放大”和“缩小”的能力,它更准确、更快速地解决了视觉谜题,且不会被噪音压垮。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →