← 最新论文
🤖 AI

On Locality and Length Generalization in Visual Reasoning

本文表明,虽然标准的全局视觉模型往往会通过利用捷径而无法在任务复杂度上实现泛化,但基于严格局部感知的循环策略可以克服这些局限性并实现鲁棒的组合泛化,这表明局部注意力对于视觉推理至关重要。

原作者: Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个巨大的、杂乱的拼图,但你不能一次观察整个画面,而是必须使用一个高倍放大镜,一次只看一小块,并一步步移动你的手。这正是我们眼睛的工作方式。我们看到的不是一个巨大的、静止的快照;我们是通过一系列快速的、局部的“瞥视”来构建大脑中的图像。

但转折点在于:我们今天使用的多数超级智能的计算机视觉模型,就像是在试图通过从远处盯着整张桌子来解决同一个拼图问题的人。它们一口气吞下了整张图像。

来自高通 AI 研究院(Qualcomm AI Research)的研究人员发表的一篇新论文提出了一个大问题:这种“一口气吞下”的方法,是否实际上阻碍了计算机在处理真正困难的推理任务时的表现?他们建立了一系列数字游乐场来测试这个问题,结果非常惊人。

“奇偶性”谜题与“捷径”陷阱

研究人员创建了一个名为**视觉奇偶性(Visual Parity)**的游戏。想象一个板子上散布着许多开关。有些是开着的(1),有些是关着的(0)。目标是什么?判断“开”着的开关总数是奇数还是偶数。

对于人类来说,这很简单:你只需要用眼睛扫过开关,数一下,然后喊出“奇数!”或“偶数!”但对于一次性观察整个图像的计算机模型来说,这是一个陷阱。论文显示,这些“全局型”模型(如流行的 Qwen2.5-VL)聪明反被聪明误。它们学会了一种捷径。它们并没有真正去数每一个开关,而是可能仅仅观察了开关的密度或图像的整体模式。当棋盘上有 5 到 10 个开关时(这是它们的训练规模),这种方法运作得非常完美。

但一旦你抛出一个变数——给它们一个有 15 或 20 个开关的棋盘,或者把棋盘做得更大——这个捷径就失效了。模型陷入了恐慌。这就像一个背下了 10 道题答案的学生,却因为从未真正学会如何计数,而在面对 20 道题的考试时挂科了。

论文明确排除了这些模型只是需要变得更大或更聪明这一观点。即使是最先进的模型,当它们尝试一次性观察整个图像时,在任务变得更长或更复杂时也会撞到天花板。它们根本无法泛化到这些新的、更难的版本中。

秘诀:一个“中央凹视”智能体

那么,解决方法是什么?研究人员构建了一个名为 FOVEAGENT-LSTM 的机器人智能体。它不再盯着整个棋盘看,而是配备了一个类似于人类眼睛的“中央凹视(foveated)”视觉系统。

可以这样理解:该智能体拥有一个位于视野中心的、超清晰的小型摄像头(中央凹/fovea),能够清晰地看到细节;以及一个围绕在边缘的、模糊的广角摄像头(外周视觉/periphery),帮助它知道下一步该往哪里移动。它迈出一步,观察一个开关,更新其心理状态,移动到下一个,然后重复此过程。

这种“步进式”的方法是关键。论文发现,当智能体被迫进行局部观察,即一次只看图像的一小块时,它实际上学会了任务的逻辑。它不再依赖捷径。当研究人员在比训练时见过更多的开关(多达 20 个!)的棋盘上测试该智能体时,它依然能保持正确率。这表明,局部感知(观察微小的碎片)结合循环性(记住之前看到了什么)是解决这些问题的魔力配方。

那么“寻找”东西又如何呢?

这里变得有趣了。研究人员还测试了另一种不同类型的游戏,叫做召回(Recall)。想象一个充满了红色“T”和绿色“L”的房间,而你的任务是找到一个红色的“L”。这是一个搜索任务,而不是计数任务。

在这种情况下,“全局型”模型(那些能一眼看全所有东西的模型)表现得非常好!它们不需要一步步走遍房间。它们可以直接扫描整个房间并发现目标。论文指出,对于简单的“搜索并发现”类任务,你不需要复杂的、步进式的局部视觉。只有当你需要追踪状态(比如计数或遵循一系列规则)时,你才需要这种步进式的方法。

现实世界测试:寻找根

为了看看这在现实世界中是否有效,他们尝试了一个数学任务:在图表上寻找“根”(即曲线与零线相交的点)。他们需要在充满了其他线条和子图的杂乱图中找到这些根。

当他们使用标准的全局模型时,模型在处理复杂且凌乱的图表时很难找到根。但当他们使用他们的“中央凹视”智能体(它通过查看高分辨率的小块图像)时,表现要好得多。论文表明,对于需要从图像不同部分拼凑信息的任务,局部观察具有巨大优势。

难点在于:尺寸很重要

不过,这其中存在一种微妙的平衡。研究人员发现,如果智能体的“瞥视”范围太大,它就会再次开始作弊。如果智能体一次能看到太多的开关,它就会停止计数,转而开始猜测模式。

他们找到了一个“甜点区(sweet spot)”。智能体需要对它正在观察的具体开关进行高分辨率观察(以确定它是开还是关),但同时需要对周围区域进行低分辨率、模糊的观察(以便在导航的同时不至于看得太多)。如果模糊的视图过于清晰,智能体会学会走捷径;如果过于模糊,智能体会迷失方向。这是一个“金发姑娘原则(Goldilocks situation)”:外周视觉需要恰到好处,既能帮助智能体移动,又不至于让它通过作弊来获取信息。

总结

这篇论文并不声称已经解决了 AI 的所有问题。它指出,对于那些需要计数、追踪或在大型图像中遵循一系列步骤的任务,目前这种“一次看全所有东西”的模型可能正在遭遇瓶颈。

它暗示,要获得真正鲁棒的、类人的计算机推理能力,我们可能需要回归基础,构建像我们一样“观察”世界的模型:一次专注于一个瞥视,记住之前发生的事情,并在谜题中步步为营。这提醒我们,有时,看得少(局部)反而能让你理解得更多(全局)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →