← 最新论文
💬 NLP

An Exam for Active Observers

该论文介绍了 ActiveVision,这是一个基准测试,它证明了当前的多模态大语言模型在本质上缺乏进行主动视觉观察的能力,这一点可以通过它们在需要迭代感知的任务上与人类表现相比几乎完全失败这一事实得到证实。

原作者: Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正看着一个凌乱的房间。相机对它拍下了一张单次的、冻结的快照。如果你要求一台计算机仅根据这张照片来描述这个房间,它可能会说:“地板上有衣服,书架上有书。”但如果你的目标是寻找一只藏在蓝色牛仔裤堆下的红色袜子,或者追踪一根穿梭在纠缠乱线中的单根细绳呢?要做到这一点,你不能只看一次。你必须移动视线,聚焦于一点,猜测袜子可能在哪里,再看一遍,然后调整你的搜索路径。这被称为主动观察(active observation)。这是“拍一张快照”与真正“搜寻答案”之间的区别。几十年来,研究人类视觉与思维的科学家们一直知道,我们的大脑就像是不断重新检查线索的侦探,而不是仅仅扫一眼。

现在,我们拥有强大的计算机大脑,称为多模态大语言模型(MLLMs)。这些 AI 系统可以阅读文本并观察图片,在回答描述照片或简单问题的测试中经常获得满分。但这里有一个核心问题:这些 AI 模型是否真的像人类那样在“观察”?它们是否具备那种像侦探一样不断检查图像、形成新猜想并寻找隐藏细节的能力?还是说,它们只是拍了一张快照,做了一个猜测,然后就固守其见解,即便那个猜测是错误的?这正是新论文试图解决的谜题。

这篇题为《一项针对主动观察者的测试》(An Exam for Active Obbersvers)的论文介绍了一个全新的测试,名为 ActiveVision。把它想象成一个“找不同”游戏的加强版,专门设计用来诱导 AI 展示其真实水平。研究人员构建了 17 种不同的谜题,这些谜题无法通过单次扫视来解决。有些任务要求 AI 在复杂的图案中计数散落的形状,有些要求它在不迷路的情况下穿过迷宫般的蜿蜒路径,还有些要求它比较两张相似图像之间的微小细节。关键在于,这些谜题被渲染得看起来像是真实的、杂乱的照片(比如缠绕的绳索或航拍地图),而非简单的卡通图,且答案要求 AI 不断地“回头看”图像。

当研究人员让世界上最聪明的 AI 模型接受测试时,结果令人震惊。即使是最先进的模型也表现得糟糕透顶。表现最好的模型 GPT-5.5(在其最高推理水平下)仅解决了大约 10.6% 的谜题。事实上,在 17 类任务中,有 11 类 GPT-5.5 的得分是完美的 。另一个强有力的竞争者 Claude Fable 5 表现甚至更差,仅解决了 3.5% 的问题。与此同时,作为普通人的真人参与者在测试中的平均得分高达 96.1%。差距巨大:人类的表现大约是顶尖 AI 的九倍。

研究人员还尝试了一种巧妙的变通方法。他们要求 AI 模型编写并运行自己的计算机代码来解决谜题,希望脚本能代替它们进行“观察”。虽然这带来了一些帮助,但并未解决根本问题。基于代码的智能体(agent)表现最好时也仅能解决约 50.6% 的任务,但在处理像追踪缠绕环路这样最难的谜题时仍然感到吃力。代码经常失败,因为那些看起来像真实世界的图像对于标准的计算机视觉工具来说过于杂乱,而且 AI 无法“察觉”到代码已经犯了错。

论文得出结论,目前的 AI 模型本质上是“被动感知者”。它们拍下一张照片,将其转化为一份数据列表,然后尝试根据这份列表进行回答。它们缺乏主动重定向注意力、形成假设并返回图像进行核实的能力。作者指出,在教导 AI 真正学会“反复观看”、实现视觉与思维之间的闭环之前,它们在需要细致观察的现实工作领域(如检查医学影像、检测工厂零件或在复杂环境中导航)中仍将是不可靠的。“ActiveVision”考试证明了,尽管今天的 AI 模型在其他方面都非常聪明,但在“真正观察”这一简单的类人行为上,它们依然表现得很拙劣。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →