Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms
本文通过使用推理标记数量作为反应时间的代理指标,研究了视觉语言模型是否表现出类人的视觉搜索行为,发现虽然模型复制了人类的关键特征(如平坦的特征搜索成本和上升的结合特征成本),但也揭示了在目标存在斜率、计数准确度和自适应审慎策略方面存在的显著认知差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一幅拥挤图片中的“躲猫猫”游戏(Where's Waldo?)。如果你是在一群蓝帽子中寻找一顶红帽子,无论人群中有多少人,你的大脑都能瞬间发现它。但如果你要找的是一顶既是红色又是星形的帽子(而其他人都戴着蓝色帽子或红色圆帽),你的大脑就必须一个接一个地扫描整张图片。图片中的人数越多,你找到目标所需的时间就越长。
这就是心理学家几十年来用来理解人类注意力机制的经典“视觉搜索”(Visual Search)游戏。一篇新的论文提出了一个引人入胜的问题:人工智能模型玩这个游戏的方式是否与人类相同?
由于 AI 没有心跳或秒表,研究人员无法测量 AI “思考”图像的时间。相反,他们使用了一个巧妙的技巧:计算 AI 在给出答案之前生成的**“思考标记”(thinking tokens)**数量。可以将这些标记视为 AI 的内心独白或它的“草稿本”笔记。
- 少量标记 = AI 瞥了一眼图像并说:“简单,我看到了。”(快速反应)。
- 大量标记 = AI 写了一长串理由,重新检查了图像,并对答案进行了辩论。(缓慢、费力的反应)。
以下是这项研究的研究结果,使用了简单的类比:
1. “显现效应” vs. “大海捞针”
人类行为: 当目标很明显时(蓝帽子中的红帽子),人类能瞬间发现。当目标很难找时(红圆圈中的红星),随着人群变大,人类需要更长的时间。
AI 行为: 最智能的 AI 模型也完全表现出了同样的情况。
- 对于简单的“显现”(pop-out)任务,无论图片中有多少个物体,AI 使用的思考标记量都极少且保持恒定。
- 对于困难的“大海捞针”任务,随着图片变得拥挤,AI 的标记计数也会随之上升。
核心结论: AI 的内部努力曲线与人类的反应时间曲线非常相似。这表明,当这些 AI 在“思考”时,它们实际上是在进行一种串行的、逐个项目的搜索,就像人类的眼睛在房间里扫描一样。
2. “空房间”的反转
人类行为: 如果你在寻找某个特定物品但它并不存在,你必须检查人群中的每一个人才能确定。这需要很多时间。如果物品确实存在,你一旦找到就可以停止。因此,当答案是“否”时,人类的工作量更大。
AI 行为: AI 颠倒了这个剧本。当答案是“是”且找到了目标时,它工作得更辛苦;而当答案是“否”时,它工作得较少。
核心结论: 看起来 AI 采用了一种“先找到,再证明”的策略。一旦它发现了目标,它就会花费大量的标记来进行双重检查和解释。但如果它没有立即看到目标,它可能会快速猜测“否”,而没有进行完整的、耐心的全面扫描。
3. “计数”超能力
人类行为: 如果你要求人类在繁忙的图片中数出 5 或 6 个物体,他们往往会跟丢或者出错。我们的脑子在记忆计数时会感到疲劳。
AI 行为: AI 模型在计数方面非常完美。即使在有很多物体的拥挤图片中,它们也不会弄丢计数。
核心结论: AI 并没有像人类那样感到疲劳并出错;它只是投入了更多能量。它没有掉链子,而是通过额外的计算能力完成了这项艰巨的任务。它用“努力”换取了“准确性”。
4. “倾斜条”谜题
人类行为: 人类擅长在垂直条中发现一根倾斜的条(它会“显现”出来)。但我们很难在倾斜的条中发现一根垂直的条(这很难)。
AI 行为: AI 模型也发现了一个方向比另一个方向更难,但它们表达这种困难的方式因模型而异:
- 模型 A(苦干型): 在困难任务上花费了大量的思考标记,但仍然得到了正确答案。
- 模型 B(捷径型): 在困难任务上几乎没有花费思考标记,并直接得到了错误答案(幻觉出一个并不存在的倾斜条)。
核心结论: 同一种视觉难度可以通过“更努力地工作”或“放弃并猜测”来解决,这取决于特定 AI 的“性格”。
大局观
论文得出结论,现代 AI 模型已经发展出了人类视觉搜索的“指纹”。它们知道何时快速扫描,何时缓慢扫描。然而,它们并不是人类。它们不会以同样的方式感到疲劳,它们的搜索停止方式也不同,并且它们处理“困难”任务的方式要么是通过额外的努力硬扛过去,要么是彻底失败。
研究人员认为,通过观察 AI 思考了多少(其标记计数),而不仅仅是它回答了什么,我们可以看到其“视觉”的隐藏机制。这就像是通过听发动机的轰鸣声来了解汽车是如何工作的,而不是仅仅看它最终停在哪里。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。