← 最新论文
🤖 AI

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

本文引入了一个因果审计框架,用以证明多模态大语言模型中的“以图促思”范式往往会创造一种有效性的错觉,即尽管总体准确率有所提升,但由于策略失调,视觉工具的使用并不能在因果层面上改善答案。

原作者: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜题的侦探,但你不仅仅是看一眼犯罪现场的照片,你还拥有一把神奇的放大镜。这把放大镜能让你放大微小的细节,裁剪出特定的线索,并在近距离观察它们之前进行研究。在人工智能的世界里,这被称为“用图像思考”。科学家们一直在教这些超级聪明的计算机大脑(被称为多模态大语言模型)使用这些视觉工具,希望通过这种“放大并仔细观察”的方式,让计算机能更好地回答棘手的问题。其核心理念是,如果人类需要眯起眼睛盯着模糊的车牌看才能读出内容,那么计算机也应该能自动做到这一点。

但问题在于:仅仅拥有放大镜并不意味着你就知道如何使用它。有时,你可能会放大错误的区域,或者放大过度导致失去了全局观,甚至在已经知道答案的情况下还在进行放大。这篇论文提出了一个非常重要的问题:当这些 AI 侦探使用它们的缩放工具时,它们是真的利用发现的新信息来改变自己的想法,还是只是在假装观察,实际上却偷偷坚持原有的猜测?研究人员想要查明,这种“缩放”究竟是在帮助计算机思考,还是仅仅是一场浪费时间和精力的华丽表演。


伟大的缩放幻觉

研究人员决定将这些 AI 侦探置于显微镜下观察,但不是那种观察细胞的显微镜——他们使用的是“因果审计”。你可以把它想象成一种特殊的测试,通过秘密替换 AI 所看到的线索,来观察 AI 是否真的在意这些线索。他们将 AI 的思考过程视为一个包含三个层级的叙事:大局(整体计划)、故事的中段(整个观察过程)以及单个步骤(每次缩放的过程)。

他们在六种不同的 AI 模型上运行了这项测试,并使用了五种不同类型的棘手视觉谜题。他们的发现令人震惊。尽管使用缩放工具的 AI 模型在整体上偶尔能多答对一些问题,但与它们消耗的“脑力”(计算机 Token)相比,这种进步微乎其微。事实上,对于某些模型来说,使用这些工具反而让它们在解决问题时比直接看一眼图片并立即猜测的表现更差。

研究揭示了 AI 出错的两种主要方式,作者称之为“策略失调”(Policy Miscalibration)。

1. 没看就下结论(“假侦探”)
想象一位侦探说:“我要放大看那个窗户!”但随后立刻闭上眼睛并直接猜出了答案。研究人员发现,对于许多 AI 模型来说,它们在缩放后“发现”的视觉信息实际上完全没有改变它们的答案。AI 只是在走过场。这就像一个学生举手提问,但随后忽略了老师的回答,依然按照自己原本的想法写下答案。这种“缩放”只是一种仪式,而不是真正的寻真过程。

2. 看了却没计划(“过度思考者”)
这是相反的问题。想象一位侦探找到了所需的线索,解开了谜题,但随后却无缘无故地不停地去放大地板、天花板和那只猫。AI 会很早就找到正确答案,但随后会进行不必要的缩放,经常放大到毫无意义的地方,或者在完成任务之前就耗尽了时间(或“预算”)。它在看,但它没有计划何时停止。

“校准良好”的少数派

最有趣的发现是,AI 并非总是失败。研究人员发现,这些工具提供的微小成功几乎完全来自于一小部分“校准良好”(Calibrated)的尝试。在这些罕见的情况下,AI 准确地知道何时该缩放、要看什么以及何时停止。

这就像一个 100 人的教室。如果老师说“大家使用计算器”,而全班平均分只提高了 1 分,这看起来可能意味着计算器非常有用。但如果你仔细观察,你可能会发现,其中 90 名学生只是乱按按钮导致了混乱,而只有 10 名学生真正知道如何使用计算器来解决问题。所谓的“平均”进步是真实的,但它是由于那极少数幸运的少数派所创造出的幻觉。其余的学生只是在浪费时间。

为什么会发生这种情况?

作者提出了一个可能的解释,即这些 AI 模型的训练方式:它们通常只被奖励最终得到正确答案,而不关心它们是如何得到答案的。这就像电子游戏,你只能因为打败了 Boss 而获得积分,至于你是聪明地战斗还是绕圈子跑了一个小时才打败 Boss,获得的积分都是一样的。因为 AI 不会被惩罚“没看就下结论”或“看了却没计划”,所以它学到的是:只要最终能得到正确答案,是否浪费时间或忽略发现的线索都无所谓。

总结

这篇论文并不是说视觉工具是没用的。它说的是,目前大多数 AI 模型使用这些工具的方式大多只是一种表演。它们只是名义上的“用图像思考”。真正的突破不会仅仅来自于给 AI 更多的工具或让它们缩放得更快;而在于教会 AI 真正去“倾听”它所看到的东西,并知道何时停止观察。在那之前,“思考”可能只是一种幻觉,而 AI 大多时候只是在假装忙碌的同时进行着猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →