See2Think: Do Multimodal Models Really Use Intermediate Visual States?
本文介绍了 See2Think,这是一个包含 1,200 个样本基准测试和视觉思维动作(Visual Action-of-Thought)协议的统一评估框架,旨在揭示虽然多模态模型表现出对中间视觉状态的行为依赖性,但其推理准确性受到渲染保真度的严重限制,并在不同模型和环境之间存在显著差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个棘手的谜题,但你不仅仅是盯着图片看,而是被允许拿起铅笔,画线、圈出线索,并在纸上勾勒出你的思考过程。这就是**多模态大语言模型(Multimodal Large Language Models)的世界——这些超级聪明的计算机程序既能阅读文本,也能“看见”图像。一段时间以来,这些模型通过写下步骤(一种被称为思维链(Chain-of-Thought)**的小技巧)在“大声思考”方面变得越来越出色。但许多谜题,尤其是涉及三维空间或复杂几何的谜题,仅靠文字很难解决。人类自然会通过绘制图表来辅助思考,因此科学家们想知道:这些人工智能模型真的能利用中间过程的绘图和草图来解决问题吗,还是它们只是在装样子?
这是研究人员正在提出的重大问题。如果一个人工智能说:“我需要在这里画一条线来弄清楚这个问题”,它真的会利用那张新画作来寻找答案吗?还是它只是忽略了那张画并直接猜出了答案?这就像是在问,一名学生是真的在利用草稿纸做数学题,还是只是在上面乱涂乱画,然后寄希望于最终答案来自魔法。理解这一点至关重要,因为如果这些模型并没有真正使用它们创造出的视觉工具,那么我们就是在浪费时间去构建那些并不能让它们变得更聪明的特性。
于是有了 See2Think,这项研究就像是人工智能推理领域的一位侦探。研究人员构建了一个庞大的测试场——See2ThinkBench,其中包含 1,200 个不同的谜题,涵盖了从二维几何、化学结构图到三维机器人场景以及现实世界的物理问题。他们不仅要求模型给出答案,还设置了一套特殊的协议,称为视觉思维行动(Visual Action-of-Thought, VAoT)。把这想象成一场游戏,人工智能必须轮流进行:它思考,决定要“画”一些东西(比如高亮显示某个特定的角度或裁剪图像的一部分),然后由一个独立的工具实际完成绘画,接着人工智能必须观察这张新图以继续其推理过程。
团队测试了四种不同的强大人工智能模型,以观察它们如何应对这场游戏。他们发现并没有所谓的“一招鲜”的获胜者。有时,仅仅用文字思考(不绘图)效果最好;而有时,实际看到绘图确实有所帮助。但这里有一个转折:这些模型在决定画什么(挑选正确的线索)方面表现得非常出色,但在正确使用绘图方面却经常失败。事实上,研究发现最大的瓶ing点不在于选择正确的动作,而在于绘图本身的“忠实度”——即工具是否真的画出了人工智能所要求的样子?
或许最令人着迷的发现来自于研究人员玩的一个“诡计”。他们特意给了模型“损坏的”绘图——即看起来像是人工智能要求的,但实际上却是错误或具有误导性的图片。当这种情况发生时,模型的表现显著下降,尤其是在三维场景中,准确率下降了超过 10 个百分点。这证明了模型确实在真实地依赖它们所看到的视觉状态,即便这个状态是破碎的。然而,这项研究也表明,仅仅因为一个模型依赖于绘图,并不意味着绘图真的帮助它得到了正确答案。有时,模型对视觉反馈的依赖程度如此之高,以至于即使是一张糟糕的图也会让它们因困惑而失败,这表明“使用”视觉状态与“受益于”视觉状态是两件完全不同的事情。
简而言之,这篇论文揭示了虽然人工智能模型在“视觉推理的概念”上正变得越来越好,但在执行和信任它们自己绘制的草图这一混乱的现实面前,它们仍然感到吃力。它们就像那些知道该看图表的哪个部分,但在尝试实际阅读自己画出的新草图时却往往会迷失方向的学生。研究人员得出结论,我们不能仅仅关注最终答案,而应该开始诊断整个过程——检查绘图是否相关、是否绘制正确,以及模型是否真的利用它来进行思考。在我们解决这些瓶颈之前,“用图像思考”可能仍然更多是一种表演,而非真正的超能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。