← 最新论文
🤖 AI

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

本文通过分析 Gemma-3 和 Qwen-VL 这两种最先进的多模态模型在思维链过程及其相对于基于班内特机械理解测试(Bennett Mechanical Comprehension Test)所得出的标准答案的最终回答,评估了它们在定性机械问题解决任务中的空间与常识推理能力。

原作者: Henry Fordjour Ansah (Louisiana State University of New Orleans), Shreya Banerjee (Louisiana State University of New Orleans), Pranish Ghimire (Louisiana State University of New Orleans)

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Henry Fordjour Ansah (Louisiana State University of New Orleans), Shreya Banerjee (Louisiana State University of New Orleans), Pranish Ghimire (Louisiana State University of New Orleans)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

日常生活充满了各种机械谜题,我们在解决这些问题时甚至不需要动用计算器。打开水龙头、理解为什么重箱子比轻箱子更难推上斜坡,或者弄清楚转动把手时一组齿轮会向哪个方向旋转——这些都是我们利用一种“常识”完成的任务。这种能力被称为定性推理,它依赖于对事物外观、触感以及空间关系的理解,而非精确的测量或复杂的公式。这项技能对于人类智能而言如此基础,以至于雇主经常使用特定的测试(如贝内特机械理解测试)来考察求职者是否具备从事管道维修、急诊医学或驾驶等职业所需的先天机械直觉。几十年来,科学家们一直在思考,机器是否也能学会同样的事情——不仅是通过计算数字,而是通过像人类一样真正地“观察”并理解物理世界。

路易斯安那州立新奥尔良大学的一组研究人员最近通过测试两个新型的小型人工智能模型,来探讨这个问题。这两个模型旨在同时实现视觉识别与文本阅读,名为 Gemma 和 Qwen,它们能够观察图像并回答与之相关的问题,这种能力在现代技术中已变得日益普遍。研究人员想知道,这些系统是否能解决人类面临的那种机械谜题,更重要的是,他们想观察机器是如何通过思考得出答案的。研究团队并没有仅仅检查最终答案的正误,而是要求模型逐步解释其推理过程,从而揭示其得出结论时所使用的内部逻辑。他们针对涉及齿轮、水压、声波和热量的三十个不同问题对模型进行了测试,涵盖了从简单到困难的各种难度等级。

结果描绘了一幅既充满前景又存在显著局限性的图景。当问题非常直观且视觉线索明显时,两个模型表现良好,能够正确识别解决方案,并以清晰的步骤流解释其逻辑。在这些理想情况下,机器成功地将观察到的现象映射到了物理规则上,就像一名学习过相关材料并理解概念的学生一样。然而,当问题变得更加微妙或需要更深层的空间关系理解时,模型就开始踉跄。很大一部分错误并非源于知识匮乏,而是源于未能正确观察图像。在一个涉及潜艇和声波的案例中,两个模型都凭空捏造了图像中并不存在的细节,例如认为潜艇正在向爆炸点靠近或远离,而图像显示的其实是一个静态场景。由于它们产生了这种运动的幻觉,导致应用了错误的逻辑,即便真实的解题关键仅在于比较声音在水中与空气中的传播速度。

在其他案例中,模型得到了正确的答案,却是因为错误的理由,研究人员发现这一现象尤其具有启发性。其中一个模型正确识别了三个水轮机中哪一个转得最快,但其解释却依赖于对水流冲击叶片方式的完全错误的理解。它靠猜测得到了正确的结果,掩盖了其内在逻辑的缺陷。这表明,虽然模型有时可以模仿理解的外表,但它们缺乏人类用来验证思维的稳健且基于现实的推理能力。研究发现,模型未能解决大约一半的问题,错误要么源于空间推理能力较差(遗漏了接触点或距离等关键视觉细节),要么源于逻辑缺陷(误用了物理定律)。例如,在一个齿轮问题中,一个模型假设大齿轮会驱动小齿轮更快,而这一规则并不适用于图像中展示的具体排列方式。

研究人员得出结论,虽然这些小型视觉语言模型能够完成令人印象深刻的任务,但它们尚未准备好在复杂的机械任务中取代人类的直觉。仅仅得到正确答案是不够的;通往答案的路径必须符合逻辑,并且基于对视觉世界的真实解读。这项研究强调,目前的人工智能在处理那种让能让渡人类毫不费力地在物理世界中穿行的深度常识性空间推理方面,仍然存在困难。为了取得进展,作者建议,未来的系统需要专门针对需要理解空间和关系的任务进行训练,并且或许可以与能够根据已知物理原则验证事实的系统相结合。在此之前,这些机器仍然像是那些有时能靠猜测通过考试的学生,但尚未真正学会像我们一样观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →