LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
该论文介绍了 LEGO-Puzzles,这是一个通过基础任务和组装规划来评估多模态大语言模型(MLLMs)多步空间推理能力的基准测试,揭示了即使是最强的模型也显著逊色于人类,并且随着规划复杂度的增加,其准确性难以维持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何用积木搭建一座复杂的城堡,但你只能通过语言和展示图片来与它交流。这就是多模态大语言模型(MLLMs)的世界。可以将这些模型想象成超级聪明的数字大脑,它们既能阅读文本,也能“看到”图像,尝试像人类一样理解这个世界。对于任何大脑来说,最难学习的事情之一就是空间推理——即理解物体如何在三维空间中组合在一起的能力,知道哪个积木该放在上面,哪个需要旋转方向,以及随着零件的加入,整个结构是如何变化的。虽然这些人工智能模型在聊天和描述图片方面正变得越来越出色,但科学家们仍在思考:它们真的能够“规划”出一系列动作来完成搭建吗?仅仅观察一座完工的塔并说出“它很高”是一回事,但要弄清楚从零开始构建它所需的确切 50 个步骤,则是完全不同的挑战。如果我们希望机器人能够修理汽车或帮助我们组装家具,它们就必须掌握这种循序渐进的思考能力。
于是,LEGO-Puzzles 应运而生,这是一个旨在测试这项技能的新型“考试”。研究人员并没有使用真实的塑料积木,而是利用乐高说明书创建了一个巨大的数字游乐场,以观察世界上最聪明的 AI 模型在处理空间谜题时的表现。他们将测试分为两个主要等级。第一级是基础集(Elementary Set),就像是热身练习。它要求 AI 对单张图片进行简单的提问:“哪个积木更高?”“这两个零件是否接触在一起?”或者“如果我旋转这个零件,它从侧面看是什么样子的?”这测试的是基础的“空间理解”。第二级是规划集(Planning Set),这是真正的“终极 Boss 战”。在这里,AI 不仅仅是在回答问题,它必须扮演一名大师级建筑师的角色。它会被给出一堆初始积木和一张最终目标的图片,然后必须生成一个逐步实现的计划来达到目标。研究人员测试了 29 个最先进的 AI 模型,包括像 GPT-5 和 Gemini 这样的大名鼎鼎的模型,甚至还邀请了人类专家参加同样的测试。
结果给 AI 界带来了一次现实的警示。即使是最强大的模型在基础问题上也表现挣扎。在基础问题中,顶尖的 AI 模型比人类的表现至少落后了 20%。例如,当被要求判断三维空间中积木的高度时,许多模型会产生混乱,它们只是盯着屏幕上的平面二维图片看,而没有想象真正的三维形状。但随着任务长度的增加,情况变得糟糕得多。当 AI 需要使用多选题来规划一系列步骤时,一旦计划超过 3 步,它们的准确率就开始显著下降,跌破 50%。当计划需要 8 步 时,最强模型的准确率直接掉到了 0%。相比之下,人类参与者无论步骤链条有多长,都能完美解决所有的规划任务。
研究人员还尝试了一些更难的任务:要求 AI 不仅仅是描述步骤,还要实际画出建造过程中的中间状态图片。他们想看看 AI 是否能想象出城堡在第 1 步、第 2 步……之后的样子。结果非常悬殊。即使对于仅有 3 步 的短计划,模型在生成正确的视觉序列方面也完全失败了。它们有时能画出一个看起来像乐高积木的东西,但无法将其放置在正确的位置,也无法掌握正确的朝向。论文指出,由于模型在仅 3 步的图像生成任务中表现得如此糟糕,研究人员甚至没有测试针对该特定任务更长的时限。这表明,虽然这些模型擅长识别模式,但它们缺乏随着时间推移去“想象”行为后果的能力。它们无法在脑海中维持一张关于建造过程的心理地图而不丢失进度。
简而言之,LEGO-Puzzles 揭示了尽管我们目前的 AI 模型令人印象深刻,但它们距离拥有真正的空间智能还非常遥远。它们无法可靠地规划多步骤的组装,并且在被要求可视化物体的未来状态时表现得一败涂地。论文总结道,在 AI 真正理解物理世界以至于能帮助我们建造物品、修理损坏物品或自主在复杂环境中导航之前,我们还有很长的路要走。人类直觉与机器计算在物理世界之间的差距依然巨大,而这一新的基准测试为模型在哪里跌倒提供了一份清晰的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。