← 最新论文
🤖 AI

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

本文介绍了 MMArch,这是一个针对建筑与土木工程领域的严谨基准测试,旨在评估多模态大语言模型将分布式视觉证据与工程原理相结合的能力,并揭示了当前人工智能系统与人类专家之间存在的显著性能差距。

原作者: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何成为一名建筑师。你不仅仅希望它能识别出一张照片显示的是一座房子;你还希望它能理解为什么这座房子不会倒塌。这就是“多模态大语言模型”(MLLMs)的世界。把这些模型想象成超级聪明的数字大脑,它们可以同时阅读文本并观察图片。它们擅长描述所见之物,比如说,“那是一扇蓝色的门,”或者“这张图表显示线条正在上升。”但在现实世界的工程领域,仅仅知道你看到了什么是不够的。你必须将图纸、物理规则和安全规范联系起来,才能做出判断。这就像是一名侦探,必须观察犯罪现场的照片,回想起特定的法律,然后判定嫌疑人是否有罪。研究人员一直在问的一个大问题是:这些 AI 侦探真的能破案,还是仅仅根据看到的线索在瞎猜?

这就是名为 MMArch 的新研究介入的地方。研究人员构建了一个专门针对建筑与土木工程的庞大且复杂的测试,以观察 AI 是否真的能像工程师一样“思考”。他们不仅要求 AI 描述一张图片,还给了它一个谜题——答案隐藏在图纸的不同部分,并且需要特定的物理规则才能解开。研究结果令人警醒。虽然最聪明的 AI 模型能答对大约一半的问题,但一个由人类专家组成的团队几乎答对了所有问题。研究发现,AI 失败并不是因为它看不见图片,而是因为它无法将图片与正确的规则联系起来,并进行数学计算得出答案。这就像 AI 能读懂菜单并看到食材,却不知道如何烹饪这道菜。

大考:MMArch

研究人员创建了一个名为 MMArch(多模态建筑学)的基准测试。把它想象成一场 AI 的期末考试,但它不是那种你可以通过猜测来完成的选择题,而是一套简答题。该考试由 1,212 个问题组成,这些问题直接取自关于建筑物、桥梁和城市的真实同行评审科学论文。这些不是虚构的图片;它们是工程师用来证明其设计有效的实际图表。

该测试涵盖了 10 个不同领域,从建筑在地震中的震动方式到我们如何设计城市的数字模型。为了确保 AI 无法走捷径,研究人员使用了一个巧妙的“规划者-编写者”系统。首先,一个“规划者”查看论文并挑选出一个特定的答案(例如“6 号和 7 号钢筋”)。然后,一个“编写者”创建一个必须结合图片并了解工程规则才能找到该答案的问题。AI 不能只阅读文本或只看图片的局部,它必须观察整幅图,寻找正确的线索,并应用规则来解决问题。

结果:AI 对决人类

当他们让 18 种不同的 AI 模型(包括免费的开源模型和昂贵的顶级商业模型)通过这项测试时,结果非常明确:AI 距离成为真正的工程师还有很长的路要走。

  • 人类专家: 一个由真实建筑师和工程师组成的专家组答对了 94.6% 的题目。他们完美通过了考试。
  • 最强的 AI: 最聪明的商业 AI 模型(GPT-5.5)仅答对了 51.7%
  • 开源 AI: 最好的免费模型表现约为 30%

这是一个超过 40 个百分点 的差距。即使是最强的 AI 也仅仅是勉强及格,而人类的得分接近完美。研究人员进行了检查,以确保 AI 不仅仅是在瞎猜或通过阅读文本而非观察图片来答题,他们确认 AI 确实在推理环节遇到了困难。

为什么 AI 如此挣扎?

团队不仅停留在分数层面;他们还研究了 为什么 AI 会出错。他们发现,问题不在于 AI 看不见图片。AI 在识别图表中的正确线条和数字方面其实做得相当不错。真正的麻烦发生在 AI 尝试将所见之物与已知知识结合的时候。

他们将错误分为五类:

  1. 感知错误 (20.3%): AI 误读了图片(例如混淆了两条相似的线)。
  2. 原理错误 (21.7%): AI 看对了图片,但使用了错误的规则(例如认为图表中宽阔的环形意味着材料正在变弱,而实际上这意味着它正在变强)。
  3. 组合错误 (35.8%): 这是最大的问题。AI 找到了正确的数字并知道了正确的规则,但当它尝试将两者结合起来得出最终答案时,它漏掉了一个步骤或搞错了数学运算。这就像拥有所有的食材和食谱,却因为忘记了正确的混合顺序而烧焦了蛋糕。
  4. 定位错误 (14.5%): AI 知道要找什么,但读错了数字(例如把 -142 读成了 +138)。
  5. 一致性错误 (7.7%): AI 在“大脑”中得出了正确答案,但写下的却是错误的答案。

最大的启示是,组合错误占了所有错误的三分之一以上。这意味着 AI 最大的弱点是连接点与点之间的逻辑。它可以看到证据,也可以回忆起规则,但它无法可靠地将它们结合起来解决复杂问题。

“循序渐进地思考”有帮助吗?

你可能听说过,告诉 AI “一步步思考”(一种称为“思维链”的技术)可以帮助它解决难题。研究人员在 MMArch 上尝试了这一点。他们要求 AI 在给出答案之前先解释其推理过程。结果如何?效果并不显著。对于某些模型,这让它们稍微变好了一点;而对于另一些模型,这反而让它们变得更糟。这表明,问题不在于 AI 需要被告知如何思考,而在于它本身对于建筑和工程的具体规则了解得不够多,以至于无法构建一个正确的思维链。

未来展望

研究结论指出,我们不能仅仅通过扩大 AI 的规模或提供更多数据来解决这个问题。问题不在于规模的大小,而在于缺乏深层的、专业化的推理能力。AI 需要学习如何将视觉证据与领域知识绑定在一起,而目前的模型还无法做到这一点。

MMArch 现在已开放给其他研究人员使用,作为训练场。它是一个诊断工具,帮助我们准确看到 AI 在哪里失败,以便我们为未来构建更好的模型。在那之前,如果你需要设计一座在地震中不会倒塌的摩天大楼,雇佣一位人类专家显然比询问一个机器人要靠谱得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →