AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery
本研究表明,视觉语言模型(尤其是通过思维链提示进行增强后)能够通过利用视觉模式识别,在通过街景图像预测建筑类型方面达到约 70% 的准确率,尽管它们与人类专家不同,即对更广泛的上下文线索和领域知识的依赖程度较低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图了解一座城市,但你不是在街道上行走,而是通过一个巨大的、高科技的摄像机从地面向上观察一切。这就是城市分析的世界——在这个领域,科学家和规划师试图绘制出城市运作的图谱,从建筑物的材料到它们有多少层楼。长期以来,为了获取这些信息,专家们必须走访每一栋建筑,做笔记,并猜测其用途——这是一项缓慢、昂贵且令人精疲力竭的工作。但最近,一种新型的“大脑”进入了这场游戏:视觉语言模型(Vision-Language Model,简称 VLM)。把 VLM 想象成一个超级聪明的机器人,它读过互联网上几乎所有的书,同时也学会了如何“看”图片。它可以通过将所看到的图像与它所掌握的语言知识相结合,不仅能看出一栋房子长什么样,还能识别出它的材质、有多少层楼,以及人们在里面做什么。大家都在问一个大问题:这个机器人能否做得像建筑师或工程师这样的专业人类专家一样好,尤其是在数据难以获取的地方?
这篇论文将这个问题带到了印度尼西亚北雅加达那繁忙、混乱且充满活力的街道上,那里的建筑往往是手工建造、随时间不断增改,且并不总是遵循官方规则。研究人员想要看看这些 AI 机器人是否能通过街景照片,正确地猜出数千栋建筑的“类型学”(这是“类型与用途”的一个高级说法)。他们让三个最著名的 AI 模型——GPT-4o、Claude 3.5 Sonnet 和 Gemini 2.0 Flash——与一支人类专家团队进行了一场友好的竞赛。这些人类专家是土木工程师和建筑师,他们凭借多年的训练提供正确答案,充当“金标准”。AI 模型被给予了一套特殊的指令或“提示词”,以观察要求它们“循序渐进地思考”(这种技术被称为思维链,Chain-of-Thought)是否能帮助它们取得更好的成绩。
结果既有令人印象深刻的高光时刻,也有一些有趣的、像人类一样的错误。AI 模型在猜测基础信息方面表现得相当不错。在统计建筑楼层数量时,机器人的判断与人类的一致率达到了 70% 到 80%。这就像 AI 非常擅长通过数窗户来推测高度。然而,当涉及到猜测建筑的“用途”(例如是商店、住宅还是工厂)时,一致性下降到了 60% 到 70% 左右。AI 有时会感到困惑,因为从街道上看,住宅和小型店铺看起来非常相似。研究发现,“思维链”方法(即强制 AI 在给出答案前先解释其推理过程)使模型变得更加稳定和可靠,就像学生在考试时展示解题步骤会表现得更好一样。
最有趣的发现之一是 AI 和人类是如何进行不同思考方式的。AI 就像一个只相信亲眼所见物的侦探:它过度关注物理特征,如“墙壁”、“窗户”、“材料”和“高度”。而人类专家则像是了解社区氛围的老练当地人。他们看着同样的图片,但也会考虑区域的“氛围”、建筑的状态以及社区的背景。例如,如果一栋建筑看起来有些破旧,但位于繁忙的集市区域,人类可能会猜它是商店,而 AI 可能只看到“旧砖块”并猜它是仓库。论文指出,虽然 AI 目前还不完美,但它已经能完成人类约 70% 的工作,并且它能以极大的规模进行,在极短的时间内查看 30,000 栋建筑。
研究人员得出结论,这些 AI 工具尚未准备好完全取代人类专家,尤其是在处理像猜测非正式社区中复杂的建筑用途这类棘手工作时。然而,它们是强大的合作伙伴。它们可以充当“初步筛选”,快速处理数千张图像,为规划者提供城市概貌的直观印象,这在数据匮乏或陈旧的地区非常有帮助。这项研究表明,通过将 AI 识别视觉模式的能力与人类理解语境的专业知识相结合,我们可以构建出一幅更清晰的城市图景。这并不是关于机器人胜出的比赛;而是关于机器人与人类如何共同协作,去解开城市世界的谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。