想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是指纹或脚印,而是通过观察城市照片来推测居住在那里的人们有多富有、多健康或受教育程度如何。这个科学领域被称为“城市社会经济感知”(urban socio-economic sensing)。长期以来,计算机一直擅长识别照片中的简单事物,比如“那是一辆车”或“那是一棵树”。但想要推测复杂的社会故事——比如一个社区的平均收入或预期寿命——就像是要求一台计算器去写一首诗一样难。这很难,因为这些数字是抽象的,而且数据非常杂乱。最近,我们开发了“大型视觉语言模型”(LVLMs),它们是超级聪明的 AI 大脑,可以同时看图并阅读文字。它们就像是读遍了图书馆里每一本书、看过互联网上每一张照片的学生。研究人员提出的核心问题是:我们能否教会这些 AI 学生不仅是去猜测数字,而是真正学会通过城市照片中的线索进行思考,从而理清居住在那里的人们背后的故事?
这就是名为 CityRiSE 的新项目发挥作用的地方。该项目的研究人员意识到,虽然这些 AI 模型功能强大,但它们在面对从未见过的城市,或者面对未被明确教授过的特定社会问题时,往往难以做出准确的判断。此外,它们往往只是直接吐出一个数字而没有解释“为什么”,这使得人们很难信任它们。为了解决这个问题,团队不仅仅是给 AI 喂了更多的图片;他们还教会了它如何使用一种叫做强化学习(Reinforcement Learning)的方法来进行推理。把这想象成训练一只狗,只不过 AI 得到的不是零食,而是在它正确解开谜题时获得的“奖励”。团队构建了一个特殊的训练游戏,要求 AI 观察街景和卫星图像,发现重要的线索(比如建筑物的类型、绿化的存在或道路的状况),然后通过逐步解释其思考过程,最后给出最终答案。
CityRiSE 的秘诀在于如何奖励 AI。研究人员设计了两种类型的奖励。第一种是“回归奖励”(Regression Reward),它就像一张计分卡。如果 AI 猜经济状况是“7”,而真实答案是“8”,它会得到不错的奖励;如果它猜的是“1”,则会受到重罚。这教会了 AI,接近正确答案比错得离谱要好。第二种是“关键词奖励”(Keyword Reward),它就像一份清单。如果 AI 在解释中提到了特定的、有用的事物,比如“车辆”、“绿化”或“街道设施”,它就会获得积分。这迫使 AI 去观察图片的正确部分并解释其逻辑,而不是仅仅凭空捏造一个答案。他们还给 AI 了一些额外的练习题,比如判断一张照片来自哪个城市或计数物体,以磨练其通用的推理能力。
结果非常令人印象深刻。团队仅使用大约 5,109 个样本就训练好了 CityRiSE,与其他模型通常需要的数百万张图像相比,这是一个极小的量。尽管数据集如此之小,CityRiSE 的表现仍然优于许多现有的模型,包括一些非常昂贵的商业 AI 系统。更令人兴奋的是,它展示了一种罕见的能力,叫做“泛化”(generalization)。这意味着它能够观察一个它从未见过的城市(比如另一个国家的城市),或者尝试预测一种它从未被要求过的统计数据(比如心理健康获取能力,而不是仅仅是收入),并且依然能做出良好的预测。论文表明,通过学习如何通过视觉线索进行推理,AI 不仅仅是死记硬背训练数据,它还学习了一种能在新环境下运作的灵活思维方式。
简而言之,CityRiSE 表明,如果你教一个大型 AI 模型“展示其解题过程”,并奖励它寻找正确的视觉线索,它就能成为一个更出色的城市侦探。它超越了仅仅吐出数字的“黑箱”,变成了一个能够解释为什么一个社区可能正在挣扎或繁荣的工具,而这种解释是基于它在图像中实际看到的。这种方法表明,未来 AI 可以帮助我们在不需要为每一个新问题都准备海量预标注数据的情况下,理解新的地方所面临的复杂社会问题。