A multi-view contrastive learning framework for spatial embeddings in risk modelling
本文提出了一种新颖的多视图对比学习框架,该框架通过从卫星图像和 OpenStreetMap 数据中生成低维空间嵌入,以增强保险及房地产应用中风险模型的预测准确性和可解释性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,仅凭地图上的一个点就试图理解一个地方的特征。几十年来,保险公司和房地产分析师正是这样做的,他们将一个位置仅仅视为一对数字:经度和纬度。他们曾希望这些坐标能告诉他们关于风险或物业价值所需了解的一切。但地图上的一个点是沉默的;它并不知道自己是位于繁华的市中心、宁静的乡村山谷,还是易受洪水影响的河岸。它看不见附近的商店、建筑物的类型,也看不见景观的纹理。当分析师仅依赖这些原始数字时,他们的模型往往会错过那些定义人类生活方式和自然行为的微妙且真实的模式。他们最终会在流动的风险周围画出人工的、方方正正的线条,就像试图通过画一系列笔直的矩形阶梯来描述一条蜿蜒的河流一样。
为了解决这个问题,研究人员开始使用一种被称为“嵌入”(embedding)的技术。可以将嵌入想象成一个地方的数字指纹。与其只用一对数字,不如用一组捕捉其本质的数值列表来表示一个位置:它的外观、周围的环境以及它在更广阔世界中的地位。本文介绍了一种创建这些指纹的新方法,即通过教计算机同时从多个角度观察一个地方。研究人员将展示土地物理形态的卫星图像,与显示人类活动的数字地图(如学校、商店和公园的位置)结合在一起。通过训练计算机将这些视觉和背景线索与精确的地理坐标相匹配,他们创建了一个系统,仅凭经度和纬度就能生成任何位置丰富且详细的描述。
由 Freek Holvoet 及其同事领导的团队构建了一个包含欧洲近 96,000 个位置的海量数据集。对于每个地点,他们收集了一张卫星照片和来自全球地图项目的周边设施详细计数。然后,他们训练了一个计算机模型,以学习视觉和背景数据与该地点特定坐标之间的联系。模型学会了表达:“这种建筑和绿地的模式属于这些特定的坐标。”一旦模型学会了这种关系,它就可以完全忘记图像和地图。从那时起,它只需获取任何新位置的一对坐标,就能瞬间生成一个包含该地点所有已知环境信息的复杂数字指纹。
研究人员在两个截然不同的现实场景中测试了这个系统。首先,他们研究了法国的房价。他们将仅使用原始坐标的标准模型与使用这种新型数字指纹的模型进行了对比。结果显而易见:使用指纹的模型预测价格的准确度更高。更重要的是,新模型能够以旧模型无法做到的方式“看见”景观。当研究人员将预测结果可视化时,旧模型产生了块状且不自然的地图,价格在隐形的界限处发生突变。而新模型则产生了平滑且真实的地图,能够正确识别巴黎周边和阿尔卑斯山脉的高价值区域,同时识别出农村地区的较低价值。他们甚至表明,该系统可以对从未见过房屋交易的地区做出合理的预测,因为它理解了这些地区的地理特征。
在第二个测试中,团队将该方法应用于比利时的洪水保险。他们分析了数千起洪水索赔案例,以观察数字指纹是否能帮助划分风险区域。同样,使用指纹的模型表现优于使用原始坐标的模型。它们能更好地区分高风险和低风险社区,捕捉到河谷沿线危险区域的真实形状,而不是将其强行塞入人工的方框中。研究还表明,这些数字指纹的生成时间不到一毫秒,足以用于日常的保险定价。
这项工作表明,风险分析的未来在于赋予计算机更丰富的“场所感”。通过教机器理解一个位置不仅是空间中的一个点,而是一个具有特定视觉和社会背景的场所,分析师可以建立更准确、更公平的模型。研究人员证明,这些工具可以在标准计算机上进行训练并适应不同地区,为改进我们定价保险和管理风险提供了一种实用的方法,而无需在每次计算中都访问敏感或专有的数据。其结果是一个像人类一样看待世界的系统,它理解你身处何处很重要,但你周围的环境同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。