想象一下,地球就像一床巨大的、发着光的拼布被子。有些方块是由深色的沥青和混凝土组成的,像七月的黑色汽车一样吸收着阳光。另一些方块则由绿草或蓝水组成,保持着凉爽与清新。这种温差不仅仅关乎舒适度,更是一个生死攸关的问题。当城市变得过热时,可能会导致人们生病甚至死亡。科学家们称之为“地表温度”(LST),这基本上是一种测量地面热度而非空气温度的专业说法。
长期以来,科学家们一直试图预测这种热量,但他们的地图往往是模糊的。他们观察的是巨大的土地块,就像隔着一层雾气浓重的窗户观察一座城市,从而错过了热量实际积聚的微小细节。此外,他们大多一次只研究一两个城市,这使得很难比较一种新方法是真的有效,还是仅仅运气好。为了解决这个问题,研究人员需要一个巨大、清晰且共享的游乐场,让每个人都能在同样的街区级复杂谜题上测试他们的预测工具。
于是,HeatCast 诞生了。这是一个全新的项目,它就像一个用于预测城市热量的超高清视频游戏关卡。该团队并没有观察整个城市,而是创建了一个基准,将视角缩小到单个街区,横跨美国 124 个不同的城市。他们收集了从 2013 年到 2025 年中期的长达十年的卫星照片,创建了一个细节如此丰富的数据集,以至于它能看清热停车场与紧邻其侧的凉爽公园之间的温差。
研究人员并不仅仅是堆砌数据;他们为计算机模型建立了一场严格的“考试”。他们设定了一个特定的挑战:观察过去 12 个月的天气和土地数据,然后预测下个月的地表温度。他们在这场考试中测试了两类不同的 AI “学生”。一种是经典的、可靠的学生(CNN+LSTM),另一种是更新、更先进的学生,名为 Earthformer。
结果令人感到意外。先进的 Earthformer 模型表现得更好,其预测热量的平均误差为 7.74 K(开尔文),而经典模型则偏离了 10.42 K。但最有趣的发现不仅在于哪个模型更聪明,而是在于它们是如何思考的。研究人员发现,最好的预测并非仅仅来自于观察过去的受热记录。事实上,当 Earthformer 模型完全忽略过去的受热数据,转而专注于另外八个线索(如植被覆盖率、可见水量以及地面的反照率/光泽度)时,它的误差率达到了最低的 7.72 K。事实证明,了解地面“看起来”是什么样子,往往比仅仅知道昨天有多热,更能成为预测未来热度的精准“水晶球”。
这篇论文并不声称已经永久解决了热量问题,但它向科学界交付了一个强大的新工具。通过发布所有的数据、代码和模型的“标准答案”,他们为所有人提供了一个公平的方式来构建更好的热量预测工具。这可以帮助城市规划者明确知道在哪里种植树木或建设公园,以冷却那些最热、最脆弱的社区,让城市对每个人来说都更加安全、更加舒适。
技术摘要:HeatCast —— 邻里尺度地表温度(LST)预测的基准测试
问题陈述
地表温度(LST)是理解城市热环境的关键指标,但目前尚缺乏一个广泛采用的、用于邻里尺度(30 米分辨率)预测的开源基准。先前的研究受到以下三个主要因素的限制:
- 地理范围: 大多数研究仅侧重于一到三个城市。
- 分辨率: 现有数据集通常使用公里级产品,这会抹平关键的城市内部热梯度(例如,不透水表面与植被之间的差异)。
- 可复现性: 许多研究并未发布数据、代码或标准化的评估协议,导致难以比较不同研究的模型性能或任务难度。
因此,社区缺乏一种标准化的方法来评估跨越多样化城市环境的次月 LST 预测模型。
方法论
数据集构建 (HeatCast)
作者构建了 HeatCast,这是一个涵盖 124 个美国城市(城市足迹大于 90 平方英里)的基准数据集。
- 时间覆盖范围: 从 2013 年中期(Landsat 8 投入使用)到 2025 年 6 月。
- 空间分辨率: 30 米网格,源自 Landsat 8/9 Collection 2 Level-2 数据。
- 数据量: 约 140 万个 128×128 像素的图块(约 150 GB)。
- 输入通道(每张图块 9 个):
- 地表温度 (LST)。
- 数字高程模型 (DEM)。
- 地表反射率 RGB(波段 2–4)。
- 光谱指数:NDVI、NDWI 和 NDBI。
- 宽带反照率 (Albedo)。
- 标签: 每个像素都被分配了一个局部气候带 (LCZ) 标签(17 个类别 + 未分类),以实现分层评估。
- 预处理: 对影像进行镶嵌处理,重投影至统一的 UTM 网格,并对受云影响的像素进行掩模处理。序列中缺失的月份通过线性插值(最多连续两个月)进行处理,或直接剔除。
基准测试协议
- 任务: 次月 LST 预测。给定连续 12 个月的 9 通道观测数据,预测下一月的 LST 通道。
- 时间划分:
- 训练集: 2013–2021 年。
- 验证集: 2022–2023 年。
- 测试集: 2024 年 1 月–2025 年 6 月。
- 指标: 以开尔文 (K) 为单位的均方根误差 (RMSE),报告为有效像素的平均值。评估按 LCZ 超类进行分层(紧凑城市、开阔城市、其他城市、自然区域)。
基准模型
实现了两种架构并在时间划分上进行了训练:
- CNN+LSTM: 一个两层卷积编码器(64 个隐藏通道)后接一个 128 单元的 LSTM 进行时间建模,以及一个线性解码器。
- Earthformer: 一种基于 Transformer 的模型,使用长方体注意力机制进行时空预测,配置为 256 个基础单元、4 个注意力头和一个堆叠卷积下采样器。
两种模型均使用 AdamW(学习率 5×10−4)进行训练,并采用了早停机制和数据增强(旋转/翻转)。
关键结果
基准性能
- Earthformer 实现了测试集总 RMSE 为 7.74 K。
- CNN+LSTM 实现了测试集总 RMSE 为 10.42 K。
- LCZ 分层表现: Earthformer 在开阔城市、其他城市和自然区域类别中优于 CNN+LSTM。然而,CNN+LSTM 在紧凑城市像素上的表现更好(8.62 K 对比 12.68 K),而此类像素仅占数据集的 0.76%。
特征消融实验 (Earthformer)
作者研究了不同输入通道子集的预测价值:
- 仅辅助通道(无 LST): 使用 8 个非 LST 通道(DEM、RGB、指数、反照率)得到了最低 RMSE 7.72 K。
- 全通道: 7.74 K。
- 仅 LST 历史数据: 8.15 K。
- 仅 RGB: 8.68 K。
这表明对于 Earthformer 而言,辅助变量提供的预测信号比仅靠历史 LST 强。相反,对于 CNN+LSTM,移除历史 LST 会显著降低性能(RMSE 从 10.42 K 上升至 12.47 K)。
重要性与主张
论文提出了以下贡献与意义:
- 首个邻里尺度基准: HeatCast 是第一个针对 124 个美国城市、在 30 米分辨率下进行每月 LST 预测的共享基准,填补了先前公里级或单城市研究留下的空白。
- 可复现性: 该数据集、代码、固定的时间划分以及参考评估框架均基于 MIT 许可证发布,允许对未来模型进行直接比较。
- 对预测特征的洞察: 消融研究表明,在针对此特定预测任务的 Transformer 模型中,非 LST 通道(特别是反照率和光谱指数等辅助变量)可以超越历史 LST 数据。
- 为未来工作奠定基础: 该基准支持关于类别平衡预测(特别是针对稀有的紧凑城市类别)、特征融合以及地理空间基础模型在热预测领域应用的研究。
作者指出了局限性,包括 Landsat LST 产品固有的不确定性(晴空条件下为 1–2 K)、侧重于具有足够无云影像的大型城市,以及该基准评估的是已知城市的未来日期而非向未见地理区域的迁移。数据集可通过 https://doi.org/10.57967/hf/9889 获取。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。