城市正面临着一种新型的危险,这种危险需要持续的、超局部的监测才能保障人们的安全。空气中的细颗粒物肉眼不可见,却对肺部具有致命威胁,是全球范围内导致过早死亡的主要原因,而在污染最严重且数据最匮乏的地方,其打击也最为沉重。为了应对这一挑战,城市规划者和卫生官员需要了解未来几小时内空气质量的变化情况,且必须精确到单个街角。他们还需要预测局部温度,以应对热浪并管理能源消耗。问题在于,那些最需要这些预测的城市,往往缺乏用于构建定制预测工具所需的长期、高质量的数据记录以及昂贵的计算能力。多年来,对于这些资源匮乏的运营者而言,标准的建议一直是:要么从头开始构建微型、高效的模型,要么从数据丰富的城市那里借鉴知识,其背后的假设是:最新、最强大的预测引擎过于庞大且复杂,无法在网络边缘运行。
来自孟加拉国拉杰沙希大学的一个研究小组决定测试这一长期存在的假设。他们旨在测试新一代“基础模型”——即在来自世界各地的海量数据上进行预训练的大型人工智能系统——是否能够在从未接触过特定城市数据的情况下,实际预测该城市的空气质量和温度。他们比较了三种不同的方法:在本地训练一个小型定制模型;从数据丰富的城市借用一个模型并针对当地条件进行微调;以及直接下载一个预训练好的基础模型并让其立即投入使用,这种方法被称为“零样本学习”。他们在二十九个城市中测试了这些策略,涵盖了从首尔、纽约等数据丰富的枢纽,到内罗毕、坎帕拉等数据匮乏的地区,监测指标包括每小时的空气污染水平和局部温度。
研究结果推翻了关于基础模型过于沉重而无法用于本地使用的传统观念。在预测空气污染时,预训练的基础模型的表现与经过精心调优的本地专家模型不相上下,尽管该基础模型从未见过该城市的任何一个数据点。事实上,当研究人员将能源成本和模型训练所需的时间考虑在内时,预训练选项往往更具优势。当系统需要频繁重新训练(这是保持预测准确性的常见要求)时,基础模型消耗的能量大约比本地模型少十倍。只有在本地定制模型被训练一次后便几乎一年不再变动的情况下(这在瞬息万变的空气质量监测领域很少见),它才会比基础模型更具能源效率。
这项研究还揭示了许多科学对比中存在的一个隐藏缺陷。在预测温度时,本地专家模型看起来似乎具有压倒性优势,但一旦研究人员纠正了一个微妙的时间误差,这一优势便消失了。原始测试给了本地模型一个关于未来状况的“完美天气预报”,从而使其能够做出预测,这是一种在现实世界中并不存在的公平偏差。一旦研究人员限制模型只能使用在做出预测那一刻实际可用的天气数据,本地模型的领先优势就缩减到了可以忽略不计的程度,而预训练的基础模型依然是一个强力且可靠的选择。这一发现表明,许多声称某种方法优于另一种方法的先前研究,可能受到了同样时间误差的误导。
最终,研究人员发现,对于数据有限且预算紧张的城市来说,最好的策略通常是停止尝试构建定制引擎,转而开始下载现成的引擎。预训练的基础模型在准确性上与最好的本地模型在统计学上没有显著差异,同时在速度和能源效率方面具有巨大优势。它不需要当地的工程师团队,也不需要长期的本地历史数据。研究结论指出,数据匮乏城市的预测默认策略已经发生了变化:与其训练一个小模型,不如下载一个大型预训练模型并让它发挥作用。这种转变可以将高质量的空气质量和温度预测变得触手可及,使那些长期被遗忘的城市受益,将一个复杂的工程挑战转化为一个简单的文件下载过程。
技术摘要:面向城市空气质量与温度预测的成本感知型时间序列基础模型评估
问题陈述
对超局部空气质量和天气预报需求最紧迫的城市,往往也拥有最短的数据记录和最紧凑的计算预算。处于这些资源受限环境中的运营商通常面临三种部署策略:训练一个高效的本地专家模型(通过神经架构搜索或标准模型)、从数据丰富的城市迁移模型,或者以零样本(zero-shot)方式利用预训练的时间序列基础模型(TSFMs)。领域内存在一个普遍假设,即基础模型计算量过大,不适合边缘侧部署,因此认为搜索和迁移是仅有的可行路径。此外,标准的评估基准通常依赖于“完美预知”的协变量(使用在预测目标时刻可获得的未来气象数据),这可能会人为地抬高依赖协变量模型的表现,尤其是在跨领域比较中。本研究测试了“基础模型过于沉重”这一前提的有效性,并调查了协变量时序性的方法论伪影是否扭曲了跨领域结论。
方法论
本研究在两个领域(每小时城市 PM2.5 和 2 米气温)针对 29 个城市(14 个数据丰富城市,15 个数据稀缺城市)评估了五类模型层级。评估框架包括:
- 模型层级:
- 季节性朴素模型(Seasonal-naïve): 一个 168 小时的持续性基准。
- LightGBM 专家模型(LightGBM Specialist): 一个使用滞后目标值、日历特征和气象协变量的梯度提升树模型。
- NAS-GRU: 一个通过多目标神经架构搜索(Green-NAS-A)发现的 15.3 万参数循环神经网络模型。
- Chronos-Bolt(零样本): 一个在不进行训练的情况下运行、使用四周上下文窗口的 4800 万参数基础模型。
- Chronos-Bolt + 协变量: 一种基础模型预测在协变量上进行岭回归后的残差的变体。
- 协变量时序消融(Covariate Timing Ablation): 模型在两种机制下进行评估:
- 因果模式(可部署): 协变量被限制为在预测起点已知的值(最后已知值)。
- 完美预知模式(上限): 协变量被设置为其在预测目标时刻的值(标准基准惯例)。
- 评估指标: 准确度通过具有固定序列尺度的平均绝对比例误差(MASE)进行衡量。统计显著性通过在控制错误发现率(FDR)下的 Diebold–Mariano、符号检验和 Wilcoxon 检验进行评估,同时辅以配对等效检验(TOST)。
- 成本与能源: 能源消耗直接在边缘/CPU 类硬件(消费级 GPU 和仅 CPU 设备)上使用
codecarbon 进行测量。通过一个成本调整后的决策规则,最小化 MASE+λ⋅USD/1000 次预测,以生成部署获胜图谱。
- 迁移学习实验(E4): 将 NAS-GRU 模型在数据丰富城市进行预训练,并在不同数据预算({0, 1, 10, 100}% 的本地历史数据)下在数据稀缺城市进行微调,以对比其与零样本性能的表现。
关键结果
- PM2.5 性能: 在可部署的因果协变量下,零样本 Chronos-Bolt 模型与经过调优的 LightGBM 专家模型在统计上无法区分(MASE 分别为 0.662 和 0.692)。在 29 个城市中,没有任何模型记录到相对于另一个模型的 FDR 显著优势。在完美预知协变量下,两者在 0.05-MASE 范围内形式上是等效的。零样本模型的性能与本地数据量之间没有检测到相关性。
- 温度性能: 专家模型在完美预知协变量下的所谓优越性(MASE 0.533 对比 0.792)是评估惯例造成的伪影。当限制在因果协变量下时,专家模型的领先优势缩小为微小且不显著的差异(MASE 0.745 对比 0.792)。“完美预知”假设本身在该领域为专家模型带来了 +0.212 的 MASE 提升。
- 迁移学习: 在数据稀缺机制下,迁移学习方案(预训练的 NAS-GRU)在任何微调预算下都从未显著优于零样本模型。零样本模型在每个预算水平下均处于领先地位。
- 能源与成本: 在频繁重训练协议下,零样本模型消耗的能量大约是专家模型的数量级(1.0–1.2 kJ/1,000 次预测 对比 9.5–15.1 kJ/1,000 次预测),因为它避免了训练步骤。然而,研究指出,一个一旦训练完成的专家模型在经过约 2,800–4,400 次预测(120–180 天的每小时服务)后,最终会实现成本摊销并变得更具能源效率。
- 部署图谱: 当将成本纳入目标函数时,在现实的(因果)协变量可用性下,零样本基础模型家族在 PM2.5 和大多数温度场景中占据了部署获胜图谱的主导地位。只有当运营商能够获得可靠的、数值天气预报(NWP)级别的协变量预测(完美预知)时,专家模型才会获得显著优势。
意义与主张
本文提出了三个主要贡献:
- 测试效率前提: 这是首次将搜索、迁移和零样本策略进行面对面比较的研究,其中准确度、实测能耗和成本被纳入统一的决策规则。研究发现,“基础模型对于边缘侧过于沉重”这一前提在经验测试中并未成立;紧凑的基础模型(如 Chronos-Bolt-small)在准确度上能匹配调优后的专家模型,同时在频繁重训练时消耗更少的能量。
- 方法论修正: 本文证明了协变量时序性本身可以制造出虚假的跨领域结论。使用未来协变量的标准做法,为那些气象因素几乎是确定性驱动因素的领域(如温度)创造了人工优势,这种扭曲在单一领域内是不可见的,但在跨领域比较中至关重要。作者建议对所有使用未来协变量的基准测试进行因果协变量消融分析。
- 操作指导: 对于数据稀缺城市的运营商而言,实际的默认选择已从“训练一个小模型”转向“下载一个模型”。研究提供了一个成本调整后的决策规则,允许运营商根据其特定的电价、硬件和重训练频率来重新推导部署获胜者。研究表明,在数据稀缺机制下,迁移学习路径在准确度上并不比零样本路径具有优势,从而消除了在这些背景下构建复杂迁移流水线的必要性。
作者对其主张保持了谦逊,指出零样本模型是“匹配”而非“超越”专家模型,并强调能源优势取决于重训练频率。他们同时也承认了研究的局限性,包括硬件特异性(消费级 GPU 与嵌入式设备)、预训练语料库中的潜在数据污染,以及评估范围(每小时、24–48 小时预测时界)。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。