想象一下,你正试图预测未来几天的天气,以决定是否要带把伞。现在,想象一下你不是在预测天气,而是在预测美国不同城市流感的传播情况。这正是这篇论文的研究人员想要做的事情:建立一个最完美的“流感天气预报”。
他们想要弄清楚哪种现代计算机大脑(AI 模型)最擅长预测未来 1 到 4 周内会有多少人病倒或需要住院。
以下是他们的研究发现,通过一些简单的类比进行了拆解:
1. 大考:“AI 模型”的口味测试
研究人员收集了来自美国 10 个不同地区的流感样症状和医院就诊数据。然后,他们将这些数据输入到 17 种不同类型的 AI 模型中,看看谁能最好地预测未来。
可以将这些模型想象成不同类型的厨师:
- “老派”厨师: 这些是存在已久的传统统计模型。
- “专业型”厨师: 这些是专门为数字和时间构建的深度学习模型(如 PatchTST 和 iTransformer)。
- “语言型”厨师: 这些最初是为写故事或聊天而设计的模型(大语言模型或 LLMs,如 TimeLLM 和 Chronos)。研究人员想知道这些“文字智慧”是否也能转化为“数字智慧”。
- “主厨”(专家混合模型): 这是一个名为 MultiFoundationCore 的新模型。它不像依赖单一厨师那样,而是像一位主厨,倾听不同专家的意见,并将他们的最佳想法结合起来,形成一个最终的预测。
2. 结果:谁赢得了比赛?
结果出人意料,但也证实了专家的猜想。
- “语言型”厨师表现挣扎: 那些为文本设计的模型(LLMs)表现不如专门处理数字的模型。论文指出,试图将流感数字转化为“文字”来处理,就像是通过阅读一首关于汤的诗来测量汤的温度一样。你会丢失进行准确预测所需的精确、连续的细节。
- “专业型”厨师表现出色: 专门为时间序列数据构建的模型(如 PatchTST)非常强大。当它们经过“预训练”后,表现会变得更好。
- 预训练类比: 想象一位厨师在来到你的厨房之前,先在意大利学习如何做意面。预训练就像是让 AI 在开始学习流感知识之前,先学习来自其他来源(如交通模式或其他疾病爆发)的海量数据。这给了这些专业厨师一个巨大的领先优势,尤其是在预测 3 到 4 周后的情况时。
- “主厨”夺冠: MultiFoundationCore 模型占据了榜首。通过融合多个不同“专家”模型的预测,它创造了一个比任何单一模型都更准确、更稳定的预测。这就像是让一个专家小组对天气进行投票,而不是只询问一个人。
3. 两种测试方式:时间 vs 空间
研究人员通过两种不同的方式测试了模型,就像驾照考试一样:
- 时间测试(时间维度): 他们在一个城市的历史数据上训练模型,并要求它预测该城市自身的未来。这测试了模型是否学习到了当地流感的“季节性节奏”。
- 空间测试(空间维度): 他们在一些城市的数据上进行训练,并要求它预测完全陌生的城市的流感情况。这测试了模型是否能够适应不同的群体和报告风格。
- 结果: 模型在“时间测试”中表现普遍更好。预测一个新城市(空间测试)更难,因为每个城市在人们生病和报告方式方面都有其独特的“个性”。
4. 秘密配方:更多数据和更多信号
研究还观察了给予模型额外帮助时会发生什么:
- 更长的历史记录: 给模型提供更长的流感数据历史(20 年对比 3 年)有助于它预测更远的未来。这就像是在猜测接下来会发生什么之前,先读了一本更长的日记。
- 交叉训练: 他们发现,教导模型理解住院人数有助于它更好地预测流感症状,反之亦然。这就像一位既了解咳嗽又了解发烧的医生;了解其中之一有助于理解另一个。
- 更新模型: 他们发现,频繁地重新训练模型(每隔几周用新数据更新一次)可以保持其敏锐度,但如果每天都进行更新,对计算机来说成本太高。适度的更新频率是最佳平衡点。
核心结论
该论文得出结论,对于短期(1-4 周)的流感预测:
- 不要使用“文字”模型: 为语言构建的模型并不适合处理像疾病率这样连续的数字。
- 使用“专业型”模型: 为时间序列数据构建的模型效果最好。
- 预训练是关键: 在执行主任务之前,让这些模型学习相关数据(如医院记录)会让它们变得更聪明。
- 进行组合: 最好的方法是将几种不同的模型混合在一起(“专家混合模型”),以获得最可靠的预测。
研究人员发布了所有的代码和数据,以便他人可以使用这个“测试厨房”,在未来构建更强大的公共卫生工具。
技术摘要:理解流行病预测中时间序列基础模型的核心特征
问题陈述
准确的季节性流感短期预测是美国公共卫生的关键需求,直接影响疫苗接种时机、医院人员配置和资源分配。虽然 CDC 的 FluSight 和 COVID-19 Forecast Hub 计划已经为流行病预测建立了具体的基准,但现代时间序列基础模型(FMs)以及基于大语言模型(LLM)的方法在实际运行的传染病数据上的表现仍未得到充分表征。
现有的流行病学时间序列基础模型评估存在四个主要局限性:
- 数据范围: 它们通常依赖于单一的国家级时间序列,历史记录有限,无法捕捉对于现实世界规划至关重要的多季节区域模式。
- 泛化能力: 很少测试空间泛化能力(即在具有不同人口统计特征和报告实践的不同区域之间进行迁移)。
- 实验设计: 许多研究使用了一些临时的长预测步长(例如 24–60 周),这偏离了 CDC 运营目标的 1–4 周目标,并且忽略了数据修订(回填/backfill)问题。
- 不一致性: 异构的数据流水线和基准模型使得很难区分真正的建模进步与预处理带来的伪影。
本文通过在现实的公共卫生约束下,对区域性流感预测进行系统性评估来解决这些差距,并对比了经典的神经网络、数值型 Transformer 模型、预训练的时间序列基础模型以及基于 LLM 的方法。
方法论
数据与泛化范式
本研究利用了美国卫生与公众服务部(HHS)区域级别(10 个区域)的每周时间序列数据,涵盖了约 20 年的流感样病例(ILI)数据,以及三个季节的流感相关住院数据。
- 时间泛化: 模型在特定区域的早期片段上进行训练,并在同一区域内不相交的后期时间范围内进行评估。
- 空间泛化: 模型在部分区域上进行训练,并在完全未见的区域上进行评估,以测试地理迁移能力。
- 预训练来源: 为了评估跨领域迁移,模型在多种语料库上进行了预训练,包括:
- 流行病每周数据: COVID-19 死亡人数。
- TrafficL: 高频交通车道占用率。
- M4: 一个包含约 100,000 个单变量序列的大型异构基准。
- 住院数据: 作为一种机制相关的信号使用。
实验设置
- 预测步长(Horizons): 提前 1–4 周,与 CDC 的运营目标一致。
- 指标: 均方误差(MSE)和归一化纳什-萨特克利夫效率(NNSE)。
- 评估的模型: 17 种深度预测模型,包括:
- 模式模型: PatchTST, iTransformer, TFT, TiDE, TCN, LSTM(迭代式和直接式)。
- 基础模型: Chronos 各变体, TimesNet, TimeLLM。
- 提出的架构: MultiFoundationCore (MFC),一种融合了多个预训练预测器的混合专家(MoE)模型。
- 消融实验: 研究调查了预训练来源的影响、辅助信号的使用(住院数据作为输入 vs. 作为预训练)、重训练频率以及历史数据长度的影响。
核心贡献
- 系统性基准测试: 作者首次在明确的时间和空间泛化范式下,针对 1–4 周的多步长目标,对 ILI 和住院量预测进行了系统性的时间序列基础模型评估。
- 架构比较: 通过对模型家族的受控比较显示,**混合专家(MoE)**策略,特别是 MultiFoundationCore (MFC) 模型,取得了最强的整体性能。MFC 融合了多个预训练预测器,利用异构表示来提供互补的预测信息。
- 预训练洞察: 研究表明,预训练在较长步长(第 3–4 周)时带来的增益最大,特别是当预训练领域在机制上与流感动态一致时(例如住院数据)。大型通用语料库(M4)也为长期稳定性提供了显著益处。
- LLM 的局限性: 研究发现,在这一环境下,基于 LLM 的时间序列方法(如 TimeLLM, Chronos)的表现逊于数值型预测器。作者将其归因于架构上的不匹配,即语言风格的标记化(tokenization)无法保留对于短步长流行病预测至关重要的连续数值结构(振幅、斜率、相位)。
- 辅助信号分析: 研究阐明了住院数据的效用,表明它既可以作为预训练源,也可以作为辅助协变量,两者都能提高预测效果,其中预训练在不同步长下带来的收益最为一致。
结果
时间评估(区域内)
- 顶尖性能: MultiFoundationCore 取得了最佳的整体平均性能(MSE = 0.382, NNSE = 0.864),优于所有单个基准模型。
- 数值型 vs. LLM 模型: 数值型 Transformer 模型(PatchTST, iTransformer)的表现明显优于基于 LLM 的方法。例如,表现最好的 Chronos 配置平均 MSE 为 0.683,而未经预训练的 PatchTST 则达到了 0.439。
- 预训练影响: 预训练持续提升了数值型模型的性能。在住院数据上预训练的 PatchTST 实现了 0.412 的 MSE,在 M4 数据上为 0.415,而基准模型为 0.439。预训练的益处在 4 周步长时最为显著。
- 策略: 直接多输出预测模型在较长步长下通常优于迭代式模型,因为迭代式方法容易受到误差累积的影响。
空间评估(跨区域)
- 泛化能力: 模型在时间拆分下的表现普遍优于空间拆分,这可能是由于 10 个 HHS 区域之间的多样性有限。
- 顶尖表现者: 在空间设置下,PatchTST 是表现最好的单一模型(平均 MSE = 0.449, NNSE = 0.848),其次是 TFT 和 LSTM。
- LLM 性能: LLM 模型(TimeLLM)在空间泛化方面继续表现不佳,这进一步证实了将语言风格的先验知识迁移到未见地理环境中的难度。
辅助信号与重训练
- 住院数据: 将住院数据作为 ILI 预测的预训练源显著降低了 MSE(例如,TFT 的 MSE 从 0.428 降至 0.346)。将其作为输入流也有所帮助,尤其是在 ILI 历史记录较短的情况下。
- 重训练: 更频繁的重训练(每 10 步一次 vs. 每 200 步一次)带来了持续但递减的精度提升,这表明在计算成本和预测性能之间存在一个实际的平衡点。
- 住院量预测: 对于规模较小、噪声较大的住院数据集,紧凑的 TinyLSTM 基准表现出惊人的实力,在没有使用辅助数据的情况下优于大型基础模型。然而,在融合 ILI 协变量时,MultiFoundationCore 仍然实现了最低的总误差(MSE = 0.00224)。
意义与主张
本文旨在为流感监测的模型选择和策略提供可操作的指导:
- 模型选择: 对于 1–4 周的运营预测,融合了预训练数值专家的**混合专家(Mixture-of-Experts)**框架优于单一模型方法。
- 预训练策略: 预训练在较长步长时最为受益,且当来源领域在机制上与目标相关(如住院量与 ILI 相关)时最为有效。
- 对 LLM 的警示: 文中指出,重新编程的 LLM 并不能在现实的、短步长的、多区域的流行病设定下决定性地超越专门的数值模型。流行病数据的连续数值特性需要目前语言风格架构所缺乏的归纳偏置。
- 数据效用: 长期的监测记录和机制相关的辅助信号(如住院量)对于稳健的多步长预测至关重要。
作者强调,其工作是一项关于预测行为的系统性研究,而非一个完全投入运行的实时系统。他们发布了代码、数据和预训练检查点,旨在为未来使用时间序列基础模型进行流行病预测的研究提供可复用的测试平台。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。