✨ 要点🔬 技术摘要
想象一下,你正试图预测一座繁忙城市的交通未来。你拥有来自数百个不同传感器的数据:交通灯、公交站、高速公路摄像头和气象站。
旧方法:“独奏音乐家”模式 大多数现代用于此类任务的 AI 模型将每个传感器视为在不同房间里演奏的独奏音乐家。它们倾听交通灯的节奏,然后倾听公交站的节奏,并尝试根据每一个单独的信号来预测未来。它们忽略了交通灯和公交站实际上正在相互“对话”这一事实。如果灯变红了,公交车就会停下;如果公交车晚点了,交通就会拥堵。通过忽略这些联系,模型错失了大局。
愿景:将数字转化为图像 这篇论文的作者提出的 VFEM 意识到,时间序列数据(随时间变化的数字)如果排列得当,看起来其实非常像一张图像。
想象一下,你有一张电子表格,行是不同的传感器,列是时间步长。
如果你将这张电子表格变成一张热力图(就像天气图一样),你就能看到 模式。
你可以发现一条代表“每天都会发生高峰时段”的“条纹”。
你可以观察到一种“滞后”现象,即一个传感器在另一个传感器之后立即出现峰值。
你可以识别出看起来像突然爆发的白噪声的“故障”(异常值)。
人类非常擅长识别这些视觉模式。但计算机通常需要从头开始学习如何识别它们。
解决方案:“专家画家”与“音乐家” VFEM 引入了一个巧妙的两部分系统,就像一个由两位专家组成的协作团队:
视觉分支(专家画家): 该模型将时间数据转化为一张图片,并将其输入到一个预训练的大型视觉模型 (LVM) 中。把这个 LVM 想象成一位世界闻名的画家,他研究了数百万张照片。这位画家是识别图像中的模式、纹理和关系方面的专家。
窍门: 作者冻结 了这位画家。他们不让画家重新学习如何绘画,而只是问:“嘿,你在这一幅交通图中看到了什么模式?”这节省了大量的计算资源。
时间分支(音乐家): 这部分是一个标准的 AI 模型,它倾听原始数字,并理解时间的节奏和序列(就像音乐家阅读乐谱一样)。
融合(指挥家): 模型提取“画家的”视觉洞察力和“音乐家的”时间洞察力,并将它们混合在一起。这就像一位指挥家,告诉画家和音乐家要和谐地演奏。画家可能会说:“我看到一个看起来像是周末的模式,”而音乐家会说:“我看到节奏正在放慢。”两者结合在一起,比任何单一模型都能做出更好的预测。
为什么这意义重大
它很高效: 因为他们使用了一个“冻结的”专家画家(预训练视觉模型),他们只需要训练总模型参数的约 7.5% 。这就像聘请了一位免费完成繁重工作的著名顾问,而你只需要支付训练一个小助手来翻译其建议的费用。
它能看到他人忽视的东西: 通过将数据转化为图像,该模型可以识别不同变量之间复杂的相互关系(例如,一栋建筑的用电量如何影响另一栋),而其他只观察单个变量的模型则完全忽略了这一点。
它行之有效: 在使用真实世界数据(电力、交通、天气)进行测试时,这个“视觉特征赋能”模型在尝试进行长远预测时,击败了许多目前的顶尖模型。
总结 VFEM 是一种通过意识到时间数据看起来像一张图片 来预测未来的新方法。它不仅仅是在处理数字,而是利用一只预训练的“眼睛”来捕捉数据中的视觉模式,并将其与一只“时间耳朵”对节奏的聆听相结合。其结果是一个更聪明、更快、更准确的预测器,它理解一个系统中不同部分是如何相互连接的。
技术摘要:VFEM – 通过跨模态融合实现视觉特征增强的多变量时间序列预测
问题陈述 多变量时间序列预测在当前的大规模基础模型中面临两个主要局限性。首先,盛行的通道独立(channel-independent)架构 将每个变量单独处理以应对不同的数据维度。虽然这有助于实现零样本泛化,但它忽略了能够增强预测准确性的关键跨通道依赖关系和相关性。相反,通道依赖型模型通常需要在海量数据集上进行全参数训练,这会产生高昂的计算成本,并且在对多变量序列进行展平处理时,可能无法捕捉到特定领域的模式。
其次,现有的时间序列跨模态方法 主要依赖于文本模态(例如,利用文本提示词重用大语言模型 LLM)。这些方法未能充分利用视觉模型的空间模式识别能力。多变量时间序列在被渲染为二维图像时,会呈现出周期性、领先-滞后关系以及异常事件等视觉模式,这些模式天然适合由预训练视觉模型进行识别,但在跨模态集成中,这一潜力尚未得到充分挖掘。
方法论:VFEM 架构 作者提出了 VFEM(Visual Feature Empowered Multivariate Time Series Forecasting,视觉特征增强的多变量时间序列预测) ,这是一个旨在利用预训练大视觉模型(LVM)来捕捉复杂跨变量模式的跨模态框架。该架构由三个主要阶段组成:
视觉模态处理:
变换: 将多变量时间序列 X ∈ R L × M X \in \mathbb{R}^{L \times M} X ∈ R L × M (其中 L L L 是回顾窗口,M M M 是变量数量)转置为 X ⊤ ∈ R M × L X^\top \in \mathbb{R}^{M \times L} X ⊤ ∈ R M × L 。该矩阵被视为单通道强度图,并复制到三个通道(c = 3 c=3 c = 3 )以形成 3 通道 RGB 图像输入 X v s X_{vs} X v s 。在此表示法中,行对应变量,列对应时间步。
特征提取: 预训练的视觉编码器(具体为 SigLIP-2-base-NaFlex )处理图像以提取全局视觉嵌入。至关重要的是,视觉编码器在训练期间是冻结 的。
扩展与投影: 由于视觉编码器输出的是单个全局嵌入,因此将其在所有 M M M 个变量上进行复制,以提供共享的视觉上下文。随后,一个可学习的投影网络(带有残差连接)负责弥合视觉特征与时间序列表示之间的领域鸿沟,将其映射到统一的隐藏维度。
时间模态处理:
原始时间序列经过**可逆实例归一化(RevIN)**以消除分布偏移,同时保留时间模式。
归一化后的序列通过使用**时空自注意力机制(spatiotemporal self-attention)**的时间分支进行处理。时间维度被划分为若干段,并通过重新排列张量,使注意力机制能够同时捕捉跨变量和跨时间段的依赖关系。
跨模态融合:
将视觉隐藏状态(H v s H_{vs} H v s )与时间隐藏状态(H t s H_{ts} H t s )沿特征维度进行拼接。
融合编码器 (使用自注意力层)处理组合后的特征,以共同建模跨模态交互和跨变量依赖关系。
最后,线性预测层生成预测结果,随后进行反向实例归一化以恢复原始数据尺度。
核心贡献
跨模态框架: 本文引入了一种新颖的方法,将多变量时间序列转化为视觉表示,使预训练视觉模型能够感知通道独立模型所缺失的空间关系和跨变量模式。
参数效率: 通过冻结大型视觉编码器,VFEM 仅训练了其总参数量的 7.45% (在 3.75 亿个总参数中,约有 3000 万个可训练参数)。这种策略在利用预训练视觉知识的同时,避免了在有限的时间序列数据上发生过拟合。
性能: 通过融合视觉和时间分支,VFEM 在多个基准测试中实现了具有竞争力的预测性能,证明了视觉模式识别是时间序列分析的一种可行且有效的模态。
实验结果 作者在七个基准数据集上评估了 VFEM:ETTh1, ETTh2, ETTm1, ETTm2, Electricity, Weather, 和 Traffic 。模型与以下对象进行了对比:
零样本时间序列基础模型: Chronos (Base/Large), Moirai (Base/Large)。
特定任务监督模型: GPT4TS, UniTST, TimesNet, PatchTST。
主要发现:
卓越的准确性: 在所有数据集和预测步长(F ∈ { 96 , 192 , 336 , 720 } F \in \{96, 192, 336, 720\} F ∈ { 96 , 192 , 336 , 720 } )下,VFEM 均实现了最低的均方误差(MSE)和平均绝对误差(MAE),优于零样本基础模型和监督式的特定任务基准模型。
长序列稳定性: 视觉模态增强了模型识别长期模式的能力,使得随着预测步长增加,性能下降更加缓慢(例如,从 F = 336 F=336 F = 336 到 F = 720 F=720 F = 720 ,MSE 的增幅极小)。
消融实验:
移除视觉或时间分支中的任何一个都会导致性能下降,其中视觉分支对长期预测的影响更为显著。
投影层对于对齐模态至关重要。
冻结策略: 与解冻最后 2 层或 4 层或进行全参数微调相比,保持视觉编码器完全冻结的效果最好,这表明在处理异构模态时,保留预训练的视觉表示是至关重要的。
表示质量: t-SNE 可视化和轮廓系数(Silhouette Score)分析证实,训练后的投影层成功地将预训练视觉特征适配到了时间序列领域,生成的嵌入比原始冻结编码器输出或手工设计的统计特征具有显著更好的聚类质量。
意义与主张 本文声称 VFEM 通过验证视觉模态的效用,为多变量时间序列预测提供了新的视角 。它证明了:
多变量时间序列包含视觉可识别的模式(周期性、领先-滞后、异常情况),这些模式可以被预训练视觉模型有效地捕捉。
视觉特征与时间特征的跨模态融合可以有效地建模复杂的变量间依赖关系,而不会带来大规模时间序列语料库全参数训练的计算负担。
冻结大型视觉模型并仅训练极小比例的参数是一种高效的策略,能够实现最先进的性能,为现有的通道独立或全参数微调的通道依赖方法提供了可行的替代方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。