想象一下,你有一个设计用来阅读书籍的超级智能机器人。它极其擅长理解句子,因为它知道单词具有特定的顺序:“猫坐了”(The cat sat)与“坐了猫”(Sat the cat)是不同的。这个机器人使用一种特殊的系统来追踪句子中每个单词的位置。
现在,想象一下你想教这个机器人理解不规则时间序列数据。这就像是一个气象站,只在降雨时发送报告,或者是一个心脏监测仪,只在心跳出现漏跳时才记录一次心跳。数据点并非以固定的时间间隔(例如每秒)出现,而是在随机时间出现。
标准的机器人对此会感到困惑。它期望一种稳定的节奏,就像节拍器一样。如果你给它输入不规则的数据,它要么会崩溃,要么需要大量修改,加入复杂的定制部件来处理这种混乱。
这时,RoMAE(旋转掩码自编码器)登场了。这篇论文的作者构建了一个新版本的机器人,它无需任何定制的“齿轮”或特殊修改就能处理这种不规则性。以下是他们是如何做到的,使用了简单的类比:
1. “旋转”指南针(RoPE)
秘诀在于一种名为旋转位置编码(RoPE)的方法。
- 旧方法:想象机器人使用一把尺子来测量距离。如果尺子上只有 1、2、3、4 的刻度,它很难轻松测量"1.5"或"3.7"。它难以处理连续的、非整数的数值。
- RoMAE 方法:机器人不再使用尺子,而是使用指南针。它不仅仅是数步数,而是旋转其对“位置”的理解。
- 如果一个数据点发生在时间 10,机器人会将其内部视角旋转一定的角度。
- 如果一个数据点发生在时间 10.5,它会旋转一个略有不同的角度。
- 因为指南针可以指向任何角度,而不仅仅是整数,所以机器人可以完美地理解连续的、不规则的时间。它不需要被告知“这是时间序列”;它只需理解数据的几何结构。
2. “蒙眼”游戏(掩码自编码器)
机器人通过玩一种名为“蒙眼”的游戏来学习。
- 设置:你向机器人展示一张图片(或数据流),但用“蒙眼布”(掩码)遮盖了其中 75% 的内容。
- 任务:机器人必须根据可见部分猜测蒙眼布下是什么。
- 结果:通过尝试填补不规则数据中的缺失部分,机器人学会了数据行为背后的潜在模式。一旦它擅长这个游戏,你就可以取下蒙眼布,将其用于分类或预测等实际任务。
3. “通用适配器”
通常,如果你想让机器人处理图像,你需要构建一个大脑;如果你想让它处理音频,你需要构建另一个大脑;如果你想让它处理不规则时间,你需要构建第三个非常复杂的大脑。
RoMAE 是一个通用适配器。
- 作者在图像(如照片)、音频(如声音片段)和不规则时间序列(如气象数据或心脏监测数据)上测试了它。
- 主张:他们发现 RoMAE 无需为任何这些任务改变其大脑结构。它在图像和音频上的表现与现有最佳模型一样出色,同时它也在其他模型挣扎的不规则时间序列任务中表现出色。这就像一把瑞士军刀,其锋利程度不亚于专用的厨师刀,同时还拥有螺丝刀和开瓶器。
4. “锚点”技巧([CLS] 令牌)
该论文的一个有趣发现是关于机器人如何区分“绝对”时间与“相对”时间。
- 相对时间:“这个事件发生在那个事件之后的 5 分钟。”
- 绝对时间:“这个事件恰好发生在下午 2:00。”
作者发现,如果他们在数据开头添加一个特殊的“锚点”令牌(称为 [CLS] 令牌),机器人就能确定绝对时间。如果没有这个锚点,机器人只知道事件之间的距离,而不知道它们在时钟上的具体位置。
- 比喻:想象你在一个黑暗的房间里。如果你只知道“我向前走了 10 步”,你就不知道自己在房子的什么位置。但如果你有一盏手电筒(即“锚点”)告诉你“我距离门有 10 步”,你就确切地知道自己在哪。
他们证明了什么?
这篇论文并没有声称这将治愈疾病或预测明天的股市。相反,他们通过实验证明了三点:
- 通用性:RoMAE 在图像、音频和混乱的不规则时间数据上表现优异,无需特殊的架构调整。
- 性能:在一个困难的天文学挑战(ELAsTiCC 数据集,涉及来自太空的不规则光变曲线)中,RoMAE 击败了专为该任务设计的专用模型。
- 锚点效应:他们从数学上证明并通过实验展示,如果没有特殊的“锚点”令牌,机器人就会失去了解绝对位置的能力,这使得某些任务变得更加困难。
局限性(缺点)
论文诚实地指出了缺点:
- 速度:因为机器人每次看到数据时都必须为每一块数据计算这些“指南针旋转”,所以它比使用简单、预计算尺子的模型稍慢(大约慢 13%)。
- 长度:像所有此类标准机器人一样,如果你试图一次性喂给它海量数据(如整本小说或一整年的连续视频),它的速度会变得非常慢。
总之:作者构建了一个“通用学习者”,它使用旋转指南针来理解时间,使其能够在混乱的不规则数据上玩“蒙眼”游戏,其表现与在干净的图片和声音上一样出色,而且无需定制的大脑。
技术摘要:旋转掩码自编码器是通用学习者
问题陈述
将 Transformer 架构应用于不规则时间序列数据带来了重大挑战。最初为自然语言等离散序列设计的标准 Transformer 依赖于量化的位置信息。它们缺乏对连续位置数据的原生支持,而连续位置数据对于建模健康、金融和天体物理等领域中常见的不规则采样时间序列至关重要。现有的解决方案通常需要专门的架构修改(例如,改变前馈层)或新颖的位置嵌入(例如,神经 ODE),这增加了计算开销和方法的复杂性。此外,将 Transformer 扩展到不规则数据往往需要放弃为自然语言处理(NLP)和计算机视觉(CV)开发的工具“生态系统”。
方法:旋转掩码自编码器(RoMAE)
作者提出了RoMAE,这是掩码自编码器(MAE)框架的扩展,它集成了旋转位置嵌入(RoPE),以处理连续、多维的位置信息,而无需针对特定任务的架构专门化。
核心组件
- N 维分块(Patchification): 输入 x∈Rd1×d2×⋯×dD 被划分为不重叠的块。对于不规则维度(例如时间),块大小必须为 1,以确保每个块包含均匀的数据点。这些块被展平为序列并投影到嵌入维度 dmodel。
- 连续轴向 RoPE: 与专为离散整数设计的标准 RoPE 不同,RoMAE 利用具有连续实数值位置(m∈R)的 RoPE。模型接受位置向量序列 s=[s1,…,sk] 以及输入值。
- 轴向应用: 为了编码多维位置(例如时间和通道索引),模型采用轴向 RoPE,将嵌入空间划分为子空间,每个子空间编码一个特定维度。
- 处理高维: 为了避免将 dmodel 除以大量维度 D 带来的计算成本,作者选择性地保留一个维度来存储维度索引,从而减少有效位置维度。
- 架构: RoMAE 遵循 MAE 的非对称编码器 - 解码器结构。
- 编码器: 标准 Transformer 编码器(利用 SiLU 激活和 RMSNorm)处理未掩码的块。
- 解码器: 较小的 Transformer 解码器重建被掩码的块。
- 预训练: 一定比例的块被掩码。解码器预测原始块的值。
- 下游任务: 解码器被丢弃,编码器的中间表示用于分类或回归。
关于位置的理论见解
本文研究了 RoPE(一种相对位置嵌入方法)与 [CLS] 标记之间的相互作用:
- 相对与绝对: 如果没有学习到的 [CLS] 标记,RoMAE 编码器是平移不变的,仅依赖于相对位置。
- 绝对位置的重建: 作者证明(命题 4.2),包含一个学习到的 [CLS] 标记允许模型重建绝对位置。[CLS] 标记充当“锚点”,使模型能够推断任何嵌入相对于该锚点的绝对位置,从而有效地打破了 RoPE 在全序列上下文中的纯相对属性。
主要贡献
- 带有 RoPE 的连续位置嵌入: 这项工作将 RoPE 的效用扩展到连续、非均匀的时间戳,证明了除非使用锚点(如 [CLS]),否则学习到的输入嵌入可能会使 RoPE 的相对距离保证失效。
- RoMAE 框架: 一个统一的架构,原生处理不规则多变量时间序列,同时保持图像和音频上的标准性能。它消除了对专门时间序列架构的需求。
- 全面的实验分析: 作者在四种不同的模态和任务上验证了 RoMAE:
- 不规则采样多变量时间序列分类。
- 图像分类。
- 不规则采样时间序列插值。
- 音频分类。
实验结果
该论文报告了多个基准测试的结果,将 RoMAE 与最先进的(SOTA)专用模型进行了比较:
- 不规则时间序列分类(ELAsTiCC 挑战赛): 在 DESC ELAsTiCC 数据集(天文光变曲线)上,RoMAE-tiny 的表现优于专用的 ATAT 架构。RoMAE 的 F 分数达到 0.8029(无警报掩码),而 ATAT 为 0.6270,这表明通用模型可以在困难数据集上超越专用模型。
- 图像分类(Tiny ImageNet): 带有 RoPE 的 RoMAE 表现与带有绝对位置嵌入的 MAE 相当或略好,证实了其在计算机视觉领域的通用性。
- 音频分类(ESC-50): 在 AudioSet-20k 和 Librispeech 上预训练后,RoMAE-small 达到了 84.7% 的准确率,超过了在同一数据集上训练的 SSAST 模型(82.2%)。
- 插值任务:
- 螺旋线: RoMAE 将均方误差(MSE)比之前的最佳模型(ContiFormer)提高了数量级。
- 合成数据与 PhysioNet: RoMAE 在单变量和多变量临床数据上取得了具有竞争力的 MSE 结果,经常超越 HeTVAE 和 Latent ODE 等专用模型,特别是在处理稀疏观测值方面。
- 位置重建: 实验证实,带有 [CLS] 标记的模型可以以接近零的均方误差(MSE)重建绝对位置,而没有该标记的模型则失败(MSE > 200)。
意义与主张
该论文声称 RoMAE 是一个通用学习者,能够弥合标准 Transformer 应用(NLP、CV)与不规则时间序列分析之间的差距。
- 统一框架: 它表明,对于不规则时间序列上的强性能,专门的架构并非严格必要;辅以连续 RoPE 的标准 Transformer 方法就足够了。
- 数据效率: RoMAE 即使在小型数据集(数百个样本)上也表现出强大的性能,并能扩展到数百万(ELAsTiCC),突显了预训练的优势。
- 理论见解: 这项工作提供了实证证据,表明 RoPE 的“长期衰减”属性对其功能并非至关重要,并阐明了 RoPE 支持绝对位置重建的条件。
- 局限性: 作者承认,连续 RoPE 会产生计算开销(比量化 RoPE 慢约 13%),因为频率无法在前向传递之间缓存。此外,与 BERT 风格模型一样,RoMAE 不适合涉及分布外时间窗口的外推任务。
总之,RoMAE 为连续时间插值和表示学习提供了一个与任务无关的基线,表明“基础模型”方法可以成功地扩展到处理不规则、多维数据的科学领域,而无需定制架构更改。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。