想象一下,你正在尝试教一个机器人理解一个故事,但这个故事讲述得非常奇怪。有时叙述者每秒都在说话,有时他们等待五分钟,有时则完全跳过数天。这就是不规则时间序列数据(例如,仅在发生变化时才发出蜂鸣声的患者心率监测仪,或停止工作数小时的天气传感器)所面临的情况。
为了应对这种情况,机器人需要两种超能力:
- 情境感知能力:它需要知道此刻正在发生什么,以决定是应该记住过去还是将其遗忘。(例如:“哦,刚刚发生了心脏病发作?我最好记住这个!”vs“只是正常的心跳?我可以忘掉上一个。”)
- 时间感知能力:它需要理解事件之间过去了多少时间。(例如:“距离上次蜂鸣声已经过了 5 秒”vs“已经过了 5 小时”。)
以往机器人的问题
该论文指出,迄今为止构建的两个最佳机器人(称为Mamba和S5)各自拥有一种超能力,却缺失了另一种。
解决方案:TIDES
作者创造了一种名为TIDES(时间隐式衰减与特征值选择性)的新机器人。
将 TIDES 想象成一位混合厨师。
- 时钟(时间):TIDES 保留着一个真实的物理时钟。它从不伪造时间。如果事件之间的间隙是 5 小时,机器人就知道是 5 小时。它不会试图从输入中学习“虚假时间”。这使得它能够完美处理奇怪、不规则的间隙,即使它从未见过该特定间隙大小。
- 大脑(选择性):TIDES 不是通过伪造时间来变聪明,而是根据输入改变其内部记忆设置。当发生重大事件时,它会告诉内部记忆:“减缓这条特定信息的遗忘过程。”当发生无聊事件时,它则说:“快速忘掉这个。”
魔法技巧:
在以前的模型中,机器人试图通过改变时钟速度(时间步长)来变聪明。TIDES 保持时钟速度真实且物理化,但改变记忆衰减率(遗忘速度)。这样,它就能兼得两者之长:它既理解时间的真实流逝,又知道该记住什么。
“渐隐闪光”测试
为了证明这行之有效,作者发明了一个名为**“渐隐闪光”**的简单游戏。
想象一排 40 个光探测器。
- 发生一次闪光。
- 探测器发光,然后慢慢暗淡下去。
- 其暗淡速度取决于它在行中所处的“区域”(慢速、中速或快速)。
- 闪光之间的时间是随机且不规律的。
- 旧机器人:"S5"机器人无法学习不同区域的不同暗淡速度。"Mamba"机器人可以学习这些速度,但如果你将闪光之间的时间改为训练时未见过的时间,它就会完全失败。
- TIDES 机器人:它学会了每个区域的不同暗淡速度,并且即使闪光之间的时间完全陌生且奇怪,它也能完美工作。
结果
作者在真实世界数据集(如医疗传感器数据和生物模拟)上测试了 TIDES。
- 它成为了时间序列数据分类的新冠军(最先进水平)。
- 它成为了生物方程预测的新冠军。
- 关键的是,它不仅仅是在训练数据上运气好;它在处理“分布外”数据(奇怪、未见过的时间间隙)方面比竞争对手表现好得多。
总结
TIDES是一种新型人工智能,它不再试图通过“伪造”时间来变聪明。相反,它保持时间的真实性和物理性,但使记忆变得灵活。这使它能够处理混乱、不规则的真实世界数据(如掉线的传感器或延迟到达的医疗记录),而不会在时间变化时感到困惑。
技术摘要:TIDES——选择性状态空间模型中的隐式时间感知
问题陈述
现实世界中的序列数据,如临床观察、环境传感器读数和金融事件,很少在规则网格上进行采样。标准的序列模型通常假设时间步长均匀,迫使它们要么对数据进行重采样(从而丢弃时间信息),要么用显式的时间特征增强输入。
两大主流的状态空间模型(SSM)家族解决了序列建模问题,但在处理不规则时间序列时面临根本性的权衡:
- 连续时间 SSM(例如 S5): 这些模型保留了时间步长的物理意义(Δ~≡Δ),允许它们通过在实际经过的时间上积分连续动力学,原生地处理不规则时间戳。然而,它们通常是**线性时不变(LTI)**的,意味着其动力学不随输入内容变化,从而限制了每个 token 的表达力。
- 选择性 SSM(例如 Mamba): 这些模型通过使离散化步长 Δ~ 和投影矩阵(B,C)成为输入依赖的函数,实现了强大的每个 token 的表达力。这使得模型能够逐 token 调整其有效时间常数。然而,这种设计将 Δ~ 从物理采样间隔坍缩为一个学习到的门控。因此,模型失去了对不规则时间的原生处理能力;要处理不规则数据,它必须将时间增量作为显式输入特征。论文认为,这种间接耦合阻碍了模型向训练期间未见过的不规则性区域(时间增量)进行外推。
方法论:TIDES
作者提出了 TIDES(隐式时间感知衰减与特征值选择性),这是一种选择性 SSM 变体,旨在调和 Mamba 的表达力与 S5 的物理时间语义。
核心设计原则
TIDES 将输入依赖性从离散化步长(Δ~)转移到连续时间生成器(状态矩阵 Λ 和投影 B,C)。
- 隐式时间感知: 时间步长 Δ~ 保持严格的物理属性(Δ~≡Δ),完全由观测时间戳决定。它不是输入的函数。
- 选择性生成器: 输入依赖性应用于:
- Re(Λ): 特征值的实部(衰减率)成为输入的函数。这使得模型能够根据内容“更快遗忘”或“保持更久”,提供必要的选择性。
- B 和 C: 输入和输出投影是输入依赖的,允许模型过滤噪声并调节状态的读写。
- Im(Λ): 虚部(振荡频率)保持静态。作者认为逐 token 调制频率缺乏清晰的连续时间解释,且实证发现这会损害性能。
架构细节
- 初始化: 模型使用源自 HiPPO 的偏置初始化 Λ,B,C,并将投影权重初始化为零。这确保模型从一个条件良好的 LTI 递归开始,并将选择性学习为平滑的扰动。
- 低秩投影: 为了管理参数量,B 和 C 的稠密投影被分解为低秩结构(r≪PH)。
- 深度投影器: 输入路径在最终投影之前包含残差门控线性单元(GLU)块以引入非线性,类似于 Mamba 的预处理。
- 归一化: 在离散化之前,立即对投影参数(Re(Λ),B,C)应用 RMSNorm,以稳定训练,防止递归中出现无界扰动。
- 稳定重参数化: Re(Λ) 被重新参数化(例如通过指数映射或稳定映射),以确保特征值始终位于稳定半平面,从而无论输入如何都能防止爆炸性递归。
主要贡献
- 架构: TIDES 引入了一种设计,其中选择性存在于连续时间生成器(Re(Λ),B,C)中,而离散化步长保持为物理的、隐式的量。这使得模型能够原生地处理不规则时间戳,同时不牺牲每个 token 的表达力。
- 机制分析(Fading Flash): 作者引入了一种新颖的诊断基准 Fading Flash,用于隔离两种失败模式:
- LTI 刚性: S5 无法同时建模多种衰减率。
- 外推失败: 类 Mamba 模型无法泛化到训练分布之外的时间增量(Δ)。
- 结果表明,TIDES 是唯一能够克服这两者的架构,在保持对未见 Δ 值鲁棒性能的同时,捕捉了区域依赖的动态。
- 实证结果: TIDES 在以下方面取得了新的最先进(SOTA)平均排名:
- UEA 时间序列分类: 优于 LogNCDE、RFormer 和其他基线。
- Physiome-ODE 回归: 超越 LinODEnet 和其他不规则时间序列预测模型。
实验发现
- Fading Flash: 在这个受控实验中,S5 未能捕捉区域依赖的衰减(低表达力),而 MambaS(Mamba 的代理模型)未能外推到训练范围之外的测试时 Δ 值(导致有效衰减率漂移)。TIDES 成功学习了所有区域的正确衰减率,并在广泛的测试时 Δ 范围内保持鲁棒。
- 随机丢弃消融: 在 EigenWorms 数据集上进行随机时间步丢弃实验时,即使在训练期间未见过的极端丢弃率(rtest=0.9)下,TIDES 仍保持了高准确率。相比之下,MambaS 和 RFormer 在高丢弃率下显著崩溃,证实了输入依赖的 Δ~ 或固定的签名窗口无法泛化到不规则采样区域。
- Im(Λ) 消融: 使特征值的虚部依赖输入并未提高性能,反而略微降低了性能,支持了保持振荡频率静态的设计选择。
意义与主张
论文声称,TIDES 证明了每个 token 的表达力与忠实的物理时间语义是兼容的,前提是输入依赖性通过连续时间生成器而非离散化步长进行路由。
作者提出了一个针对不规则采样序列的更广泛设计原则:将离散化与表达力分离。物理采样间隔应仅通过解析离散化规则进入模型,而表达力应存在于连续时间生成器中。这种分离使得模型能够同时具备表达力,并能外推到训练期间未见过的采样区域。
论文在范围上保持适度,明确指出 TIDES 是为不规则时间序列(临床、传感器、模拟数据)设计的,并未声称它是 Mamba 在语言建模等规则网格任务上的通用替代品,因为在这些任务中,输入依赖的时间门控的作用不同。这项工作表明,将时间处理与表达力分离的原则可能扩展到其他连续时间架构,包括神经 ODE 和连续时间注意力变体。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。