Accelerating Time Series Foundation Models with Speculative Decoding
本文介绍了一种专为时间序列基础模型中的连续补丁自回归量身定制的投机解码框架,该框架利用一个廉价的草稿模型来提出未来的补丁,并由目标模型并行对其进行验证,在保持准确性保证的同时,实现了高达 3.0 倍的推理加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图预测未来,但不是通过水晶球,而是使用一台能够观察电力消耗、交通流量或天气等数据模式的超级智能计算机。这个领域被称为时间序列预测(time series forecasting)。多年来,这些计算机一直在变得越来越聪明,但它们有一个令人恼火的习惯:它们很慢。它们的工作方式就像一个人一次只能读一个词。如果你要求它们预测未来 100 小时的天气,它们必须先计算第一小时,然后利用第一小时的结果计算第二小时,接着是第三小时,以此类推。它们无法跳过步骤或同时观察全局,因为它们的设计初衷就是为了极其谨慎地进行一步步的计算。这是一个问题,因为在现实世界中,比如电网管理者需要决定“现在”该购买多少电力时,等待一台缓慢的、循序渐进计算的计算机完成任务就太晚了。我们需要快速得到答案,同时我们也需要准确的答案。
这篇论文介绍了一个聪明的技巧,可以在不降低准确性的情况下,让这些缓慢而谨慎的计算机变得更快。作者称之为“投机采样”(speculative decoding),这是一种高级的说法,意思就是“猜想与校验”。想象一下你正在和朋友一起写故事。你(那个缓慢、谨慎的专家)通常一次只写一句话。但你的朋友(那个快速、稍欠谨慎的猜想者)可以瞬间喊出接下来的五句话。与其忽略你的朋友,不如快速阅读他们写的五句话。如果这些句子看起来没错,你就直接说“没错!”并继续写下去,从而节省了你自己亲手书写的时间。如果其中一句话看起来不对,你只需修正那一个词并继续前进。论文证明了对于这些时间预测计算机,这种“猜想与校验”的方法可以使速度提升高达 3.0 倍,同时保持预测精度几乎与它们独自进行繁重工作时一样出色。
问题所在:缓慢、循序渐进的机器人
时间序列基础模型就像是巨大的、超级智能的机器人,它们阅读了数十亿个数据点。它们在预测诸如明天高速公路上的交通流量或下周城市所需能源之类的问题上表现卓越。但它们有一个瓶颈:它们是“自回归”(autoregressive)的。这意味着它们就像是在堆叠多米诺骨牌。为了预测第 100 块骨牌,它们必须先预测第 99 块,然后是第 98 块,以此类推,一直回溯到起点。它们无法无法一次性预测整个未来。如果你想要一个长期的预测(即“长时界限”),这个机器人必须进行数百个缓慢且连续的步骤。这就像要求一只蜗牛跑马拉松;它最终会到达终点,但当它到达时,比赛可能已经结束了。
解决方案:快速小助手与谨慎的大老板
作者意识到,虽然大机器人很慢,但一个更小、更廉价的版本(称为“草稿”模型)通常能以几乎同样出色的水平猜出接下来的几个步骤。然而,这个小机器人并不完美。因此,论文提出了一种团队协作策略:
- 快速小助手(草稿): 一个更小、更快的计算机一次性猜出未来 K 个补丁(patches)。可以把它想象成一个打字很快的人,眨眼间就能打出句子中的下五个词。
- 谨慎的大老板(目标): 这个庞大、缓慢、超级精确的计算机不再亲自打字。相反,它会查看快速打字员写的五个词。它通过一次性的并行观察来检查所有词汇。
- 决策: 如果老板同意快速打字员,它就会说“接受!”,然后继续前进。如果老板不同意其中一个词,它就只修正那一个词,并停止快速打字员继续进行后续猜测。
这里的奥妙在于,大计算机通常必须一步一步地进行。有了这个技巧,它可以一次性接受一整块步骤。论文证明,即使处理的数据不是像语言模型那样的文字(而是连续的数字,如温度或电压),这种方法依然有效。作者必须发明一种新的“检查”数字的方法,因为你不能像在语言模型中那样仅仅比较概率;相反,他们使用一种数学上的“距离测试”来查看猜想是否足够接近真相。
研究发现
团队在五种不同类型的预测模型上测试了这个想法,包括 Timer-XL、TimesFM、Sundial、Time-MoE 和 TiRex。他们在电力网、天气模式和交通传感器等真实世界数据上运行了这些模型。
- 速度: 在许多情况下,这种新方法使模型快了 1.2 到 3.0 倍。例如,在 Time-MoE 模型上,他们在特定的数据集(ETTm1)上实现了 3.05 倍的加速,同时保持了极高的准确度。
- 准确度: 预测结果几乎与缓慢、谨慎的方法一样好。事实上,在某些情况下,“投机”方法甚至比标准方法更准确,因为它能更频繁地纠正错误。
- “免费”奖励: 如果快速小助手的所有猜想都正确,大老板就会获得一个“免费”的预测。这就像老板在不需要亲自打字的情况下就读到了下一个词。
何时失效
论文非常诚实地说明了这种技巧何时会失效。如果快速小助手已经和老板一样优秀了(那么就不需要检查了),或者如果老板检查猜想所花费的时间相对于节省的时间来说太长了,那么这个技巧就不再奏效。作者创建了一个数学公式来精确预测何时使用这种方法是值得的,这样工程师们就不必靠猜。他们发现,对于某些模型(如在特定交通数据上的 TiRex),检查过程过于昂贵,导致该方法反而减慢了速度。
总结
这篇论文不仅仅提出了一个酷炫的想法,它还构建了一个运作中的系统,将一个缓慢的、循序渐进的过程转变为一个快速的、并行的过程。它证明了你不需要在速度和准确性之间做选择。通过让一个快速的小模型承担繁重的猜想工作,并让一个大而聪明的模型执行快速的检查工作,我们可以获得两者的最佳结合。其结果是,我们可以更快地获得电力、交通和天气的优质预测,这有助于电网更高效地运行以及交通流更加顺畅,而无需等待那个缓慢的机器人完成它漫长而孤独的数据行走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。