Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting
原作者: Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das
原作者: Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:重新思考多模态时间序列预测的预训练后方案(POSTTIME)
问题定义
时间序列基础模型(TSFMs)通过利用海量的历史数值数据语料库,在单模态预测基准上实现了最先进的零样本性能。然而,现实世界的预测很少是单模态的;未来的轨迹经常受到外生的非数值因素影响,如突发新闻、政策变更和特定领域的文本描述。TSFMs 在结构上受限于数值输入,无法直接消耗这种多模态上下文。
相反,大型语言模型(LLMs)擅长处理复杂的多模态数据并执行复杂的推理,但已被证明在原始数值预测任务上表现不如 TSFMs。本工作解决的核心挑战是如何系统地将 TSFMs 的数值稳定性与 LLMs 的多模态推理能力统一起来,以实现稳健的预测。现有方法通常试图转换时间模态或在多模态语料库上从头预训练模型,但本文提出了一种不同的范式:对现成的 LLM 进行预训练后微调,使其作为基于上下文的修订者,在强大的数值 TSFM 先验之上进行干预。
方法论:POSTTIME 方案
作者引入了 POSTTIME,这是一种两阶段的预训练后微调方案,旨在教导 LLM 生成基于上下文的预测干预。其核心论点是,LLM 不应充当独立的预测器,而应充当“修订者”,根据多模态上下文决定是保留、忽略还是修订由 TSFM(例如 TimesFM-2.5)生成的基础预测。
1. LLM 的角色:预测器之上的修订者
实证分析表明,将 LLM 用作直接预测器(输入历史和上下文以生成预测)的效果,不如将其用作修订者(输入历史、上下文和 TSFM 先验以生成修订后的预测)的效果。修订者角色简化了推理任务,使 LLM 能够专注于整合文本信息并进行校准调整,同时将预测锚定在 TSFM 强大的数值先验之上。
2. 第一阶段:基于多样化轨迹的监督微调(SFT)
SFT 阶段旨在教导 LLM 有效的修订策略。作者确定了区分 POSTTIME 与标准实践的关键设计选择:
- 推理轨迹生成: 作者不使用观测到的地平线(真实值)作为模仿目标——这会引入后见之明偏差且对未来预测而言充满噪声——而是使用前沿 LLM(Gemini-3.1-Flash-Lite)生成预测时轨迹。这些轨迹在不看到未来的情况下对上下文进行推理,生成多个“有效”的推理路径,其中有效性定义为修订后的预测是否优于 TSFM 先验。
- 数据采样与困难案例: 与筛选“简单”样本的做法不同,POSTTIME 保留了困难和模糊的案例。数据集包含上下文微弱或具有误导性的样本,要求 LLM 学习何时不进行修订(即回退到 TSFM 先验)。这是通过为每个样本生成五个独立的修订并保留覆盖完整结果谱系的轨迹来实现的:明确的改进、模糊的干预以及应保留先验的案例。
- 回退机制: 如果没有生成的修订能改善 TSFM 先验,则插入一个回退目标,在此目标中训练 LLM 明确声明上下文不足以支持修订,并输出原始先验。
3. 第二阶段:基于可验证奖励的强化学习(RLVR)
RL 阶段优化策略以最大化修订效果。
- 奖励设计: 标准的 RL 方法通常使用绝对预测精度(如 ExpMAE)作为奖励。作者认为这对于修订者来说是不够的,因为它无法区分好的修订和好的先验。相反,POSTTIME 使用改进比率(ImpRatio) 奖励,衡量修订后的预测相对于基础 TSFM 先验的相对改进。
- 优势: 该奖励函数提供了更强的偏好信号,减少了奖励崩溃(即多个完成项获得相似分数),并鼓励模型学习何时修订实际上有益,而何时有害。
主要贡献
- 范式转变: 本文论证并验证了“基于上下文的修订者”范式优于直接多模态预测,表明 LLM 最适合在强大的 TSFM 先验上进行干预,而不是从头生成预测。
- POSTTIME 方案: 一种新颖的预训练后微调框架,结合了具有多样化预测时推理轨迹的 SFT 和基于改进的奖励的 RL。
- 自动化数据构建: 一种生成高质量、自动化推理轨迹和回退示例的方法,无需人工干预标注,有效处理了修订效用的谱系(从简单到不可能案例)。
- 奖励创新: 引入了 ImpRatio 奖励函数,将 RL 目标与改进先验而非实现绝对精度的特定目标对齐。
实验结果
作者在 TimesX 多模态预测基准上评估了 POSTTIME,使用 Gemma-3-4B 作为 LLM,TimesFM-2.5 作为 TSFM 先验。
- 性能: POSTTIME 模型(SFT + RL)显著优于独立的 TSFMs、仅 LLM 基线、零样本 LLM+TSFM 修订以及现有的多模态预测模型(包括 TimeOmni、Aurora 和 ChatTS)。
- 在域内(ID)测试集上,POSTTIME 将 TimesFM-2.5 的 nMAE 提高了 6.38%,nMSE 提高了 12.43%。
- 在域外(OOD)测试集上,nMAE 提高了 3.93%,nMSE 提高了 11.24%。
- 消融研究:
- 修订者 vs. 预测器: 修订 TSFM 先验在 8 种不同的 LLM 上始终优于直接预测。
- 轨迹多样性: 包含多样化的推理轨迹和困难案例(回退)至关重要;仅筛选“简单”案例会损害尾部性能(p99 指标)。
- 奖励设计: 与标准的 ExpMAE 奖励相比,ImpRatio 奖励显著减少了奖励崩溃,从而实现了更稳定和有效的策略优化。
- 泛化性: 当应用于不同的基础 LLM(如 Qwen3-4B)和不同的轨迹生成器时,该方案被证明具有鲁棒性。
意义与主张
本文声称,POSTTIME 提供了一种可扩展、有效的方案,用于弥合数值 TSFMs 与多模态 LLMs 之间的差距。通过重新定义 LLM 作为基于上下文的修订者的角色,并利用特定的数据构建和奖励策略优化预训练后微调过程,该方法在不需从头预训练的情况下实现了卓越的多模态预测精度。
作者强调,他们的方法教导 LLM 变得“校准”——不仅知道如何修订,还知道在上下文不足时何时保留数值先验。这种能力对于稳健的现实世界部署至关重要,因为在现实世界中,文本上下文可能是嘈杂或无关的。这项工作表明,对于多模态时间序列任务,最有效的交互机制可能不是在单个模型的输入或输出端融合模态,而是利用 LLM 批判性地评估并干预专用数值模型的输出。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。