← 最新论文
🤖 machine learning

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

本文提出了 TiMi,这是一个利用大语言模型进行因果推理,并结合轻量化多模态混合专家模块,从而在无需显式对齐的情况下将文本信息有效整合进时间序列预测的新型框架,并在十六个真实世界基准测试中实现了最先进的性能。

原作者: Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

时间序列预测是研究如何通过观察一段随时间记录的数字序列来推测未来可能发生什么的科学。它是预测从汽油价格到流感爆发传播等一切事物的引擎。几十年来,最成功的方法几乎完全依赖于数字本身,即在过去寻找模式并将其投射到未来。然而,现实世界很少仅仅是一串数字。它是一个复杂的系统,受到新闻标题、政府政策以及往往以文本而非数据点形式出现的意外事件的影响。虽然人类在读到关于供应链中断的新闻报道时会自然地调整对未来价格的预期,但传统的计算机模型却难以做到这一点。它们通常将文本视为一个单独的、令人困惑的层,难以与平滑流动的数值数据对齐,从而导致在世界发生变化时预测失准。

清华大学的一个研究小组提出了一种弥合这一差距的新方法,引入了一个名为 TiMi 的系统。该方法并没有试图将文本和数字强行塞入同一种僵化的格式,而是将两者视为两个独立但相互协作的引导者。其核心思想是使用大语言模型(一种在海量人类写作基础上训练的人工智能)来阅读文本,并推理其对未来的意义。该模型不仅仅是记忆文字;它还分析文字以推断因果因素,例如一项新政策会导致销售上升还是下降。这种推理随后被传递给一个专门的预测引擎,利用这些洞察力来优化其数值预测。研究人员发现,通过让语言模型充当数字的“向导”,而不是试图将它们合并成一个单一且混乱的混合体,该系统能够实现显著更准确的预测。

研究人员在涵盖农业、气候、能源和公共卫生等多个不同领域的 16 个真实世界数据集上测试了这种方法。在这些测试中,这个新系统始终优于现有的先进模型,包括那些此前曾尝试结合文本和数字的模型。在文本提供了明确的数值变化原因的情景下(例如一份关于智能手机召回导致销量骤降的报告),其表现尤为出色。在这些案例中,新系统成功利用文本预判了跌幅,而其他模型往往无法捕捉到这种突然的变化。这项研究表明,更好的预测关键不在于强迫不同类型的数据看起来一样,而在于允许每种数据各司其职:文本提供故事和原因,而数字提供记录和趋势。

为了实现这一目标,团队设计了一个模块化系统,其作用类似于一组专业的顾问。系统的其中一部分完全专注于历史数字,学习数据的长期节奏和模式。另一部分则专注于文本,利用语言模型提取关于未来趋势的结构化见解,例如前景是在增加、减少还是保持稳定。这两股信息流随后被汇聚在一起,使系统能够根据特定时刻选择最相关的建议。如果文本暗示即将发生重大事件,系统就会侧重于该见解;如果文本模糊或无关紧要,系统则更多地依赖历史模式。这种灵活性使模型能够处理现实世界中复杂的数据,即文本和数字可能不会同时到达或以相同的格式到达。

研究人员还探索了该系统在处理不规则数据时的表现,这在现实世界中非常普遍。在许多情况下,新闻报道可能会在不可预测的时间发布,或者某些天的数据会缺失。传统模型通常在这些缺口面前显得力不从心,但新系统却能轻松应对。因为它在合并见解之前会分别处理文本和数字,所以它不需要两者之间具备完美的同步性。在不规则数据集的测试中,该系统比标准方法减少了近 30% 的预测误差。这种鲁棒性表明,该方法不仅是理论上的改进,更是一个可以应用于实际应用中不完美、异步数据的实用工具。

研究的一个关键部分涉及理解该系统是如何做出决策的。研究人员发现,系统会自动将相似类型的趋势数据进行分组。例如,当系统被要求预测一个显示强劲上升趋势的数据集的未来时,它会一致地依赖其内部逻辑的一个特定部分。当趋势向下时,它会切换到另一个部分。这种行为表明,该系统不仅仅是在猜测;它正在学习专业化,将其大脑中的不同“专家”分配给处理不同类型的未来场景。此外,研究还表明文本的质量至关重要。当研究人员向系统输入带有噪声或无关的文本时,系统的性能仅轻微下降,这证明了它能够过滤掉噪声并专注于有效信号。

这些发现挑战了这样一种流行观点,即结合文本和数字的最佳方式是将它们融合为一个统一的表示形式。之前的尝试通常试图将文本转化为一种数值编码,以便直接与时间序列数据混合,而这个过程往往会稀释文本的含义。新方法拒绝了这种融合,转而采用一种引导式交互。通过将文本保留为因果推理的来源,并将数字保留为预测的主体,该系统保留了双方各自的独特优势。研究人员证明,这种方法适用于广泛的领域,从追踪流感病例到预测交通流量,这表明阅读和推理文本的能力是预测领域的一项通用资产。

最后,这项工作为时间序列分析中的人工智能提供了一条更清晰的前行路径。它表明,预测的未来可能不在于构建更大、更复杂、试图同时处理一切的模型,而在于设计能够倾听不同类型信息的系统。通过让语言模型阅读新闻,让预测模型观察数字,并让它们协同工作,该系统实现了单靠其中任何一方都无法达到的准确性和适应性。结果表明,对于任何试图预测复杂系统未来的人来说,数字背后的故事与数字本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →