← 最新论文
🤖 machine learning

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

Chronicle 是一个紧凑的、仅含 32400 万参数的解码器型 Transformer,它在统一架构中从头开始同时在自然语言和时间序列上进行训练,在两个领域均实现了具有竞争力的性能,并具备卓越的模态融合预测能力,而无需依赖对预训练语言模型的后期适配。

原作者: Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你让两位截然不同的专家同处一室。

第一位专家是时间序列分析师。他们擅长解读随时间变化的数据——比如股价、天气模式或心率监测仪读数。他们只需观察线条的形态,就能预测接下来会发生什么。然而,他们是哑巴;无法解读那些常伴随数据出现的笔记、新闻报道或描述性文字。

第二位专家是语言学者。他们精通阅读书籍、理解故事和回答问题。但如果你递给他们一张原始数字的电子表格,他们会完全不知所措。他们不懂“数据”这门语言。

长期以来,科学家们试图让这两位专家协同工作:给语言学者上一门速成数学课,希望他们能同时掌握两者。但论文指出,这就像强迫鱼穿上靴子去学爬树。语言学者的大脑是为文字构建的,而非为时间的韵律所设计,因此结果笨拙且低效。

“编年史”(Chronicle)登场了。

这篇论文的作者从头开始构建了一种全新的专家模型。他们并非在现有的语言专家基础上强行灌输数学知识,而是打造了一个单一、紧凑的大脑(一个拥有 3.24 亿参数的模型),让它从第一天起就同时学习两种语言。

以下是他们采用的方法,借助一些简单的类比:

1. “共享教室”模式

大多数先前的模型试图将时间序列模块强行拼接到语言模型上。这就像盖好了一栋房子,却试图把游泳池粘在屋顶上。

“编年史”则不同。它就像建立了一个单一的共享教室,学生(即数据)要么在读书(文本),要么在观察时钟滴答(时间序列)。

  • 课程安排:在大部分训练过程中,学生们分组学习。92% 的时间他们在读书,8% 的时间他们在研究时钟。
  • 神奇之处:尽管分组学习,但他们坐在相同的课桌前,使用相同的笔记本(即“共享参数”)。等到毕业时,大脑的“语言”部分已经掌握了时间的韵律,而“时间”部分也习得了语言的细微差别,全程无需将它们强行粘合。

2. “拼布”被褥

为了教会模型理解时间,作者并没有逐个输入原始数字。相反,他们将时间序列切割成小方块,就像拼布被褥上的布片

  • 想象一条代表一年温度数据的长布条。
  • 将其切割成 32 天的片段(布片)。
  • 每个片段被转化为一个单一的“令牌”(token,即类似单词的单位),供模型理解。
  • 这使得模型能像阅读句子一样轻松地看到数据的“形状”(是上升?还是激增?)。

3. “两阶段”训练

训练分为两个阶段:

  • 第一阶段(基础):模型分别学习阅读书籍和预测下一个布片。它在这两项任务上都变得非常擅长。
  • 第二阶段(对话):他们引入了少量“混合”数据。想象一下,同时向模型展示一张风暴云的图片(布片)和句子“正在下雨”(文本)。这教会了模型两种模态如何相互关联,使其能够理解数字中的特定模式意味着“下雨”。

他们证明了什么?

论文声称,这种新的“编年史”模型之所以强大,原因有三:

  1. 它是双语大师:它的文本理解能力与其他同规模的小型专用语言模型(如 Gemma-3 或 LLaMA)一样出色。它并没有因为学习了数学而丧失阅读能力。
  2. 它是时间预测专家:尽管大部分训练时间都在阅读文本,但它在预测未来数字方面的表现,优于几乎所有仅关注数字的模型。
  3. 它是融合高手:当你同时提供文本和数字(例如关于股市崩盘的新闻报道加上股票图表)时,它在预测未来方面的表现,优于任何此前尝试结合两者的模型。

核心结论

论文总结道,你不必强迫语言模型去学习时间序列,也不必强迫时间序列模型去学习语言。相反,你可以构建一个统一的基础架构,让它从一开始就同时学习两者。

这就像一位通用翻译官,他并非通过逐字翻译来学习第二语言,而是自幼同时讲着两种语言长大。他理解两者的感觉语境,因此比那些成年后才学习第二语言语法规则的人要准确得多。

注意:该论文严格聚焦于模型理解、分类和预测数据的能力。它并未声称该模型目前已被用于医院、金融交易大厅或气象站,也未预测未来的临床应用。它是一项基础研究步骤,证明了这种特定的 AI 构建方式优于旧方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →