← 最新论文
🤖 machine learning

ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models

该论文介绍了 ChronoSSM,这是一种自回归状态空间模型,它通过对事件和时间戳生成进行联合训练,在不损害内容预测质量的前提下产生更具时间信息量的表示,其性能优于将时序视为次要信号的传统两阶段方法。

原作者: Adrien Schoen, Nachiketa Ratnakar Patil, Arjun Bhagoji, Francesco Bronzino

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Adrien Schoen, Nachiketa Ratnakar Patil, Arjun Bhagoji, Francesco Bronzino

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人讲故事。长期以来,科学家们非常擅长教机器人预测故事中“接下来会发生什么”——比如,在“国王去世了”之后,下一句很可能是“王后因悲伤过度而去世”。但通常情况下,机器人并不关心这些事情发生的“时间”——它把时间视为一个乏味的背景细节,仅仅是边缘处的一个次要注释。这对于写小说来说没问题,但当你需要理解现实世界的事件时,比如医生追踪病人的心跳,或者安全系统发现网络攻击时,这种方法就会失效。在这些情况下,知道心脏是在“三秒钟前”跳动了一下,与知道跳动确实发生了同样重要。如果机器人无法学会故事的节奏,它就无法真正理解情节。

这就是名为“ChronoSSM”的新想法出现的地方。研究人员提出了一个简单但棘手的疑问:我们能否教机器人同时学习故事和时机,并使用同一个大脑?通常,科学家们使用两步法:首先,教机器人完美地掌握故事,然后冻结它的脑部,再附加一个单独的、较小的模块专门用来猜测时间。但作者怀疑,这就像试图通过先教一个人如何转向,然后冻结双手,再指望他们以后能学会踩油门来教人开车一样。他们想知道,如果从一开始就教机器人同时处理故事和时钟,是否会让它变得更聪明,而不会让它在学习过程中忘记如何讲故事。

团队构建了一种名为 ChronoSSM 的新型 AI 模型来进行测试。把这个模型想象成一个正在学习演奏复杂乐曲的音乐家。“两阶段法”就像是先教音乐家音符,锁定他们的手指,然后再让他们去摸索节拍。而 ChronoSSM 使用的“联合法”,则像是同时教音乐家音符和节奏,让节奏有助于塑造他们按键的方式。研究人员在四种完全不同类型的数据上测试了它:业务流程日志(类似于办公室任务的清单)、医院病人记录(医疗事件的流)、网络流量(在互联网中穿梭的数据包)以及世界事件地图(关于历史和新闻的事实)。

结果非常清晰。当他们在训练后观察模型的“冻结”大脑时,发现使用“联合法”训练的模型在揭示时间信息方面表现得好得多。就好像联合训练的模型拥有一个两阶段模型所不具备的隐藏节奏部。研究人员可以轻松地从联合模型中提取出时间数据,而两阶段模型则将时间信息埋藏得很深,难以寻获。这种情况发生在所有四种不同类型的数据中,无论时间信息是密集的(每一步都有时间)还是稀疏的(只有部分步骤有时间)。

但有一个问题:教机器人关注时间会不会让它变得更差于讲故事?研究人员担心,通过将机器人的注意力分散在“什么”和“何时”之间,它可能会在故事本身上出错。他们进行了仔细检查。在业务流程数据上,故事质量完全相同。在医院数据上,故事几乎一致,只有在匹配最常见事件方面存在微小且可以忽略不计的差异。然而,在网络流量和世界事件数据上,联合法实际上让故事变得更好了。看起来,学习节奏有助于模型更深入地理解数据的结构。

简而言之,这项研究表明,我们不必在聪明的讲述者和精准的计时器之间做选择。通过将它们一起训练,我们得到了一个既能理解情节又能理解节奏的模型,且不会丧失其讲述好故事的能力。这为开发能够处理时间与事件本身同样重要的现实世界情况的更智能的 AI 开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →