← 最新论文
🤖 machine learning

NEST: Nested Event Stream Transformer for Sequences of Multisets

本文介绍了 NEST,一种嵌套事件流 Transformer,它通过保留事件序列(多重集序列)的层次结构,克服了现有扁平化模型的计算低效和表示局限性,并利用一种新颖的掩码集合建模范式来提升预训练效率和下游性能。

原作者: Minghui Sun, Haoyu Gong, Xingyu You, Jillian Hurst, Benjamin Goldstein, Matthew Engelhard

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Minghui Sun, Haoyu Gong, Xingyu You, Jillian Hurst, Benjamin Goldstein, Matthew Engelhard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图理解一位患者的病史,或者某位顾客的购物习惯。在现实世界中,这些事件并非像串在绳子上的珠子那样,一个接一个地完美线性发生。相反,它们是以群组的形式发生的。

  • 在医院里: 医生接诊一位患者(一次“就诊”)。在这次就诊期间,患者可能同时接受血液检查、获得处方并得到诊断。这三件事的确切顺序可能并不重要,或者记录可能有些混乱。但这组事件属于那次特定的就诊。
  • 在杂货店里: 顾客去购物。他们将牛奶、面包和鸡蛋放入购物车。那个“购物篮”就是一个群组。他们拿起这些物品的顺序并不重要;重要的是整个购物篮。

大多数当前的 AI 模型(称为 Transformer)试图将这些群组压平为一条单一、漫长的线性事件序列。它们将牛奶、面包和鸡蛋视为依次发生的事件,忽略了它们属于同一次购物之旅的事实。这就像试图通过查看每一帧画面的列表来理解一部电影,却不知道哪些场景属于同一幕。这不仅计算成本高昂,而且往往忽略了大局。

引入 NEST(嵌套事件流 Transformer)。

本文的作者构建了一种名为 NEST 的新 AI 模型,它尊重这些自然的群组。以下是其工作原理,使用简单的类比:

1. 两步舞(架构)

NEST 没有将数据压平,而是保持“群组”(如医院就诊或购物篮)的完整性。它在模型的每一层内部使用了一个巧妙的两步过程:

  • 步骤 A:群组内部讨论(集合编码器): 首先,模型查看一个群组(例如一次医院就诊),并让该群组内的所有事件相互“交流”。它弄清楚在该次就诊内部发生了什么。这就像一次团队会议,每个人讨论各自的具体任务。
  • 步骤 B:全球圆桌会议(跨集合编码器): 接下来,模型查看每个群组的“队长”(称为 [CLS] 的特殊标记)。这些队长会面,向时间线的其余部分分享各自群组中发生的事情。这有助于模型理解就诊 A 与就诊 B 之间的关系。

魔法技巧: 大多数模型先对所有群组执行步骤 A,然后对所有群组执行步骤 B。而 NEST 则交错执行这两步。它执行一点步骤 A,然后执行一点步骤 B,然后再回到步骤 A。

  • 为什么这很重要: 想象一场接力赛。如果你跑完第一整段才传递接力棒,你可能会在途中丢失一些信息。NEST 则不断地来回传递接力棒。这确保了当模型试图理解大局时,特定事件的任何细节都不会丢失。论文从数学上证明,这种“旁路”比旧方法保留了更多的信息。

2. “队长的报告”(掩码集合建模)

在旧方法中,AI 处理完所有数据后,必须猜测如何将整个就诊总结为单一分数。这就像要求学生在阅读完整个章节后总结该章,却只给他们一个模糊的提示。

NEST 引入了一种新的训练游戏,称为掩码集合建模(MSM)

  • 工作原理: 模型看到一个事件群组(如购物篮),但它必须根据“队长”标记来猜测该群组的内容,而实际物品是隐藏的。
  • 结果: 这迫使“队长”标记成为整个群组的完美总结。因此,模型不再需要在稍后进行混乱的、靠猜测的总结,而是已经准备好高质量的总结,可用于任何未来任务。

3. 为什么它更好(结果)

作者在真实世界数据上测试了 NEST:

  • 医疗记录(EHR): 他们使用了来自医院(MIMIC-IV)和一家私立儿科数据库的数据。
  • 购物: 他们使用了杂货数据(Instacart)。

发现:

  • 更快更精简: 由于 NEST 尊重群组,它不必计算每一个单独事件之间的连接。它只计算群组内部以及群组队长之间的连接。这使得它比旧模型更快,且使用的计算机内存更少,尽管它拥有更多的“脑力”(参数)。
  • 更智能的预测: NEST 在预测以下事项方面表现更好:
    • 患者是否会在住院期间死亡?
    • 患者是否会在 30 天内再次入院?
    • 顾客接下来会购买什么物品?
  • 无需“后处理”: 由于模型在训练期间学会了总结群组,因此它不需要在训练后使用笨拙的启发式技巧来理解数据。总结已经准备就绪。

总结

将 NEST 视为一个终于理解上下文至关重要的模型。它知道在同一次医院就诊中进行的血液检查和开具的处方是一个团队,而这个团队是患者生活更大故事的一部分。通过保持这些群组在一起并让它们高效沟通,NEST 比那些试图将所有内容强行塞入单一长线的模型学习得更快、使用能量更少,并能做出更好的预测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →