← 最新论文
🤖 machine learning

David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

本文通过对七个真实事件日志的系统性基准测试表明,在下一活动预测任务中,一个简单的基于计数的 argmax 基准模型往往能达到或接近复杂深度学习模型及数十亿参数大语言模型的性能,从而挑战了模型复杂度和预训练能够持续带来更优结果的假设。

原作者: Hans Weytjens, Ingo Weber

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Hans Weytjens, Ingo Weber

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大卫挑战歌利亚:下一环节预测中的大卫与歌利亚

这是一篇关于论文《下一环节预测中的大卫与歌利亚》的解释,使用了通俗易懂的语言和富有创意的类比。

核心问题:预测下一步真的需要超级计算机吗?

想象一下你正在看电影。你已经看了前半部分,现在想猜猜接下来会发生什么。

  • “歌利亚”(Goliath)式方法: 你雇佣了一支由 1,000 名专家组成的影评人团队,他们看过了有史以来所有的电影。他们利用其庞大的历史、文化和叙事知识来猜测结局。
  • “大卫”(David)式方法: 你只需观察最后一幕。如果英雄刚刚拿起一把剑,你就猜下一幕会有战斗;如果英雄刚刚坐下来吃晚饭,你就猜下一幕会涉及进食。

这篇论文在问:我们真的需要这 1,000 名专家(歌利亚),还是仅仅观察最后一幕(大卫)就足够了?

背景:业务流程预测

研究人员正在从事一个被称为**预测性流程监控(Predictive Process Monitoring)**的领域。可以将业务流程想象成一份食谱或一条工厂装配线。

  • 目标: 给定一系列已经执行的步骤(例如:“收到订单”、“检查付款”、“包装物品”),预测紧接着的下一个步骤(例如:“运送物品”)。
  • 竞争者:
    1. Argmax(大卫): 一个超级简单的规则。它只是统计过去某个特定步骤之后通常跟着哪个步骤。如果“运送”在 90% 的情况下都紧随“包装”之后,它就会预测为“运送”。
    2. LSTM: 能够很好记忆序列的较旧的智能计算机。
    3. Transformer 与 LLM(歌利亚): 那些拥有数十亿参数的庞大 AI 模型(例如驱动聊天机器人的模型),它们在整个互联网上进行了“预训练”。其背后的逻辑是,因为它们了解大量的语言和模式,所以它们在预测业务步骤方面应该表现出色。

实验: “词汇量”问题

研究人员尝试将这些巨大的 AI 模型(LLM)用于业务任务。但业务数据并不是自然语言。它不是“猫坐在垫子上”,而是“事件 ID 405:发票已批准”。

为了让 AI 理解,他们必须将业务数据翻译成 AI 的语言。他们通过以下方式实现:

  1. 采用一个巨大的预训练模型(歌利亚)。
  2. 替换掉它的词典,使其理解业务术语而非英语单词。
  3. 教导它特定的业务规则(微调)。

然后,他们将这些“翻译过”的巨头与以下模型进行对比:

  • 从零开始训练的小型模型(仅在业务数据上学习)。
  • 简单的 “Argmax” 计数器。
  • 旧的 LSTM 模型。

实验结果:巨人的踉跄

论文的研究结果令人惊讶,可以总结为 “大卫对阵歌利亚”,而大卫胜出或打平。

1. “预训练”的迷思
研究人员发现,巨大的 AI 模型从互联网学到的“知识”(预训练)并没有提供帮助

  • 类比: 想象一位厨师,他做过世界上所有的菜肴(预训练的 AI)。你请他只用三种食材做一份非常简单的三明治。这位厨师试图利用他深厚的法餐知识来制作这个三明治,但结果发现,一个只专门制作这种特定三明治的当地熟食店员工(从零开始训练的模型)做得反而更好。这位厨师博大精深的知识反而成了干扰。

2. 越大并不代表越好
他们测试了从极小到极其庞大(数十亿参数)的模型。

  • 结果: 将模型规模扩大 1,000 倍并不会让它变得聪明 1,000 倍。事实上,较小、较简单的模型往往表现得和这些巨头一样好,甚至更好。

3. 简单的计数器胜出(大部分情况下)
在他们测试的大多数业务数据集上,简单的 “Argmax” 计数器(大卫)的表现与拥有数十亿参数的 AI(歌利亚)不相上下。

  • 原因: 业务流程通常是重复性的。如果 90% 的情况下步骤 B 紧随步骤 A 之后,你不需要一台超级计算机来搞清楚这件事。你只需要一个计算器。复杂的 AI 显然是大材小用了。

4. 什么时候巨头会赢?
巨大的 AI(以及从零开始训练的模型)仅在两个特定的数据集(BPI12 和 BPI17)上显示出明显的优势。这是因为在这两个案例中,业务流程足够复杂,或者数据的变化足够多样,以至于需要比简单计数器更高级的“大脑”。

总结

论文的结论是,业务流程预测领域一直试图用“大锤”(大规模 AI 模型)来解决问题,而实际上只需要一把“弹弓”(简单的计数器或小型模型)就足够了。

  • 不要在只需要弹弓的地方带上一位巨人。
  • 在投入数百万美元训练大规模 AI 模型之前,从业者应该先尝试使用简单的频率计数器。
  • 如果确实需要更复杂的模型,与其强行让一个巨大的、经过预训练的互联网模型来胜任这项工作,不如直接在特定数据上从零训练一个小模型。

简而言之: 在这项特定的工作中,那款“聪明”的 AI 并没有表现得比一个简单的计算器更聪明。研究人员建议我们停止把事情复杂化,转而使用更简单、更高效的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →