← 最新论文
🤖 machine learning

Revisiting Predictive Process Monitoring in the Age of Foundation Models: A Comparative Study of Sequence, Tabular, and LLM Approaches

本文对用于预测性流程监控的序列、表格及基于大语言模型(LLM)的方法进行了对比基准测试,结果表明,虽然序列模型在下一活动预测方面表现出色,且表格基础模型在时间任务中具有竞争力,但尽管大语言模型的计算成本更高,其表现通常却较差。

原作者: Lennart Fertig, Lukas Kirchdorfer, Tobias Sesterhenn

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Lennart Fertig, Lukas Kirchdorfer, Tobias Sesterhenn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观察一个繁忙的厨房。订单不断涌入,厨师们在切菜、油炸和摆盘,有时一道菜会因为等待酱汁或缺少食材而卡住。如果你能窥探未来,确切知道下一步是什么、这道菜需要多久才能做好,或者订单是否会延迟,你就能在问题发生前将其解决。这就是**预测性流程监控(Predictive Process Monitoring, PPM)的核心。它是计算机科学的一个分支,通过观察事物发生的数字“收据”——比如工厂制造汽车或银行审批贷款的过程——来预测接下来的走向。多年来,实现这一目标的最佳方法是从头开始训练一个专门的计算机大脑,教它那个特定“厨房”的具体规则。但最近,迎来了一波被称为大语言模型(Large Language Models, LLMs)**的超智能通用型计算机浪潮。这些模型可以写诗、写代码并与你聊天,人们不禁好奇:“我们能不能直接询问这些通用的天才,让他们来预测我们厨房的未来?”与此同时,第三种选择也出现了:表格基础模型(Tabular Foundation Models),它们就像是观察整齐行列数据的专家统计学家,而不是处理故事。大问题在于:我们是否仍需要那些专门的“厨房专家”,还是说这些“通用天才”和“行列统计学家”已经接管了局面?

这篇论文是一场大规模的“试吃会”,旨在测试这三位“厨师”中谁能做出最好的菜肴。研究人员设置了一场受控竞赛,使用了五个不同的真实世界“厨房”(业务流程数据集),并要求模型预测三件事:下一个活动是什么、下一步需要多长时间,以及整个任务还剩多少时间。他们将传统的序列模型(Sequence Models)(专为这项工作从头训练)与LLMs(使用一种称为 LoRA 的技术进行适配以学习流程)以及表格模型(Tabular Models)(使用上下文学习,即通过观察眼前的例子进行学习,而不进行重新训练)进行了对决。

结果既让人感到意外,又让“老派人士”感到欣慰。在预测下一个活动(例如预测厨师接下来会切洋葱)时,专门的序列模型是明显的赢家。它们的准确率始终最高,击败了 LLM 和表格模型。论文指出,这是因为这些模型非常擅长理解特定事件的顺序和流程,尤其是在流程变得复杂且存在许多可能路径(分支)时。表格模型时间相关任务方面表现相当出色,在预测耗时方面往往能达到与专家模型相当的水准。然而,尽管 LLMs 名气最大且运行成本最高,但表现通常落后。它们的计算时间更长(处理单个数据集有时需要超过 200 分钟,而其他模型不到一分钟),而且并不总是能给出正确的答案。事实上,在一个数据集中,LLM 经常在流程尚未结束时就错误地预测流程已结束,犯下了许多过早判断的错误。

因此,论文得出结论:虽然那些华丽的通用型 LLM 非常有趣,但它们尚未能在预测流程中下一步会发生什么方面撼动专门化模型的地位。专门化模型仍然是处理这项工作的最可靠厨师,而表格模型则是处理计时问题的强大且快速的替代方案。作者建议,LLMs 可能需要变得更大或采用不同的训练方式才能赶上,并且就目前而言,如果你想知道一个复杂流程中接下来会发生什么,传统的、专门化的方法仍然是最准确的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →