✨ 要点🔬 技术摘要
想象一下你正在观察一个繁忙的厨房。订单不断涌入,厨师们在切菜、油炸和摆盘,有时一道菜会因为等待酱汁或缺少食材而卡住。如果你能窥探未来,确切知道下一步是什么、这道菜需要多久才能做好,或者订单是否会延迟,你就能在问题发生前将其解决。这就是**预测性流程监控(Predictive Process Monitoring, PPM)的核心。它是计算机科学的一个分支,通过观察事物发生的数字“收据”——比如工厂制造汽车或银行审批贷款的过程——来预测接下来的走向。多年来,实现这一目标的最佳方法是从头开始训练一个专门的计算机大脑,教它那个特定“厨房”的具体规则。但最近,迎来了一波被称为 大语言模型(Large Language Models, LLMs)**的超智能通用型计算机浪潮。这些模型可以写诗、写代码并与你聊天,人们不禁好奇:“我们能不能直接询问这些通用的天才,让他们来预测我们厨房的未来?”与此同时,第三种选择也出现了:表格基础模型(Tabular Foundation Models) ,它们就像是观察整齐行列数据的专家统计学家,而不是处理故事。大问题在于:我们是否仍需要那些专门的“厨房专家”,还是说这些“通用天才”和“行列统计学家”已经接管了局面?
这篇论文是一场大规模的“试吃会”,旨在测试这三位“厨师”中谁能做出最好的菜肴。研究人员设置了一场受控竞赛,使用了五个不同的真实世界“厨房”(业务流程数据集),并要求模型预测三件事:下一个活动是什么、下一步需要多长时间,以及整个任务还剩多少时间。他们将传统的序列模型(Sequence Models) (专为这项工作从头训练)与LLMs (使用一种称为 LoRA 的技术进行适配以学习流程)以及表格模型(Tabular Models) (使用上下文学习,即通过观察眼前的例子进行学习,而不进行重新训练)进行了对决。
结果既让人感到意外,又让“老派人士”感到欣慰。在预测下一个活动 (例如预测厨师接下来会切洋葱)时,专门的序列模型 是明显的赢家。它们的准确率始终最高,击败了 LLM 和表格模型。论文指出,这是因为这些模型非常擅长理解特定事件的顺序和流程,尤其是在流程变得复杂且存在许多可能路径(分支)时。表格模型 在时间相关任务 方面表现相当出色,在预测耗时方面往往能达到与专家模型相当的水准。然而,尽管 LLMs 名气最大且运行成本最高,但表现通常落后。它们的计算时间更长(处理单个数据集有时需要超过 200 分钟,而其他模型不到一分钟),而且并不总是能给出正确的答案。事实上,在一个数据集中,LLM 经常在流程尚未结束时就错误地预测流程已结束,犯下了许多过早判断的错误。
因此,论文得出结论:虽然那些华丽的通用型 LLM 非常有趣,但它们尚未能在预测流程中下一步会发生什么方面撼动专门化模型的地位。专门化模型仍然是处理这项工作的最可靠厨师,而表格模型则是处理计时问题的强大且快速的替代方案。作者建议,LLMs 可能需要变得更大或采用不同的训练方式才能赶上,并且就目前而言,如果你想知道一个复杂流程中接下来会发生什么,传统的、专门化的方法仍然是最准确的选择。
技术摘要:重访基础模型时代的预测性过程监控
问题陈述
预测性过程监控(Predictive Process Monitoring, PPM)利用历史事件日志来预测正在运行的过程实例的未来,解决的任务包括预测下一个活动(NA)、距离完成案例的剩余时间(RT)以及距离下一个事件发生的时间(NT)。虽然近期的 PPM 研究主要由从头开始训练的深度序列模型(如 LSTM 和 Transformer)所主导,但基础模型的出现呈现了新的格局。具体而言,通过参数高效微调(PEFT)适配的大语言模型(LLM)以及具有上下文学习能力的表格基础模型,提供了其他的范式。然而,目前尚不清楚经典的序列模型是否仍能与这些基于基础模型的方法竞争,特别是考虑到表格基础模型尚未针对 PPM 进行系统的基准测试。
研究方法
作者通过对五个真实世界事件日志(BPI12、BPI17 以及三个 BPI20 变体)和三个预测任务(NA、RT、NT)进行受控实证基准测试,对比了三种截然不同的建模范式。
建模范式
经典序列模型: 这些模型从头开始在事件日志上进行训练。它们将前缀编码为有序的事件嵌入序列(结合了分类和数值属性),并使用循环(LSTM)或基于注意力机制(Transformer)的骨干网络。所有参数均通过监督优化进行学习。
基于 LLM 的方法: 这些方法利用预训练的仅解码器 LLM(Llama-3.2-1B 和 Gemma-2-2b)来处理数据。它们保留了序列前缀表示,但采用了结构化的事件日志编码,其中活动标签被视为过程原生的 Token。适配是通过低秩自适应(LoRA)实现的,仅优化一小部分参数,同时保持预训练骨干网络冻结。
表格基础模型: 这些模型(TabPFN-3 和 ConTextTab)将 PPM 视为表格预测问题。它们将前绪映射为固定长度的特征向量(总结了当前活动、经过时间及时间指标等属性),而不是保留显式的事件序列。它们利用上下文学习,在推理时不需要基于梯度的训练,而是依赖于对观测行的上下文调节。
实验设置
数据: 五个具有不同规模、活动字母表和轨迹长度的公开事件日志。
划分: 应用了避免泄漏的时间拆分(基于案例层级的 80/20 划分),按第一个事件的时间戳对案例进行排序。
特征: 输入包括活动标签和数值特征(累积时间、日历属性)。
评估指标: 用于 NA 的准确率;用于 RT 和 NT 的均方误差(MSE);以及用于计算效率的墙钟运行时间(wall-clock runtime)。
基准线: 本研究将三种范式相互对比,并与一个多数基准线进行对比。
核心贡献
概念对比: 论文从前缀表示、骨干参数化和适配机制三个维度对三种范式进行了结构化比较。
系统基准测试: 论文展示了对 PPM 进行的首次受控实证评估,涵盖了表格基础模型,并将其与微调后的 LLM 及经典序列模型进行了对比。
失败模式分析: 研究调查了性能差异,特别是分析了“分支”(即下一步的歧义性)如何影响模型性能,并识别了特定的失败模式,例如 LLM 中的过早序列结束预测。
结果
基准测试在不同任务和数据集上呈现出截然不同的性能模式:
下一活动(NA)预测: 经典序列模型(LSTM 和 Transformer)在所有五个数据集上始终获得最高的准确率。表格基础模型的表现通常较差,且随着分支复杂度的增加,差距会进一步扩大。LLM 的表现优于表格模型,但通常落后于最佳的序列模型。
时间任务(RT 和 NT): 结果较为复杂。表格基础模型在剩余时间(RT)预测方面经常取得最佳性能。对于下个事件时间(NT),序列模型和表格模型在不同的日志上分别占据了领先地位。LLM 模型尽管计算成本较高,但在时间任务上的表现普遍滞后。
运行时间: 序列模型和 ConTextTab 的运行时间明显低于经过 LoRA 微调的 LLM。LLM 的运行时间随日志规模的增大而显著增加。值得注意的是,表格模型中不存在基于梯度的训练并不自动保证更低的运行时间;TabPFN-3 的速度通常比序列基准模型慢。
分支敏感性: 切片级分析显示,对于 NA 预测,序列模型与表格模型之间的性能差距随分支复杂度的增加而增大。序列模型保留了事件顺序,使其能够更好地处理高分支场景,而将前缀编码为固定长度状态向量的表格模型则难以应对高歧义性。
LLM 特有问题: LLM 表现出特定的失败模式,例如过早预测序列结束(end-of-sequence)Token。在 BPI12 数据集中,这导致了 LLM 23–25% 的 NA 错误,而序列基准模型的此类错误为 0%。
意义与主张
论文声称,虽然基础模型提供了极具前景的替代方案,但它们并不能在 PPM 中普遍超越经典的序列模型。研究结论如下:
序列模型仍然是下一活动预测(NA)的最优选择 ,特别是在复杂的、高分支的过程中。
表格基础模型在时间预测任务(RT/NT)中具有竞争力 ,提供了一种无需训练的可行替代方案,尽管它们在处理复杂日志的 NA 预测时表现挣扎。
LLM 的成本很高 (运行时和计算资源),且无法持续提供卓越的准确率,经常受到数据集相关的适配问题以及特定失败模式(如过早终止)的影响。
作者强调,范式的选择高度取决于具体的预测任务以及过程日志的结构复杂度(分支)。他们指出,本次评估使用的是相对较小的 LLM,并且未探索表格模型的其他特征表示方式,并建议将这些作为未来的研究方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。