想象一下,你是一名正在试图破解谜题的侦探,但你的犯罪现场不是犯罪现场,而是一条商业活动的数字足迹。这个领域被称为预测性流程监控(Predictive Process Monitoring)。你可以把它想象成公司工作流的 GPS:它观察一个案例(比如贷款申请或许可证请求)如何从一步步走向下一步,并试图猜测它最终会走向何方。这笔贷款会被批准吗?这个项目能按时完成吗?为了实现这一点,公司使用被称为**深度学习模型(Deep Learning models)的强大计算机大脑。这些模型就像是读过数百万个过去故事的超级聪明学生,能够发现人类容易忽略的模式。但问题在于,这些模型是“黑盒”。它们会给你答案,但不会告诉你为什么它们会这么认为。这就像一位老师给了你考试成绩,却拒绝展示哪些答案是对是错。正因如此,人们往往不敢放心地让它们做出重要的决策。为了解决这个问题,科学家们使用了可解释性(Explainability)**工具。这些工具就像手电筒,能照亮模型的思考过程,凸显出故事中哪些特定部分最为重要。然而,旧的手电筒要么由于“缩放得太近”而显示每一个微小的步骤(这会让信息变得过于繁杂且令人困惑),要么由于“缩放得太远”而将整个故事模糊成一个大团(这会导致细节丢失)。
这篇论文介绍了一种为业务流程提供这种“手电筒光亮”的新方法。作者 Kseniya Sahatova 及其团队意识到,业务流程的故事不仅仅是随机的事件列表;它们有着节奏和流动感,就像书中的章节一样。他们提出了一种方法,根据活动如何自然地相互衔接,将冗长且混乱的流程日志分解为有意义的“章节”或片段(segments)。他们不再追问:“这封邮件重要吗?”或者“整个文件重要吗?”,而是追问:“这个特定的阶段重要吗?”
为了测试他们的想法,他们构建了一个“虚构”的业务流程,其中他们完全掌握了剧情转折发生的位置(即“地面真值/ground truth”)。他们发现,这种新方法识别这些剧情转折的准确率超过 90%,比仅仅观察单个步骤的效果要好得多。当他们尝试将该方法应用于荷兰一家银行的贷款申请和一家市政部门的行政任务等真实世界数据时,结果更加有趣。对于贷款申请,他们的方法清晰地展示了:一条平滑、结构化的路径导向了批准;而一种“反复创建报价”的特定模式则是导致拒绝的巨大红旗。这就像是在电影中找到了一个总是预示悲剧的特定情节装置。
论文指出,这种“片段级”的方法是完美的平衡点。它在数学上的完美程度不如观察每一个事件(后者最忠实于模型的原始数学逻辑),但它更容易被人类理解。它将相关的事件组合在一起,让你能够看到预测背后的“故事”。然而,作者也谨慎地指出,这种方法在业务流程具有清晰结构时效果最好。如果一个流程极其混乱,每个案例都完全不同,该方法可能会产生困惑,并将故事拆分成过多细碎且毫无意义的碎片。但对于那些拥有逻辑流动的流程,这种基于“章节”的解释能通过展示旅程中究竟是哪些部分左右了结果,从而帮助我们信任人工智能。
技术摘要:基于特征归因的预测性过程监控可解释性分析
1. 问题陈述
预测性过程监控(Predictive Process Monitoring, PPM)利用深度学习模型(如循环神经网络 RNN 和 Transformer)来预测正在进行的业务流程的后续结果、剩余时间或未来的活动序列。虽然这些模型通过捕捉事件日志中的序列依赖关系实现了极高的预测性能,但其“黑盒”性质阻碍了它们在对安全性要求较高的运营环境中的信任与应用。
现有的可解释性方法,特别是像 SHAP(Shapley 加性解释)和 LIME 这样的特征归因技术,在应用于 PPM 时面临着两难境地:
- 事件级解释(Event-level explanations): 为单个事件分配重要性往往会导致碎片化的见解,无法揭示有意义的过程行为或更广泛的执行上下文。
- 轨迹级解释(Trace-level explanations): 将整个轨迹聚合为一个单一单元会引入信息丢失,并掩盖了究竟是哪些特定的执行部分驱动了预测结果。
- 时间序列的局限性: 虽然时间序列文献提供了将相邻观测值分组的分割方法,但这些通用的方法往往无法遵循业务过程事件日志中特有的控制流约束、活动语义和不规则的时间间隔。它们可能会切断连贯的过程阶段,或者合并无关的行为。
因此,需要一种既能平衡计算效率,又能保留局部控制流上下文的可解释性方法,以便利益相关者能够理解哪些过程阶段影响了预测。
2. 方法论
作者提出了一种局部事后(post-hoc)可解释性方法,该方法将控制流感知分割算法与段级(segment-level)SHAP 值计算相结合。
2.1 控制流感知的轨迹分割
该方法的核心是一个将轨迹划分为连贯子序列(段/segments)的算法,该算法基于转移概率的变化进行划分。
- 直接跟随关系(Directly-Follows Relation, DFR): 算法首先从事件日志中构建直接跟随图(Directly-Follows Graph, DFG),以推导出活动之间的经验转移概率。
- 代价函数: 对于给定的轨迹,算法为潜在的段分配一个代价。在日志中频繁出现的转换贡献较低的代价,而罕见或未见过的转换则会产生惩罚(γ)。段 s 的代价定义为其转换的负对数概率之和:
C(s)=i=1∑m−1c(ai,ai+1)
其中,如果转换存在,则 c(ai,ai+1)=−logT[ai,ai+1];否则为 γ。
- 变点检测: 算法采用 PELT(剪枝精确线性时间) 算法来检测最小化惩罚目标函数的变点。该函数平衡了总分割代价与针对段数量的惩罚项(βk),以防止过度分割。通过网格搜索选择超参数 β,以最小化赤池信息准则(AIC)。
- 结果: 轨迹被划分为若干个段,每个段代表一个具有一致局部控制流行为的过程阶段。
2.2 段级 SHAP 计算
一旦完成轨迹分割,该方法将每个段视为 SHAP 值计算中的单个可解释单元,而非单个事件。
- 联盟定义(Coalition Definition): 对于 k 个段,定义一个联盟向量 z∈{0,1}k。若 zl=1,表示该段保留其原始值;若 zl=0,则表示该段被替换为基准值(该基准值源自训练数据中类别属性的众数和数值属性的平均值)。
- 扰动: 模型在经过扰动的轨迹上进行评估,在这些轨迹中,特定的段被遮蔽并由基准值替换。
- SHAP 值: 应用 KernelSHAP 来计算每个段的 Shapley 值,满足效率属性,即各段归因之和等于模型预测值与基准预测值之间的差异。
3. 实验设置
本研究使用以下内容评估所提方法:
- 数据集:
- 由 SimBank 模拟器生成的合成数据集,具有已知的地面真值(ground-truth)变点(取消 vs. 接受结果),用于验证分割准确性。
- 两个真实世界基准数据集:BPIC15(荷兰市政行政流程)和 BPIC17(金融机构贷款申请)。
- 预测模型: 基于 LSTM 的序列分类器,在固定长度的前缀(30 个事件)上进行训练,用于预测二元结果(例如,接受 vs. 取消)。
- 基准方法:
- 逐事件归因(Per-event attribution): 标准的事件级 SHAP。
- 基于分布的分割(Distribution-based segmentation): 一种根据时间窗口和会话定义对事件进行分组的方法(改编自推荐系统)。
- 评估指标:
- 分割质量: RandIndex、精确率(Precision)、召回率(Recall)和 F1 分数(针对合成数据);熵相关性(Entropic Relevance, ER)和模式覆盖率(针对真实世界数据)。
- 解释忠实度(Explanation Faithfulness): 通过扰动计算相对预测变化(Relative Prediction Change, RPC)。这衡量了当扰动重要的段(高 SHAP 值)与扰动不重要的段时,预测结果的变化程度。
4. 主要结果
4.1 分割质量
- 合成数据: 所提算法与地面真值变点表现出高度一致,RandIndex 得分超过 0.9,F1 分数在取消案例中为 89%,在接受案例中为 87.4%。
- 真实世界数据 (BPIC17): 该方法识别出了连贯的过程阶段。对于接受的案例,前 10 个分割模式覆盖了 81.4% 的轨迹,表明其具有稳定的控制流结构。熵相关性(ER)从全日志的 37.81 大幅下降至 6.68,表明这些段捕捉到了高度确定且可压缩的模式。
- 真实世界数据 (BPIC15): 由于许多活动对之间存在高度变异性和低转移概率,算法产生了细粒度的段(平均每个段 2 个事件)。这表明具有高控制流变异性的日志会限制形成可泛化段模式的能力。
4.2 解释忠实度
- 扰动分析: 段级 SHAP 值展示了高度的忠实度。扰动最重要的前 k 个段(覆盖约 40% 的轨迹)会导致显著的预测变化(高 RPCI),而扰动不重要的段则影响极小(低 RPCU)。
- 对比: 虽然逐事件归因显示出略高的粒度,但段级方法(无论是基于分布还是基于控制流感知)都提供了在重要部分与不重要部分之间更清晰的分离。逐事件方法有时会通过扰动孤立的事件来破坏局部依赖关系,从而导致意外的预测偏移。
4.3 定性见解
- 接受案例 (BPIC17): 包含平滑转换(例如,Concept → Complete application)的段持续将预测推向“接受”(负 SHAP 值)。
- 取消案例 (BPIC17): 涉及重复创建报价(offer creation)的段获得了极高的正 SHAP 值,强烈地将预测推向“取消”。这识别出了一个与失败相关的特定瓶颈(重复生成报价)。
- 可解释性: 该方法成功地将模型预测与具体的业务过程阶段(例如,“申请完成” vs. “报价创建”)联系起来,而非孤立的事件。
5. 重要性与主张
论文声称,所提方法提供了一个有用的中间地带,介于细粒度的事件级解释和粗粒度的轨迹级解释之间。
- 上下文保留: 通过基于控制流动态对活动进行分组,该方法保留了解释“为什么某个活动会影响结果”所需的局部上下文。
- 可理解性: 它缓解了重要事件与不重要事件相互交织的问题,使解释对过程利益相关者更具可理解性。
- 对日志结构的依赖性: 作者谦虚地指出,该方法的有效性取决于事件日志的结构。具有中等控制流变异性的日志(如 BPIC17)可以产生有意义且可比较的段,而具有高度变异性的日志(如 BPIC15)则会导致针对特定案例的细粒度分割,从而限制了泛化能力。
- 实际效用: 该方法能够识别引导案例走向预测结果的具体过程阶段(变点),从而支持针对性的决策制定和瓶颈检测,而无需实现完全的模型透明化。
研究结论认为,虽然逐事件归因由于其粒度优势在忠实度方面仍略胜一筹,但段级解释通过与业务过程的结构约束相一致,显著增强了 PPM 中深度学习模型的可解释性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。