← 最新论文
💻 computer science

Schema-Agnostic Process Trace Construction: From Raw Tables to Execution Behavior

本文提出了一种与模式无关的流水线,该流水线通过统计识别关键属性和时间属性、发现表间连接,并利用时间卷积网络对事件顺序进行建模,从而从原始且松散连接的关系表中自动重建高保真度的过程执行轨迹,进而消除了在动态信息系统中对预定义模式或领域模板的需求。

原作者: Joel Lim Zhi Quan, Tan Kar Way, Lau Hoong Chuin

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Joel Lim Zhi Quan, Tan Kar Way, Lau Hoong Chuin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图重构银行抢劫案经过的侦探。在一个完美的世界里,警察会交给你一本整齐、按时间顺序排列的日记,每一条记录都准确地说明了谁在何时做了什么。

但在现实世界中,证据是零散的。你手里有一堆乱七八糟的收据、一叠监控摄像头日志、一些手写笔记,以及一份电话通话记录表。这些文件之间互不相通。收据上没有名字,监控日志没有时间戳,而电话笔记是用另一种语言写的。此外,银行每周都在更换其归档系统。

这就是这篇论文的作者们正在解决的问题。他们处理的是现代计算机系统(如银行或大型公司)中混乱、分散在许多不同表格中的数据。传统的分析方法之所以失败,是因为它们需要一个完美的、预先组织的地图(即“模式/Schema”),而这种地图根本不存在。

以下是他们的解决方案是如何运作的,分为简单的几个步骤:

问题所在:“混乱的档案柜”

在旧式的计算机系统中,数据就像一座组织有序的图书馆。每本书都有清晰的标签,你知道它属于哪层书架。
而在现代系统中,数据就像是一个囤积者的阁楼

  • 没有标签: 你很难轻易判断哪些数据属于哪个客户(缺失“键/Keys”)。
  • 碎片化的线索: 单个交易的故事被拆分到了五个不同的表中。
  • 混乱的时间线: 一个表显示“上午10:00”,另一个显示“上午10:05”,第三个只说“昨天”。
  • 不断的装修: 当你试图清理阁楼时,阁楼里的布局也在不断变化。

正因如此,构建一个清晰的时间线(称为“过程轨迹/Process Trace”)通常需要人类专家手动将它们缝合在一起,这既缓慢、昂贵又容易出错。

解决方案:一位“与模式无关”的侦探

作者构建了一个自动化的流水线,充当一名不需要地图的超级聪明侦探。他们不问“地图在哪里?”,而是直接观察证据本身来推断故事。

以下是这位“侦探”采取的四个步骤:

1. 发现线索(特征分析/Profiling)

首先,系统扫描每一列数据以猜测其含义。

  • 寻找 ID: 它寻找看起来像唯一名称的列(如客户 ID)。它会检查:“这个值是唯一的吗?它总是存在吗?它看起来像个名字吗?”
  • 寻找时间: 它寻找看起来像日期的列。它会检查:“这看起来像时间戳吗?它是否具有一致性?”
  • 类比: 想象在整理一堆混杂在一起的拼图碎片。侦探不需要盒子上印着的图案,他们只需观察碎片本身的形状,就能猜出哪些是天空,哪些是草地。

2. 连接点与线(关系发现/Relationship Discovery)

由于没有官方的“连线题”(外键),系统使用统计信号

  • 它对比不同表中的列。如果表 A 有一组数字,而表 B 有一组完全匹配的数字,系统就会假设它们是相互关联的。
  • 它忽略“官方”规则,转而观察实际的数据模式。
  • 类比: 如果你在一个口袋里发现了一张收据,在另一个口袋里发现了一份完全匹配的信用卡账单,你就知道它们属于同一个人,即使它们并没有被订在一起。

3. 构建时间线(排序/Sequencing)

一旦系统知道哪些表是相互连接的,它就会收集单个“案例”(如特定的客户订单)的所有事件。

  • 它按时间对这些事件进行排序。
  • 如果时间信息混乱或缺失,它会利用逻辑来推测顺序。
  • 类比: 侦探将针对某一特定抢劫案的所有零散笔记、收据和日志收集起来,并将它们摆在桌面上,以观察事件发生的先后顺序。

4. 学习模式(“大脑”——TCN)

这是最先进的部分。有时,时间戳过于混乱,无法判断哪个事件发生在前面。

  • 系统使用一种特殊的 AI,称为时间卷积网络(Temporal Convolutional Network, TCN)。你可以把它看作是一个模式识别引擎。
  • 它通过观察成千上万个过去的案例来学习:“通常当事件 A 发生时,事件 B 就会紧随其后。”
  • 即使时钟坏了,AI 也能根据故事的流向预测下一步。
  • 类比: 如果你看到有人穿上外套、拿起钥匙并打开门,你就知道他们即将离开,即使你没看到他们走出门口的具体瞬间。AI 学习的就是这些“故事流”。

结果:这位侦探有多厉害?

作者在模拟混乱银行的伪造数据、标准基准测试以及一个真实的行业数据集上测试了这个系统。

  • 准确率: 它能正确预测流程中下一步的概率为 85%
  • 恢复能力: 即使在数据缺失或混乱的情况下,它也能成功找回并重构约 82% 的正确事件顺序。
  • 韧性: 当数据发生“漂移”(名称改变、日期缺失)时,该系统仍能继续工作,而传统方法则会崩溃。

为什么这很重要

这篇论文认为,我们不应该等待完美的数据后再进行分析。与其强迫混乱的现实世界数据进入一个僵化、预定义的框框里,不如让数据自己说话。

通过消除对完美“模式”(即地图)的需求,这种方法使得公司能够自动理解自己的系统,即使这些系统是混乱的、不断变化的或文档记录不全的。它将一堆混乱的证据变成了一个清晰、可读的故事,而无需人类进行繁重的体力劳动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →