Exact Deviation Attribution and Amortised Event Explanation for Semi-Supervised Anomaly Detection on Dynamic Graphs
本文介绍了一种用于动态图半监督异常检测的框架,该框架提供了精确的闭式偏差归因,并学习一个摊销事件掩码以在对检测性能零影响的情况下解释决策,同时揭示了警报往往同样源于个体节点行为和群体基准偏移。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,网络并非静态的地图,而是活跃、呼吸着的活动流。每一条发出的消息、每一笔进行的交易、每一个形成的连接都实时发生,创造出一个不断变化且演进的动态图谱。几十年来,计算机科学家一直在构建系统来监视这些网络,寻找那些出错的罕见且危险的时刻——比如诈骗者进行可疑转账、黑客探测服务器,或是机器人传播虚假信息。这些被称为异常检测器的系统在识别异常方面表现出色。它们可以计算出一个分数,并准确地表示:“这看起来不对劲。”但长期以来,它们无法说明“为什么”。它们只提供警告而不给出理由,让操作员只能靠猜测来判断是什么触发了警报。在金融或网络安全等高风险领域,没有解释的警告往往是无用的;你需要知道是哪次过去的行动导致了警报,从而决定是封禁用户还是忽略误报。
当网络是连续的时候,挑战尤为艰巨。动态图不像捕捉单一瞬间的照片,而是一段事件的视频流。传统方法通常将这种流切分成若干快照,从而丢失了交互随时间展开的细微差别。一种名为 SAD 的新型检测器被设计用来处理这种连续流。它通过保留一份关于“正常”状态的记忆来工作,并随着时间的推移更新这份记忆,以适应季节性变化或节假日。当新事件发生时,系统会将其与这份活性的记忆进行对比。如果该事件偏离常态过远,系统就会发出警报。然而,即使是这样先进的系统也存在盲点:它能告诉你某个节点是异常值,但它无法分解分数来向你展示哪些特定的过去交互导致了偏差,也无法告诉你警报是因为该节点自身行为异常,还是因为整个群体的行为发生了整体偏移。
一组研究人员现在通过一个名为 X-SAD 的新框架填补了这一空白。他们并没有构建一个新的检测器,而是构建了一种能够观察现有检测器内部并理解其推理逻辑的方法。他们的工作揭示了系统的决策过程可以分为两个截然不同的部分。第一部分是识别导致警报的具体历史事件。想象一位保安不仅拉响了警报,还指出了人群中究竟是哪三个人引起了动作触发。研究人员创建了一种方法,学习如何高亮显示这些关键的历史交互,有效地创建了一个掩码,展示哪些连接最为重要。至关重要的是,他们在实现这一目标时并未降低系统的速度,也没有改变其检测威胁的能力。检测器的准确度与之前一样,但现在它附带了一个清晰、即时的逻辑解释。
他们的第二个发现更为深刻,因为它完全不依赖于学习或猜测。由于 SAD 检测器是通过将节点与过去行为的一个特定、经过计算的平均值进行比较来工作的,研究人员发现他们可以通过数学手段将警报拆分为两个组成部分:节点自身的行为和它所属群体的行为。这就像是弄清楚一名学生成绩不及格是因为自己没学习,还是因为整个班级的考试难度突然变大了。在对在线课程交互的真实数据集进行测试时,他们发现警报几乎完美地平分成了两半。大约有一半的时间,警报是由个体节点行为异常驱动的;另一半时间,警报则是由于整个群体的基准行为发生了偏移。这种区分是其他任何系统都无法提供的,它改变了人类分析师应对警报的方式。如果问题出在群体,解决方案可能是更新系统的预期;如果问题出在个体,解决方案则可能是封禁该个体。
为了确保他们的新型解释工具是可靠的,研究人员进行了严格的测试,并将其与其他方法进行了对比。他们发现,他们这种学习共享模式以同时解释多个警报的方法,比试图从零开始解决每个警报的方法要优越得多。这种共享方法不仅更准确,而且速度快了数百倍,生成一个解释所需的时间不到十分之一毫秒。这种速度意味着解释可以在发出警报的瞬间即时提供,而不是留待后续的取证分析。他们还发现,一些衡量解释质量的常用方法实际上具有误导性。标准方法经常会对那些正确识别了“洗清嫌疑”证据的解释进行惩罚,仅仅因为这些证据降低了怀疑分数,就将其视为糟糕的解释。研究人员通过开发一种新的忠实度(fidelity)测量方法纠正了这一点,这种方法尊重异常检测的独特本质,即证明清白与证明有罪同样重要。
这项研究还揭示了用于该检测器的原始软件代码中的一些隐藏缺陷,团队在进行最终实验前修复了这些问题。其中一个缺陷意味着检测器的某个关键特性在测试期间实际上是被关闭了,这本会扭曲结果。通过修补这些问题,他们确保了所报告的数据真实反映了系统的实际能力。他们的最终结论是,当一个检测器是基于一个清晰的参考点(如正常行为的记忆库)构建时,就可以通过数学手段提取其决策的精确原因,而无需任何猜测。这种方法为人工智能的透明度树立了新标准,证明了复杂的实时系统可以既高度准确又完全可理解。其结果是一个不仅会大声喊出“危险”,还能静默且精准地讲述危险背后故事的系统,从而让人们在这个永不停歇的世界中做出更好、更快的决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。