Deep Learning for Anomaly Detection in Dynamic Graphs: A Verified Taxonomy, Survey, and Unified Benchmark
本文建立了一个经过验证的动态图深度学习异常检测分类法和统一基准,揭示了简单的基于度数的启发式算法在合成基准测试上往往优于复杂的深度模型,但在真实世界数据上却表现不佳,并暴露了当前评估实践和已发表实现方案中的关键缺陷。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个连接的网络,就像是一个庞大在线社区中谁在与谁交谈的地图,或者是在数字货币平台上谁在与谁进行交易的地图。在现实世界中,这些地图永远不是静止的;它们随着每一秒钟的流逝而呼吸、移动和演变。科学家们称这些活生生的地图为“动态图”。他们面临的挑战是捕捉这些持续运动中发生的异常现象:陌生人之间突然爆发的消息量、可疑的交易激增,或是连接两个平时从不互动的群体的链路。这些都是异常情况,快速发现它们对于抓捕欺诈、阻止网络攻击或理解信息如何传播至关重要。多年来,研究人员一直试图教会计算机观察这些移动的地图并标记出异样,通常使用被称为深度学习的强大人工智能系统。
然而,来自阿尔及利亚和法国的一个研究小组最近发现,该领域已经陷入了自身的复杂性之中。他们发现不同的科学家在使用不同的规则来定义什么是“动态图”,这导致了一系列混乱的方法论,使得这些方法无法真正进行比较。一些研究声称解决了移动网络的问题,但实际上只是在观察静态快照或简单的列表数据。另一些研究报告了令人印象深刻的成功率,但由于它们是在不同的数据集和不同的制造虚假问题的方式上测试其系统,没有人能判断出一种方法是否真的更好。这就像是试图比较在不同赛道、不同天气以及不同“获胜”定义下测试出的汽车速度一样。
为了澄清这种混乱,研究人员首先为该领域划定了一个严格的界限。他们创建了一个简单的清单,用以决定哪些计算机程序真正属于“移动网络异常检测”这一类别。一种方法必须是一个深度学习系统,它必须是在寻找异常行为而非仅仅预测下一步动作,并且必须被喂入随时间变化的流式数据。当他们将这些规则应用于现有文献时,发现许多著名的模型其实并不属于这一组。有些是为不发生变化的固定网络设计的,而另一些则是为变量间关系通过学习而非观察来建立的时间序列数据而构建的。通过剔除这些不合格者,他们创建了一个经过验证的、干净的二十四个真实方法目录,并根据它们处理网络形状和追踪时间的方式进行了分类。
在拥有了清晰的方法列表后,该团队做了该领域前所未有的尝试:他们在完全相同的条件下测试了所有方法。他们将其中十三个深度学习系统,连同一些较简单的非深度学习基准模型,甚至一组不需要训练的、基于基本经验法则的检查方法放在一起进行测试。他们向所有模型输入相同的数据,使用相同的训练集和测试集划分方式,并注入了相同类型的虚假异常,以观察每个系统发现异常的能力。结果令人惊讶,并揭示了该领域衡量成功方式的一个缺陷。
在注入了虚假异常的标准测试数据上,一个非常简单、陈旧的经验法则表现得惊人地好。这个规则仅仅观察每个人有多少个连接;它会将连接到连接数极少的人的边标记为可疑。这种基础的启发式方法不需要学习,仅需几毫秒即可运行,其成功得分达到了 0.811。这个分数高于那十三个复杂的深度学习系统中的九个。事实上,最先进的深度学习模型经常被这个简单的规则超越。研究人员意识到,这些测试的设置方式无意中泄露了答案。制造虚假异常的方法使得它们在特征上与正常流量有显著差异:这些虚假链路连接的是那些连接数很少的人,而这些网络中的真实交互通常发生在拥有许多连接的人之间。这个简单的规则仅仅是在识别这种统计学上的差异,而不是在检测复杂的异常。
真正的考验出现在研究人员转向真实世界数据时,具体使用的是比特币交易平台上的信任与不信任记录。在这里,异常不再是虚假的;它们是用户给彼此差评的真实实例。当同样的简单规则应用于这些真实数据时,它彻底失败了,表现甚至不如随机猜测。然而,深度学习系统却展现出了不同的景象。那些旨在处理连续数据流、能够随每一个新事件更新知识的系统脱颖而出。而那些依赖于以固定间隔对网络进行快照处理的系统——此前在虚假数据上表现领先——则跌落到了随机水平。
这种反转证明了这些系统的标准测试方式具有误导性。在虚假数据上的高分并非智能的体现,而是模型学会了利用测试设置中的一个漏洞。研究人员发现,通常用于排名这些方法的头条数字实际上掩盖了许多方法在处理列表顶端最重要的异常时表现糟糕的事实。一个系统可以拥有很高的整体得分,却可能完全错过最关键的警报。此外,团队审计了这些方法作者发布的实际代码,发现许多代码包含严重的错误,例如在训练数据上进行测试,或者计算了错误类型事件的得分,这些都夸大了他们报告的结果。
该研究得出结论,该领域需要改变评估进步的方式。研究人员不应依赖于一个容易被测试设置操纵的单一数字,而应该报告他们的系统相对于简单、未经训练的规则的表现,以及它们处理真实数据的能力。他们还应该关注系统是否能捕捉到最紧急的异常,而不只是平均水平的异常。这项工作表明,深度学习在该领域的真正价值不在于其本身的复杂性,而在于它学习特定网络结构并持续追踪其演化的能力,而不是在于它能在有缺陷的测试中获得高分。通过清理目录并修复测量工具,研究人员希望为未来的工作提供一个坚实的基础,从而在这样一个网络始终处于变动中的世界中真正解决问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。