← 最新论文
🤖 machine learning

RAD: Rule-Augmented Relational Anomaly Detection

本文提出了 RAD,一种规则增强的关联异常检测框架,该框架将异构图表示学习与源自随机森林路径的精炼符号规则相结合,以在保留关系结构并结合行为证据的同时,有效地识别多表数据库中的异常,并在一个涵盖网络安全和电子商务数据集的新基准测试中展示了优于现有基准方法的卓越性能。

原作者: Noah Dahle, Anne Tumlin, Ngoc Tran, Xenofon Koutsoukos, Tyler Derr

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Noah Dahle, Anne Tumlin, Ngoc Tran, Xenofon Koutsoukos, Tyler Derr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代组织庞大且轰鸣的服务器中,数据并非以整齐、单一的列形式存在。它存在于一个复杂的连接网络中,用户、机器、交易和登录尝试都像蔓延的网络中的节点一样相互关联。几十年来,计算机科学家一直试图在这堆草中寻找那根针:即那个预示着安全漏洞、欺诈企图或客户即将流失的罕见且可疑的事件。寻找这些“针”的传统方法是将整个网络“压平”成一个长长的数字列表,通过剥离连接性来使数据更容易处理。但这种方法往往会丢弃那些让事件变得可疑的关键线索。一次登录本身可能看起来完全正常,但如果将其置于特定机器、特定时间以及用户近期历史的背景下观察,就会变得极具危险性。寻找这些隐藏模式的方法,需要一种既能尊重数据结构,又能理解定义危险的具体规则化行为的方法。

范德堡大学的一个研究小组开发了一种名为 RAD 的新系统,旨在解决这个确切的问题。RAD 不再通过压平数据来丢失其形状,而是将数据库视为一张活生生的关系地图,就像一张城市地图,其中每栋建筑都是一个人,每条道路都是他们之间的连接。该系统的创新之处在于它结合了两种不同的思维方式:人工智能从网络模式中学习的能力,以及描述特定不良行为的人类定义的规则的清晰度。研究人员发现,通过在 AI 开始分析网络之前,将这些清晰、逻辑性的规则直接喂给 AI 的学习过程,系统在识别其他方法会错过的罕见、危险事件方面,表现得显著更好。

为了理解为什么这很重要,请考虑识别网络攻击的挑战。在典型的数据库中,单次登录尝试只是一个数据行。但在现实中,这次登录是一个故事的一部分。如果一个用户在从未使用的电脑上、在通常不工作的时刻、从一个与其历史记录不符的地点进行登录,那么这一行数据就变成了一个警告信号。传统的工具经常会错过这一点,因为它们孤立地观察这一行数据。研究人员在三种截然不同的数据类型上测试了他们的新系统:来自大型组织的庞大网络安全日志、来自在线零售商的客户评论数据库,以及来自一家大型服装品牌的购物交易数据库。在每种情况下,目标都是相同的:将最可疑的事件排在列表的最顶端,以便人类分析师能够快速找到它们。

RAD 系统按照精心编排的序列运行。首先,它获取复杂的、多表结构的数据库,并构建一个详细的连接图谱,保留每个用户、机器和事件的独特身份。然后,它创建一个简化的、临时的视图来搜寻特定的规则。利用一种标准的机器学习技术,它扫描数据以寻找通常会导致问题的逻辑条件,例如“在十分钟内登录了四台以上机器的用户”或“在长期活动后停止评论产品的客户”。这些不是模糊的猜测;它们是直接从数据本身推导出的具体、可解释的规则。

这正是该系统与旧方法分道扬镳的地方。RAD 不仅仅是在最后的结果检查中使用这些规则,而是将它们直接注入到 AI 开始深度分析之前的网络图谱核心。想象一下,网络图谱是一群人正在互相传递纸条以了解他们的处境。在之前的系统中,规则就像是在群体已经做出决定后才传达的最后一条纸条。而在 RAD 中,规则是在一开始就交给这些人的,从而塑造了他们倾听彼此的方式以及他们理解自身位置的方式。这使得系统能够学习到一种已经意识到特定危险行为的数据表示。

这种方法的测试结果令人瞩目。在与现有方法对比测试时,RAD 始终优于那些仅依赖压平数据或使用缺乏这些特定规则之网络图谱的系统。这种改进在网络安全领域最为显著,系统能够比以前更准确地识别可疑的登录事件。在零售环境中,它成功标记了那些很可能意外停止使用服务的客户,这是一项极具挑战性的任务,因为他们的行为在最后时刻之前往往看起来都很正常。研究人员发现,该系统将最危险事件排在顶部的能力得到了显著提升,这至关重要,因为在现实世界的安全和商业领域,分析师无法审查每一个警报;他们只有时间查看前几个。

研究还揭示了关于这些系统运作方式的一些重要细微差别。研究人员测试了尝试重建整个网络图谱(本质上是要求 AI 预测应该存在哪些连接)是否有助于系统发现异常情况。他们发现,这并不总是有效;在某些情况下,试图重建图谱实际上会分散系统执行其主要任务(寻找坏人)的注意力。同样,他们测试了使用先进的语言模型来精炼规则是否会产生影响。他们发现,虽然这些模型有助于清理和组织规则,但核心力量来自于规则本身的初始发现,而非精炼步骤。这表明,最有效的策略是发现清晰、简单的行为模式,并将它们直接输入网络分析,而不是依赖于事后的复杂调整。

最终,这项工作证明,在复杂数据中寻找异常情况的最佳方法是尊重数据的结构,同时明确地教导系统去寻找什么。通过将网络分析的深度学习能力与符号规则的精确性相结合,RAD 提供了一种看待我们数字生活中隐藏危险的新方式。它表明,当我们不再将数据视为一串扁平的数字列表,而是将其视为一个相互连接的故事时,我们就能找到那些一直存在、只待被理解的威胁。研究人员已将其代码和数据开放供他人使用,希望这种方法能帮助各地的组织在危机发生前更好地识别出那些意想不到的情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →