Rethinking Feature Alignment in Generalist Graph Anomaly Detection: A Relational Fingerprint-based Approach
本文提出了 ReFi-GAD,这是一种通用的图异常检测方法,它通过利用一种通用的、语义感知的关系指纹来从上下文和结构两个视角编码异常线索,从而克服了现有特征对齐方法的语义局限性,进而在未见过的图上实现了更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名保安,正试图在人群中识别出一个小偷。过去,你可能接受过专门针对图书馆(人们安静且戴着眼镜)或体育场(人们喧闹且穿着球衣)中小偷的识别训练。如果你试图用“图书馆小偷”的训练经验去体育场里抓小偷,你很可能会失败,因为服装、噪音和行为模式完全不同。
这就是当前计算机系统在图(连接数据的网络)中寻找“异常”(怪异或有害的节点)时所面临的问题。这些系统通常只在一种特定类型的网络上进行训练,当被要求查看完全不同的网络时,它们就会陷入困境。它们试图通过将数据压缩(就像用一把通用尺子去测量羽毛和砖块)来强行让数据看起来一致,但这却丢失了数据背后的重要含义。
本文介绍了一种名为REFI-GAD的新系统,它通过改变如何看待数据来解决这一问题。以下是具体解析:
1. 问题:试图拿苹果和橙子做比较
现有方法试图通过简单地匹配特征数量(维度)来对齐不同的网络。
- 本文的类比:想象一下,试图将Cora数据集(看起来像是一份来自研究论文的巨大关键词列表)与YelpChi数据集(看起来像是一份简短的星级评分和评论统计数据列表)进行比较。
- 失败之处:现有方法使用一种数学技巧(如主成分分析 PCA)强行将这两个截然不同的列表塞进同样大小的盒子里。但仅仅因为它们能放进同一个盒子,并不意味着它们代表相同的含义。这就像强行将“辣度”评分和“颜色”评分放入同一列;计算机会感到困惑,系统在面对新数据时,识别异常的能力实际上会变差。这被称为“负迁移”。
2. 解决方案:“关系指纹”(REFI)
作者提出,不要关注原始数据(具体的单词或数字),而是说:“让我们停止关注节点是什么,转而关注它相对于邻居如何表现。”
他们创建了一种关系指纹(REFI)。你可以将其想象成一张通用的身份证,描述了一个人的社交行为,无论他是在图书馆还是在体育场。这个指纹包含五个具体的“维度”(或线索):
- 位置一致性:这个人是否远离他的朋友?(异常节点可能是孤立的)。
- 方向一致性:这个人说话的方向或话题是否与他的朋友不同?(异常节点可能在说些奇怪的话)。
- 全局方向:这个人是否从整个人群中脱颖而出,而不仅仅是他的直接朋友?
- 度(人气):这个人是否连接了过多的人(垃圾发送者)或过少的人(幽灵)?
- 聚类(小团体性):他的朋友之间是否彼此都是朋友?(异常节点可能处于一个与整体格格不入的奇怪、紧密的小团体中)。
魔法技巧:系统将这五条线索转化为排名。它不再说“这个节点有 500 个连接”,而是说“这个节点处于连接数的前 1%"。这使得指纹具有通用性。在一个小网络中“前 1%"的节点,与在一个巨大网络中“前 1%"的节点,含义是相同的。
3. 侦探:模型
一旦系统拥有了这些通用指纹,它就会使用一个聪明的侦探模型(基于 Transformer,即先进 AI 聊天机器人背后的相同技术)来找出坏分子。
- “共享”大脑:该模型学习关于所有网络中“可疑行为”外观的通用规则。
- “细化”步骤:当模型查看新网络时,它会利用少量示例(“支持集”)来微调其关注点。它会问:“在这个特定的人群中,这五条线索中哪一条最重要?”
- 类比:如果你在图书馆寻找小偷,你会关注“安静程度”;如果你在体育场寻找,你会关注“移动情况”。该模型会自动调整其关注点。
4. 结果
作者在14 个不同的真实世界网络(从社交媒体到学术引用,再到电子商务)上测试了这种方法。
- 结果:他们的方法(REFI-GAD)显著优于所有之前的“通用”方法。
- 关键胜利:与其他方法在迁移到新数据时往往变差(负迁移)不同,REFI-GAD 始终变好。它成功地将知识从一种类型的图迁移到另一种类型,而无需重新训练。
总结
本文认为,要在任何网络中找出怪异节点,我们不应试图强行让原始数据看起来一致。相反,我们应该将每个节点转化为一个通用行为指纹(它如何与邻居相关联),然后使用一个智能、可适应的模型来识别异常值。这使得该系统能够成为一个“万能”侦探,适用于它遇到的任何图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。