FinFraudBench: A Heterogeneous Graph Benchmark for Financial Fraud Detection
本文介绍了 FinFraudBench,这是一个新的异构图基准测试,其特点是包含两个具有多实体类型和有向边的大规模、现实主义金融数据集,旨在解决现有基准测试在捕捉现实世界金融欺诈检测中的复杂性、类别不平衡和标签稀缺性方面的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代金融那庞大且无形的网络中,每一次刷卡或转账都会留下数字足迹。几十年来,专家们一直试图通过逐一观察这些足迹来捕捉欺诈者,将每笔交易视为孤立的事件。他们会检查金额、时间和地点,希望能发现不符合常规模式的迹象。但欺诈很少是孤立的行为;它是一个由连接构成的网络。一张被盗的信用卡会被特定的人、在特定的商店、以特定的方式使用,而这种方式往往将其与其他可疑活动联系起来。为了理解全局,研究人员意识到他们需要停止观察单个记录,转而开始绘制人物、卡片、商户及相关场所之间的关系图谱。这种从检查单个项目到理解其如何连接的转变,是基于图谱检测(graph-based detection)的基础——这种方法不将金融数据视为电子表格,而是将其视为一张复杂的交互图谱。
一组研究人员现在构建了一个更真实的地图来测试这些检测方法,填补了研究欺诈方式中的一个关键空白。他们创建了一个名为 FinFraudBench 的基准测试,该基准由两个基于真实世界交易记录构建的海量数据集组成。与以往将金融世界简化为单一类型节点或单一关系类型的工具不同,这些新数据集保留了金融领域混乱且多层级的现实情况。它们包含近 900 万个代表不同实体的节点(如客户、卡片、商户、类别和地点),以及近 9000 万条有向连接。研究人员精心组织这些数据,以模拟现实世界中困难的条件:即在合法交易面前,欺诈行为极其罕见,且只有极小比例的案例被标记为已知欺诈。
研究人员利用这一新基准测试了各种现有的检测模型,从简单的统计工具到旨在读取图谱的高级人工智能系统。他们发现,那些忽略不同实体类型并将一切同等对待的方法,其效果明显较差。最成功的模型是那些能够区分客户、卡片和商户,并理解每种角色在网络中扮演不同功能的模型。具体而言,专门用于处理异质图(heterogeneous graphs,即尊重不同节点类型及其特定连接方式的图)的模型,其表现始终优于那些较简单的对应模型。这些先进模型在对风险交易进行排序以及在数据高度失衡(这是真实银行系统中常见且困难的情景)的情况下识别欺诈方面,表现得更为出色。
这项研究表明,捕捉金融欺诈的关键在于保留数据的丰富且带类型的结构,而非将其扁平化。当研究人员强行将复杂的多实体数据转化为更简单的格式时,他们丢失了有助于识别不良行为者的关键信号。结果表明,最有前景的路径是构建能够同时处理不同类型的金融实体及其独特关系的系统。虽然一些旨在识别特定欺诈模式的专门模型仍具有竞争力,但它们通常无法在整体性能上匹配那些充分拥抱异质图复杂性的模型。这项工作为科学界评估未来的工具提供了一种标准化方式,确保新方法是在现实的金融生态系统,而非过度简化的版本之上进行测试。
研究人员利用公开的交易记录构建了这些数据集,将数据行转换为以交易为中心点、并与涉及的实体相连的网络。他们通过严格划分训练集、验证集和测试集,确保没有信息从未来泄露到过去(这是欺诈检测中的一个常见陷阱)。最终的数据集包含一个包含超过 180 万笔交易的数据集和一个包含近 900 万笔交易的数据集,其中欺诈率低至 0.15%,反映了现实生活中欺诈发生的极端稀缺性。通过在这一领域测试广泛的算法,该团队得以证明,导航不同类型连接的能力不仅是理论上的优势,更是有效进行欺诈检测的实际必要条件。研究结果指向了一个未来:金融安全系统的构建将基于对定义数字经济的多元关系的更深层次理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。