想象你是一名保险侦探,试图揪出一伙伪造车祸或就医记录以骗取钱财的人。
旧方法:孤立地审视个人
传统上,侦探们孤立地审查每个人(或公司)。他们会核对一份事实清单:“他们多大年纪?开什么车?提出过多少次索赔?”这就像试图仅通过查看一名嫌疑人的身份证来解开谜团。这种方法尚可奏效,但会忽略大局。欺诈者往往结成团伙,互相协助。如果你只盯着一个人,可能会忽略他们与已知罪犯之间的关联。
新构想:“社交网络”图谱
本文作者意识到,要揪出有组织的欺诈,必须看清其中的关联。他们构建了一张巨大的图谱(即“图”),其中:
- 节点代表个人和公司。
- 连线代表关系(例如,“公司 A 拥有这辆车”、“个人 B 居住在此地址”、“个人 C 是 D 公司的董事”)。
这张图谱杂乱且复杂。它包含不同类型的个人和不同类型的关系,并且随着新人的加入或离开而随时间变化。
当前“智能”图谱的缺陷
最近,计算机科学家开始利用花哨的“深度学习”(人工智能)来解读这些图谱。可以将这些 AI 模型想象成一个黑盒,它接收整张图谱,将其压缩成单一、模糊的摘要,然后猜测谁是欺诈者。
- 缺陷: 这些黑盒难以理解。在保险领域,你不能仅仅说“电脑说他们有罪”。你需要向监管机构和法庭解释为什么。此外,当图谱非常庞大,或者与诚实人群相比欺诈案例极少时(即所谓的“类别不平衡”问题),这些 AI 模型有时会感到困惑。
解决方案:G-GBM(“路径阅读”侦探)
作者开发了一种名为G-GBM的新工具。它不像将图谱压缩成模糊摘要那样,而是像一名侦探,在图谱中沿着特定路径行走。
以下是其工作原理,使用一个简单的类比:
“元路径”行走: 想象你正在调查特定的人(让我们称他为“鲍勃”)。G-GBM 不仅仅查看鲍勃。它会派出小“行走者”来追踪从鲍勃出发的特定路线。
- 路径 1: 鲍勃 → 他的车 → 车主(也许是鲍勃的兄弟)。
- 路径 2: 鲍勃 → 修理厂 → 店主(也许是鲍勃的表亲)。
- 路径 3: 鲍勃 → 地址 → 邻居(该邻居也提交了一份可疑的索赔)。
解读线索: G-GBM 不会将这些路径转化为模糊的摘要,而是记录下每条路径上发现的具体细节。“鲍勃的兄弟拥有一辆车”、“修理厂店主是鲍勃的表亲”。它将这些细节分开并保持清晰。
“树”决策: 它将这些具体的路径细节输入到一个强大的决策引擎(称为梯度提升树)中。该引擎以擅长在杂乱数据中发现模式以及处理欺诈罕见这一事实而闻名。它会问:“如果我看到这种特定的邻居和连接组合,这个人是否可能是欺诈者?”
“为什么”(可解释性): 这是其超能力所在。由于模型没有模糊数据,它可以指出触发警报的确切路径。
- 示例: “我们标记鲍勃并非因为他的年龄,而是因为路径 2显示他与一家修理厂店主有关联,而该店主有 50 起其他可疑索赔。”
- 这为保险公司提供了清晰的“审计轨迹”以证明其决定,这是法律所要求的。
论文发现
作者在两个真实场景中测试了这一新侦探工具:
- 比利时保险数据集: 一个关于公司及其董事的巨大、真实世界图谱。
- 医疗欺诈数据集: 一个关于医生和患者的图谱。
结果:
- 性能更优或相当: G-GBM 在侦测欺诈方面的表现与花哨的“黑盒”AI 模型及传统方法一样好,甚至更好。
- 速度: 其训练速度比复杂的 AI 模型快得多。
- 透明度: 它提供了清晰的决策理由,而 AI 模型难以做到这一点。
- 鲁棒性: 它比 AI 模型更能处理数据的“杂乱”特性(如缺失信息或奇怪的类别)。
总结
本文介绍了一种结合两个世界优势的方法:既具备 AI 在社交网络中洞察复杂关联的能力,又拥有传统决策树的清晰度和速度。它不仅仅说“这是欺诈”;它说“这是欺诈,因为这些特定的关联”,使其成为打击保险诈骗的实用且可信的工具。
技术摘要:基于图的梯度提升决策树归纳推理在保险欺诈检测中的应用
问题陈述
保险欺诈检测面临一系列独特的挑战,使得传统机器学习方法并非最优。首先,欺诈往往涉及有组织的网络,其中个人和实体相互协作,因此需要建模复杂关系,而非将索赔视为独立同分布(i.i.d.)事件。其次,保险数据本质上具有异构性(涉及公司、管理员和保单等不同类型的节点)和动态性(随时间演变)。第三,欺诈数据集存在极端的类别不平衡问题,即确认的欺诈案例相对于合法索赔而言非常罕见。
尽管图神经网络(GNN)已成为建模关系数据的有力工具,但在此领域它们面临重大障碍:
- 归纳局限性:许多嵌入方法(如 node2vec)是直推式的,当图结构演变或新节点出现时,难以更新预测。
- 特征处理:GNN 在处理保险数据中常见的高基数分类特征(如汽车品牌、法律形式)时往往力不从心,因为通过平均操作聚合这些特征通常毫无意义。
- 过度平滑:深层 GNN 可能遭受过度平滑的影响,随着消息传递层数的增加,节点表示变得难以区分。
- 可解释性:保险行业的监管要求需要透明的审计轨迹。GNN 通常产生不透明的嵌入,掩盖了驱动欺诈预测的具体证据(节点/边)。
因此,基于表格数据的梯度提升树(GBM)方法因其对类别不平衡和分类特征的鲁棒性而仍占主导地位,但它们缺乏原生整合图结构的能力。
方法论:G-GBM
作者提出了G-GBM(图 - 梯度提升机),这是一种新颖的归纳框架,将梯度提升决策树扩展至异构、动态图。该方法在不牺牲可解释性的前提下,弥合了 GBM 的预测能力与图的关联建模之间的差距。
核心机制
G-GBM 通过将图结构转换为节点局部邻域(自网)内的一组显式、特征化的路径来运行,然后将这些路径输入标准的梯度提升算法(具体为 LightGBM)。
- 元路径采样:对于目标节点 v,算法在其 n 跳自网内采样长度为固定 n 的简单路径。这些路径遵循特定的元路径(节点和边类型的序列)。
- 特征拼接:G-GBM 不像 GNN 那样将邻居特征聚合为单个向量,而是将采样路径上遇到的原始节点和边特征进行拼接。这保留了高基数分类数据的粒度。
- 概率加权学习:每条路径根据随机游走者遍历该路径的概率被分配一个权重。这些权重在决策树训练期间用作案例权重。
- 加权基尼不纯度:树的构建利用加权基尼不纯度标准。不纯度计算纳入了路径概率,确保概率较高的路径对分裂决策的贡献更为显著。
- 归纳预测:节点的最终欺诈概率是训练于每条元路径上的树的预测值的加权和。这使得模型能够泛化到新节点和演变的图结构,而无需重新训练整个嵌入空间。
可解释性
由于该模型依赖于显式的特征拼接而非不透明的嵌入,因此它完全兼容 SHAP(Shapley 加性解释)值。这使得调查人员能够将欺诈预测追溯至图中的特定节点、边和特征,满足监管审计要求。
主要贡献
本文概述了四项主要贡献:
- 理论方面:G-GBM 为异构图上的监督学习提供了一个归纳框架。作者认为,它对其表格对应物(LightGBM)提供了形式化的帕累托优势保证,因为包含图结构只能提高或保持性能,绝不会降低性能。
- 方法学方面:该方法通过概率加权的元路径特征化和自适应的基尼不纯度,在随机游走路径语义与梯度提升之间引入了一个理论基础坚实的桥梁。这解决了将基于树的机器学习应用于异构、动态图这一开放问题。
- 实证方面:在真实的保险欺诈数据上,G-GBM 实现了强大的预测性能,同时保留了 GBM 的实用优势(处理分类特征、缺失数据和类别不平衡),并提供路径级别的 SHAP 审计轨迹。
- 可复现性:作者在 GitHub 上发布了完整实现,并在 Kaggle 上发布了一个匿名的真实世界比利时保险欺诈图,为社区提供了一个罕见的专有级基准。
实验结果
作者在两个数据集上评估了 G-GBM:一个专有的比利时保险数据集(涉及公司和管理员)和一个开源的医疗保健提供者(HCP)欺诈数据集。
专有保险数据集
- 性能:G-GBM 的表现优于表格 LightGBM 基线以及多种归纳 HGNN 基线(HinSAGE、HAN、HGT)。
- 对于公司节点,G-GBM 实现了 0.77 的 AUC-PR,超过了 LightGBM(0.75)和 HinSAGE(0.76)。
- 对于管理员节点,由于头节点特征稀疏,改进更为显著。G-GBM 实现了 0.46 的 AUC-PR,显著优于 LightGBM(0.38)和所有 GNN 基线。
- 可解释性:SHAP 分析显示,对于管理员,二度邻域的特征高度显著,这是基线 GBM 无法捕捉到的信号。
- 效率:G-GBM 比纯表格 LightGBM 慢,但比 HGNN 基线训练快得多(例如,对于公司节点,HinSAGE 耗时约 4300 秒,而 G-GBM 仅需约 28 秒)。
医疗保健提供者(HCP)数据集
- 性能:在该数据集中,由于头节点特征具有高度预测性,G-GBM 的表现与 LightGBM 和 HGT 相当(AUC-ROC 约为 0.94)。
- 观察:邻域特征的添加并未比表格基线显著提升性能,表明对于该特定数据集,欺诈信号已被内在节点特征所捕捉。然而,G-GBM 保持了有竞争力的性能,且未出现某些 GNN 中观察到的过度平滑问题。
- 计算成本:由于 HCP 图的平均度数较高,增加了可能的元路径数量,G-GBM 的训练时间高于保险数据集。
意义与主张
本文将 G-GBM 定位为保险行业的一种务实且强大的解决方案,在平衡高预测精度需求与对可解释性的严格监管要求之间取得了平衡。
- 监管合规:与产生“黑盒”嵌入的 GNN 不同,G-GBM 提供了清晰的审计轨迹。调查人员可以确切地看到哪些相邻实体和具体特征(例如共享地址或特定的法律形式)贡献了欺诈分数。
- 对数据特征的鲁棒性:通过利用梯度提升的优势,该方法自然地处理了保险数据中典型的高基数分类变量和类别不平衡,而这些因素往往会降低 GNN 的性能。
- 归纳能力:该方法专为动态环境设计,其中新节点和边不断添加,避免了直推式方法所需的全量重新嵌入。
作者总结道,尽管 G-GBM 在高连通图中因维度扩展而面临计算挑战,但它成功避免了深层 GNN 的过度平滑陷阱,并为保险欺诈检测提供了检测能力、可解释性和训练效率之间的更优权衡。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。