← 最新论文
🤖 machine learning

Inductive inference of gradient-boosted decision trees on graphs for insurance fraud detection

本文介绍了 G-GBM,这是一种新颖的归纳式图梯度提升机,它有效结合了梯度提升的鲁棒性与可解释的异构图特征,在保险欺诈检测中达到或超越了最先进方法的性能,同时解决了类别不平衡和动态数据等挑战。

原作者: Félix Vandervorst, Bruno Deprez, Wouter Verbeke, Tim Verdonck

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Félix Vandervorst, Bruno Deprez, Wouter Verbeke, Tim Verdonck

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名保险侦探,试图揪出一伙伪造车祸或就医记录以骗取钱财的人。

旧方法:孤立地审视个人
传统上,侦探们孤立地审查每个人(或公司)。他们会核对一份事实清单:“他们多大年纪?开什么车?提出过多少次索赔?”这就像试图仅通过查看一名嫌疑人的身份证来解开谜团。这种方法尚可奏效,但会忽略大局。欺诈者往往结成团伙,互相协助。如果你只盯着一个人,可能会忽略他们与已知罪犯之间的关联。

新构想:“社交网络”图谱
本文作者意识到,要揪出有组织的欺诈,必须看清其中的关联。他们构建了一张巨大的图谱(即“图”),其中:

  • 节点代表个人和公司。
  • 连线代表关系(例如,“公司 A 拥有这辆车”、“个人 B 居住在此地址”、“个人 C 是 D 公司的董事”)。

这张图谱杂乱且复杂。它包含不同类型的个人和不同类型的关系,并且随着新人的加入或离开而随时间变化。

当前“智能”图谱的缺陷
最近,计算机科学家开始利用花哨的“深度学习”(人工智能)来解读这些图谱。可以将这些 AI 模型想象成一个黑盒,它接收整张图谱,将其压缩成单一、模糊的摘要,然后猜测谁是欺诈者。

  • 缺陷: 这些黑盒难以理解。在保险领域,你不能仅仅说“电脑说他们有罪”。你需要向监管机构和法庭解释为什么。此外,当图谱非常庞大,或者与诚实人群相比欺诈案例极少时(即所谓的“类别不平衡”问题),这些 AI 模型有时会感到困惑。

解决方案:G-GBM(“路径阅读”侦探)
作者开发了一种名为G-GBM的新工具。它不像将图谱压缩成模糊摘要那样,而是像一名侦探,在图谱中沿着特定路径行走。

以下是其工作原理,使用一个简单的类比:

  1. “元路径”行走: 想象你正在调查特定的人(让我们称他为“鲍勃”)。G-GBM 不仅仅查看鲍勃。它会派出小“行走者”来追踪从鲍勃出发的特定路线。

    • 路径 1: 鲍勃 \rightarrow 他的车 \rightarrow 车主(也许是鲍勃的兄弟)。
    • 路径 2: 鲍勃 \rightarrow 修理厂 \rightarrow 店主(也许是鲍勃的表亲)。
    • 路径 3: 鲍勃 \rightarrow 地址 \rightarrow 邻居(该邻居也提交了一份可疑的索赔)。
  2. 解读线索: G-GBM 不会将这些路径转化为模糊的摘要,而是记录下每条路径上发现的具体细节。“鲍勃的兄弟拥有一辆车”、“修理厂店主是鲍勃的表亲”。它将这些细节分开并保持清晰。

  3. “树”决策: 它将这些具体的路径细节输入到一个强大的决策引擎(称为梯度提升树)中。该引擎以擅长在杂乱数据中发现模式以及处理欺诈罕见这一事实而闻名。它会问:“如果我看到这种特定的邻居和连接组合,这个人是否可能是欺诈者?”

  4. “为什么”(可解释性): 这是其超能力所在。由于模型没有模糊数据,它可以指出触发警报的确切路径。

    • 示例: “我们标记鲍勃并非因为他的年龄,而是因为路径 2显示他与一家修理厂店主有关联,而该店主有 50 起其他可疑索赔。”
    • 这为保险公司提供了清晰的“审计轨迹”以证明其决定,这是法律所要求的。

论文发现
作者在两个真实场景中测试了这一新侦探工具:

  1. 比利时保险数据集: 一个关于公司及其董事的巨大、真实世界图谱。
  2. 医疗欺诈数据集: 一个关于医生和患者的图谱。

结果:

  • 性能更优或相当: G-GBM 在侦测欺诈方面的表现与花哨的“黑盒”AI 模型及传统方法一样好,甚至更好。
  • 速度: 其训练速度比复杂的 AI 模型快得多。
  • 透明度: 它提供了清晰的决策理由,而 AI 模型难以做到这一点。
  • 鲁棒性: 它比 AI 模型更能处理数据的“杂乱”特性(如缺失信息或奇怪的类别)。

总结
本文介绍了一种结合两个世界优势的方法:既具备 AI 在社交网络中洞察复杂关联的能力,又拥有传统决策树的清晰度和速度。它不仅仅说“这是欺诈”;它说“这是欺诈,因为这些特定的关联”,使其成为打击保险诈骗的实用且可信的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →