Inductive inference of gradient-boosted decision trees on graphs for insurance fraud detection
Dieser Beitrag stellt G-GBM vor, eine neuartige induktive Graph-Gradient-Boosting-Maschine, die die Robustheit von Gradient Boosting mit interpretierbaren heterogenen Graphmerkmalen effektiv kombiniert, um bei der Erkennung von Versicherungsbetrug bestehende State-of-the-Art-Methoden zu übertreffen oder mit ihnen gleichzuziehen, während gleichzeitig Herausforderungen wie Klassenungleichgewicht und dynamische Daten adressiert werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Versicherungsdetektiv, der versucht, eine Gruppe von Personen zu entlarven, die Autounfälle oder Arztbesuche fälschen, um Geld zu stehlen.
Der alte Weg: Der Blick auf Einzelpersonen
Traditionell untersuchten Detektive jede Person (oder jedes Unternehmen) isoliert. Sie prüften eine Liste von Fakten: „Wie alt sind sie? Welches Auto fahren sie? Haben sie viele Schadensfälle gemeldet?" Das ist vergleichbar mit dem Versuch, ein Rätsel zu lösen, indem man nur den Ausweis eines Verdächtigen betrachtet. Das funktioniert einigermaßen, verpasst aber das große Ganze. Betrüger arbeiten oft in Zirkeln und helfen einander. Wenn Sie nur eine Person betrachten, könnten Sie übersehen, dass sie mit einem bekannten Kriminellen verbunden ist.
Die neue Idee: Die „Sozialnetzwerk"-Karte
Die Autoren dieses Papers erkannten, dass man zur Aufdeckung organisierten Betrugs die Verbindungen sehen muss. Sie erstellten eine riesige Karte (ein „Graph"), bei der:
- Knoten die Personen und Unternehmen sind.
- Linien die Beziehungen darstellen (z. B. „Unternehmen A besitzt dieses Auto", „Person B wohnt an dieser Adresse", „Person C ist Geschäftsführer von Unternehmen D").
Diese Karte ist unübersichtlich und komplex. Sie enthält verschiedene Arten von Personen und verschiedene Arten von Verbindungen. Zudem verändert sie sich im Laufe der Zeit, wenn neue Personen hinzukommen oder gehen.
Das Problem mit aktuellen „intelligenten" Karten
In jüngster Zeit begannen Informatiker, ausgefeiltes „Deep Learning" (KI) einzusetzen, um diese Karten zu lesen. Stellen Sie sich diese KI-Modelle als eine Blackbox vor, die die gesamte Karte aufnimmt, sie zu einer einzigen, verschwommenen Zusammenfassung quetscht und dann vermutet, wer ein Betrüger ist.
- Der Fehler: Diese Blackboxen sind schwer zu verstehen. In der Versicherungswelt kann man nicht einfach sagen: „Der Computer sagt, sie sind schuldig." Man muss Regulierungsbehörden und Gerichten erklären, warum. Außerdem geraten diese KI-Modelle manchmal in Verwirrung, wenn die Karte riesig ist oder wenn es im Vergleich zu ehrlichen Menschen nur sehr wenige Betrugsfälle gibt (ein Problem, das als „Klassenungleichgewicht" bezeichnet wird).
Die Lösung: G-GBM (Der „Pfad-lesende" Detektiv)
Die Autoren entwickelten ein neues Werkzeug namens G-GBM. Anstatt die Karte zu einer verschwommenen Zusammenfassung zu quetschen, agiert G-GBM wie ein Detektiv, der spezifische Pfade durch die Karte entlanggeht.
So funktioniert es, anhand einer einfachen Analogie:
Der „Metapfad"-Spaziergang: Stellen Sie sich vor, Sie untersuchen eine bestimmte Person (nennen wir ihn „Bob"). G-GBM betrachtet nicht nur Bob. Es schickt kleine „Spaziergänger" aus, um spezifische Routen von Bob aus zu verfolgen.
- Pfad 1: Bob Sein Auto Der Besitzer des Autos (vielleicht Bobs Bruder).
- Pfad 2: Bob Die Werkstatt Der Werkstattbesitzer (vielleicht Bobs Cousin).
- Pfad 3: Bob Die Adresse Der Nachbar (der ebenfalls einen verdächtigen Schaden gemeldet hat).
Das Lesen der Hinweise: Anstatt diese Pfade in eine verschwommene Zusammenfassung zu verwandeln, notiert G-GBM die spezifischen Details, die entlang jedes Pfades gefunden wurden. „Bobs Bruder besitzt ein Auto", „Der Werkstattbesitzer ist Bobs Cousin". Es hält diese Details getrennt und klar.
Die „Baum"-Entscheidung: Es speist diese spezifischen Pfaddetails in eine leistungsstarke Entscheidungsengine ein (einen sogenannten Gradient Boosted Tree). Diese Engine ist bekannt dafür, Muster in unübersichtlichen Daten hervorragend zu erkennen und damit umzugehen, dass Betrug selten ist. Sie fragt: „Wenn ich diese spezifische Kombination aus Nachbarn und Verbindungen sehe, ist diese Person wahrscheinlich ein Betrüger?"
Das „Warum" (Erklärbarkeit): Dies ist die Superkraft. Da das Modell die Daten nicht verwischt hat, kann es genau den Pfad benennen, der den Alarm ausgelöst hat.
- Beispiel: „Wir haben Bob nicht wegen seines Alters gemeldet, sondern weil Pfad 2 zeigte, dass er mit einem Werkstattbesitzer verbunden ist, der 50 weitere verdächtige Schäden hat."
- Dies verschafft dem Versicherungsunternehmen einen klaren „Audit-Trail", um seine Entscheidung nachzuweisen, was gesetzlich vorgeschrieben ist.
Was das Paper herausfand
Die Autoren testeten dieses neue Detektivwerkzeug in zwei realen Szenarien:
- Ein belgisches Versicherungsdatenset: Eine massive, reale Karte von Unternehmen und ihren Geschäftsführern.
- Ein Gesundheitsbetrugs-Datenset: Eine Karte von Ärzten und Patienten.
Die Ergebnisse:
- Bessere oder gleichwertige Leistung: G-GBM fischte Betrug genauso gut oder besser als die ausgefeilten „Blackbox"-KI-Modelle und die traditionellen Methoden.
- Geschwindigkeit: Es war viel schneller zu trainieren als die komplexen KI-Modelle.
- Transparenz: Es lieferte klare Gründe für seine Entscheidungen, was die KI-Modelle nicht so leicht konnten.
- Robustheit: Es bewältigte die „unordentliche" Natur der Daten (wie fehlende Informationen oder seltsame Kategorien) besser als die KI-Modelle.
Zusammenfassung
Das Paper stellt eine Methode vor, die das Beste aus zwei Welten kombiniert: die Fähigkeit der KI, komplexe Verbindungen in einem Sozialnetzwerk zu erkennen, und die Klarheit und Geschwindigkeit traditioneller Entscheidungsbäume. Es sagt nicht nur „Das ist Betrug"; es sagt „Das ist Betrug wegen dieser spezifischen Verbindungen", was es zu einem praktischen, vertrauenswürdigen Werkzeug im Kampf gegen Versicherungsbetrug macht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.