← Nieuwste papers
💻 computer science

Rule-to-Data Knowledge Transfer via Optimal Transport for Weakly Supervised Anomaly Detection on Transaction Graphs

Dit artikel stelt een zwak gesuperviseerd framework voor anomaliedetectie in transactiegrafieken voor dat gebruikmaakt van optimale transport om hiërarchische regelsemantiek, afgeleid van beslissingsbomen, uit te lijnen met continue transactie-representaties, waardoor hoogwaardige pseudo-labels worden gegenereerd en de bestaande baselines op benchmark-datasets worden overtroffen.

Oorspronkelijke auteurs: Qiuyang Zhang, Keyang Chen, Mingxuan Jiang, Yuan Shui, Yandan Tan, Zhixin Li, Hongbin Zhu, Hongfeng Chai

Gepubliceerd 2026-06-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qiuyang Zhang, Keyang Chen, Mingxuan Jiang, Yuan Shui, Yandan Tan, Zhixin Li, Hongbin Zhu, Hongfeng Chai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Slechteriken vinden in een zee van Goediken

Stel je voor dat je een bankdirecteur bent die witwaspraktijken probeert te stoppen. Je hebt een enorme grootboek met miljoens transacties. De meeste zijn normaal (de goede jongens), maar een piepklein fractie is illegaal (de slechte jongens).

Het probleem is dat je geen lijst hebt van wie de slechteriken zijn. Om hen te vinden, heb je meestal dure menselijke experts nodig om onderzoek te doen en ze te labelen. Omdat je het je niet kunt veroorloven om elke transactie te controleren, heb je heel weinig "bevestigde slechteriken" om van te leren.

Om dit op te lossen, gebruiken banken regels (zoals "Als een transactie boven de $10.000 is en om 3 uur 's nachts plaatsvindt, markeer deze dan"). Maar deze regels zijn rommelig. Ze worden vaak geschreven als eenvoudige "Als-Dan"-statements, en ze komen niet altijd overeen met de complexe, continue patronen van echte wereldgegevens. Als je deze regels blindelings vertrouwt om nieuwe transacties te labelen, krijg je misschien veel valse alarmen of mis je de echte criminelen.

De Oplossing: Een "Vertaler" tussen Regels en Data

De auteurs stellen een nieuw systeem voor dat fungeert als een vertaler en een coach. Ze noemen het "Rule-to-Data Knowledge Transfer".

Beschouw dit als een proces in drie fasen om een computer te leren hoe hij fraude kan opsporen zonder een volledige lijst van bekende criminelen nodig te hebben.

Fase 1: Het bouwen van twee verschillende "Geesten"

Het systeem creëert twee verschillende manieren om naar de data te kijken:

  1. De Regel-Geest (De Detective):
    • Stel je een detective voor die alleen het officiële regelboek kent. Hij kijkt naar een transactie en vraagt: "Past dit binnen de 'Als-Dan'-logica?"
    • In plaats van alleen "Ja/Nee" te zeggen, bouwt deze detective een Regel-Graaf. Denk aan dit als een stamboom van regels. Hij begrijpt dat "Hoog Bedrag" en "Late Nacht" gerelateerde voorwaarden zijn die vaak samen voorkomen. Hij gebruikt een speciaal neuraal netwerk (een GNN) om te begrijpen hoe deze regels met elkaar verbonden zijn, waardoor de "hiërarchie" van de logica behouden blijft.
  2. De Data-Geest (De Waarnemer):
    • Stel je een andere waarnemer voor die het regelboek negeert en gewoon naar de ruwe cijfers en patronen van de transacties kijştir. Deze waarnemer gebruikt een standaard AI (een MLP) om te leren wat een "normale" transactie is op basis van de data zelf.

Fase 2: De "Optimal Transport" Matchmaker

Nu hebben we twee geesten die verschillende talen spreken. De Regel-Geest spreekt in "logische bomen", en de Data-Geest spreekt in "getallen". Ze begrijpen elkaar niet.

Het papier introduceert Optimal Transport (OT) als een Matchmaker.

  • Stel je voor dat je een stapel "Regel-Clusters" hebt (groepen vergelijkbare regels) en een stapel "Transactie-Clusters" (groepen vergelijkbare data).
  • De taak van de Matchmaker is om uit te zoeken welke Regel-Cluster het beste bij welke Transactie-Cluster past met de minste hoeveelheid "inspanning" (of kosten).
  • Het plakt niet zomaar een label op een transactie. In plaats daarvan creëert het een zachte verbinding. Het zegt: "Deze transactie lijkt voor 80% op de 'Hoog Risico'-regelgroep en voor 20% op de 'Veilig'-regelgroep." Dit stelt het systeem in staat om pseudo-labels (onderbouwde gissingen) te genereren voor de niet-gelabelde transacties zonder te rigide te zijn.

Fase 3: De "Contrastieve" Coach

Zelfs met een matchmaker kunnen de gissingen nog steeds een beetje ruisachtig of onzeker zijn. Daarom voegt het systeem een Coach toe met behulp van Contrastive Learning.

  • Stel je een fitnesscoach voor. Als twee transacties beide gematcht zijn aan dezelfde "Hoog Risico"-regelgroep, roept de coach: "Jullie zijn vergelijkbaar! Ga dichter bij elkaar staan!"
  • Als de een gematcht is aan "Hoog Risico" en de ander aan "Veilig", roept de coach: "Jullie zijn verschillend! Ga ver uit elkaar staan!"
  • Dit proces verfijnt de gissingen. Het trekt de "waarschijnlijke fraude"-transacties dichter bij de regelgebaseerde definitie van fraude en duwt de "waarschijnlijke veilige" transacties er juist vanaf. Dit ruimt de ruis op en maakt de uiteindelijke beslissing scherper.

Waarom dit beter werkt

De auteurs hebben dit getest op vier verschillende soorten netwerken: Bitcoin-transacties, bankoverschrijvingen, sociale media-berichten en online winkelen.

  • De Oude Manier: Gebruikte de regels simpelweg als harde labels (Goed/Slecht) of keek alleen naar de data. Dit faalde vaak omdat regels te rigide zijn en data te rommelig.
  • De Nieuwe Manier: Door de structuur van de regels (de "Regel-Graaf") te behouden en de Matchmaker (OT) te gebruiken om ze voorzichtig af te stemmen op de data, leerde het systeem fraude veel beter te detecteren.

De Resultaten

Het paper beweert dat hun methode bijna elke andere bestaande methode (inclusief standaard AI-modellen en andere "weakly supervised" methoden) versloeg tijdens deze tests.

  • Het vond meer werkelijke gevallen van fraude (hogere recall).
  • Het maakte minder fouten bij het markeren van onschuldige mensen (hogere precisie).
  • Het werkte goed, zelfs wanneer de data zeer ongebalanceerd was (waarbij 99% van de transacties veilig is en slechts 1% slecht).

Samenvatting

Kortom, dit paper bouwt een systeem dat niet alleen blindelings regels volgt of blindelings de data vertrouwt. In plaats daarvan:

  1. Respecteert het de structuur van expertregels (zoals de logische boom van een detective).
  2. Vertaalt die regels naar de taal van data met behulp van een wiskundige "Matchmaker" (Optimal Transport).
  3. Traint het systeem om gelijke zaken bij elkaar te houden en verschillende zaken van elkaar te scheiden (Contrastive Learning).

Dit stelt banken in staat om witwaspraktijken effectiever te vangen, zelfs wanneer ze geen perfecte lijst hebben van wie ze precies zoeken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →