AI foundation model choice and false positive variation in Anti Money Laundering transaction screening
Deze studie toont aan dat het selecteren van verschillende grote taalmodellen voor de screening van transacties ter bestrijding van witwassen leidt tot drastische variaties in het aantal fout-positieven en de operationele werklast, waarmee de keuze van het model wordt vastgesteld als een kritieke operationele risicoparameter die expliciete governance en monitoring vereist.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk jaar bewegen enorme sommen geld zich door het wereldwijde financiële systeem, waarvan een deel bedoeld is om de herkomst van illegale winsten te verbergen. Om dit te stoppen, zijn banken en andere financiële instellingen verplicht om de transacties van hun klanten nauwlettend in de gaten te houden, op zoek naar patronen die duiden op witwassen. Decennialang hebben zij computergestuurde systemen gebruikt om dit initiële toezicht uit te voeren. Deze systemen fungeren als een zeef die alles wat zelfs maar enigszins verdacht lijkt opvangt en markeert voor een menselijke onderzoeker om te beoordelen. Het probleem is dat deze zeven vaak te grofmazig zijn. Ze vangen een enorme hoeveelheid onschuldige activiteiten op samen met de echte dreigingen, wat een berg valse alarmen creëert. Dit dwingt analisten om urenlang onschuldige mensen te onderzoeken, wat middelen verspilt en onnodige stress veroorzaakt bij klanten.
Onlangs is een nieuw type computervorm van intelligentie het gesprek van de dag geworden. Dit zijn grote taalmodellen, krachtige instrumenten die getraind zijn op enorme hoeveelheden tekst en die complexe situaties kunnen begrijpen en redeneren zonder dat ze voor elk scenario specifieke regels geleerd hoeven te krijgen. Omdat ze transactiegeschiedenissen kunnen lezen en het verhaal achter de cijfers kunnen begrijpen, hoopten veel experts dat zij het probleem van de valse alarmen zouden kunnen oplossen. Het idee was dat deze modellen slimmer zouden kunnen zijn dan de oude regelgebaseerde systemen, door met grotere nauwkeurigheid onderscheid te maken tussen een legitieme zakelijke betaling en een verdachte overboeking. Er bleef echter een cruciale vraag onbeantwoord: als een bank een van deze nieuwe modellen verkiest boven een ander, doet dat er dan eigenlijk toe? Of zijn ze allemaal slechts verschillende versies van hetzelfde hulpmiddel, uitwisselbaar en voorspelbaar?
Een team van onafhankelijke onderzoekers zette zich in om het antwoord te vinden door de keuze van het model niet te beschouwen als een eenvoudige softwarebeslissing, maar als een fundamenteel risico voor de bedrijfsvoering van de bank. Zij verzamelden vijf verschillende, commercieel beschikbare grote taalmodellen van twee grote technologieleveranciers. Ze trainden deze modellen niet op bankgegevens en pasten hun instellingen niet aan; in plaats daarvan vroegen ze elk model om te fungeren als een verse, 'zero-shot' screener, wat betekent dat ze een oordeel moesten vellen op basis van louter hun bestaande kennis. Om een eerlijke test te garanderen, creëerden de onderzoekers een gecontroleerde set van zeshonderd synthetische transactiegevallen. Driehonderd van deze gevallen waren ontworpen om exact te lijken op bekende witwaspraktijken, terwijl de andere driehonderd perfect legitieme transacties waren die zo waren vervaardigd dat ze verdacht genoeg leken om een minder zorgvuldig systeem te misleiden. Dit waren de "harde negatieven", de onschuldige transacties die vaak per ongeluk worden gemarkeerd.
De onderzoekers voerden vervolgens elk van deze zeshonderd gevallen aan alle vijf de modellen voor, waarbij ze elk model vroegen te beslissen of de transactie verdacht was of niet. De resultaten waren verbijsterend. Wanneer de modellen naar de driehonderd legitieme transacties keken, varieerde hun gedrag enorm. Eén model markeerde slechts een fractie van hen als verdacht, terwijl een ander de overgrote meerderheid als verdacht aangaf. Sterker nog, het verschil in hoe vaak ze valse alarmen gaven tussen de beste en de slechtste presteerders was enorm. Voor dezelfde set onschuldige transacties maakte het ene model minder dan één fout per honderd keer, terwijl het andere model in meer dan acht van de tien gevallen een fout maakte. De modellen waren het niet alleen oneens over een paar lastige gevallen; ze waren het bijna negentig procent van de gevallen oneens over de legitieme transacties. Of een specifieke onschuldige klant werd gemarkeerd voor onderzoek, hing bijna volledig af van welk specifiek computermodel de screening uitvoerde.
De studie onthulde ook een duidelijk patroon binnen de families van modellen die door elk bedrijf werden aangeboden. In beide gevallen waren de kleinere, goedkopere modellen veel agressiever en markeerden zij onschuldige activiteiten op een veel hogere frequentie dan hun krachtigere, duurdere tegenhangers. De onderzoekers ontdekten dat deze modellen niet simpelweg beter of slechter waren in dezelfde taak, maar dat ze opereerden op volledig verschillende punten op het spectrum van voorzichtigheid. Het ene model was zo gretig om criminelen te vangen dat het bijna iedereen beschuldigde, terwijl een ander zo voorzichtig was dat het enkele verdachte activiteiten liet passeren om onschuldige mensen niet te lastig te vallen. Deze afweging betekende dat het kiezen van een model niet alleen een technische keuze was; het was een keuze over hoeveel valse alarmen het personeel van de bank elke dag zou moeten afhandelen.
Om te begrijpen wat dit betekende voor een echte bank, stelden de onderzoekers zich een scenario voor waarin een instelling een miljoen transacties per dag verwerkt, waarbij een zeer klein percentage daadwerkelijk verdacht is. Onder deze omstandigheden vertaalde het verschil in modelkeuze zich in een massaal verschil in werklast. Het meest voorzichtige model zou een beheersbaar aantal meldingen genereren voor onderzoekers om te beoordelen. Het meest agressieve model zou echter een wachtrij van meldingen generen die bijna tweehonderd keer groter is. In dit scenario zou het meest agressieve model een vloedgolf aan valse alarmen produceren, waarbij bijna elke melding een fout zou blijken te zijn, waardoor de weinige echte dreigingen volledig zouden worden overstemd. Dit toonde aan dat de keuze van het model de dagelijkse realiteit van het compliance-team fundamenteel kon veranderen, van een staat van gerichte investigatie naar een staat van overweldigende ruis.
De onderzoekers controleerden ook of deze modellen op dezelfde manier zouden falen, een zorg die bekendstaat als algoritmische monocultuur, waarbij iedereen op hetzelfde hulpmiddel vertrouwt en dus dezelfde fouten maakt. Ze kwamen tot de conclusie dat dit niet het geval was. De modellen misten niet dezelfde verdachte transacties; in plaats daarvan misten ze verschillende. Het echte gevaar was niet dat ze allemaal zouden instemmen om een crimineel door te laten, maar dat ze het allemaal oneens zouden zijn over wie onschuldig was. Deze divergentie betekende dat twee banken die verschillende modellen gebruiken, een compleet andere visie kunnen hebben op de activiteiten van dezelfde klant. De ene bank kan een normaal zakelijk patroon zien, terwijl de andere een misdaad ziet.
De studie concludeerde dat het behandelen van deze grote taalmodellen als uitwisselbare componenten een gevaarlijke fout is. In tegen tegenstelling tot traditionele software, waarbij de code vaststaat en door de gebruiker wordt gecontroleerd, kunnen deze commerciële modellen door de leverancier worden bijgewerkt, vervangen of gewijzigd zonder dat de bank hiervan directe kennis heeft. Een model dat vandaag goed werkt, kan morgen worden vervangen door een andere versie die volkomen anders reageert, waardoor de gehele operatie van de bank verschuift van een staat van hoge precisie naar een staat van chaos, zonder dat de eigen systemen van de bank zijn veranderd. De onderzoekers pleitten ervoor dat banken de specifieke identiteit van het model moeten beschouwen als een cruciaal onderdeel van hun risicobeheer. Ze moeten precies weten welke versie ze gebruiken, hoe deze zich regelmatig gedraagt, en begrijpen dat het wijzigen van het model een belangrijke gebeurtenis is die hun vermogen om criminaliteit te bestrijden zonder hun klanten te lastig te vallen, drastisch kan veranderen. De keuze van het model is niet slechts een inkoopdetail; het is de instelling die bepaalt hoe het systeem de wereld ziet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.