AI foundation model choice and false positive variation in Anti Money Laundering transaction screening
Diese Studie zeigt, dass die Auswahl unterschiedlicher großer Sprachmodelle für das Screening von Geldwäschetransaktionen zu drastischen Variationen in den Falsch-Positiv-Raten und dem operativen Arbeitsaufwand führt, wodurch die Modellwahl als kritischer operativer Risikoparameter etabliert wird, der eine explizite Governance und Überwachung erfordert.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Jedes Jahr bewegen sich enorme Summen durch das globale Finanzsystem, wovon ein Teil dazu bestimmt ist, die Herkunft illegaler Gewinne zu verschleiern. Um dies zu verhindern, sind Banken und andere Finanzinstitute verpflichtet, die Transaktionen ihrer Kunden genau zu überwachen und nach Mustern zu suchen, die auf Geldwäsche hindeuten könnten. Seit Jahrzehnten verlassen sie sich zur ersten Überwachung auf Computersysteme. Diese Systeme fungieren wie ein Sieb, das alles auffängt, was auch nur geringfügig verdächtig erscheint, und es für einen menschlichen Ermittler zur Überprüfung markiert. Das Problem besteht darin, dass diese Siebe oft zu grobmaschig sind. Sie fangen eine enorme Menge harmloser Aktivitäten zusammen mit den echten Bedrohungen ein, was einen Berg von Fehlalarmen erzeugt. Dies zwingt Analysten dazu, stundenlang unschuldige Menschen zu untersuchen, was Ressourcen verschwendet und bei Kunden unnötigen Stress verursacht.
Kürzlich ist eine neue Art von künstlicher Intelligenz in das Gespräch eingetreten. Dies sind große Sprachmodelle, leistungsstarke Werkzeuge, die auf riesigen Textmengen trainiert wurden und in der Lage sind, komplexe Situationen zu verstehen und zu begründen, ohne dass ihnen für jedes Szenario spezifische Regeln beigebracht werden müssen. Da sie Transaktionsverläufe lesen und die Geschichte hinter den Zahlen verstehen können, hofften viele Experten, dass sie das Problem der Fehlalarme lösen könnten. Die Idee war, dass diese Modelle klüger als die alten regelbasierten Systeme sein könnten und zwischen einer legitimen Geschäftszahlung und einer verdächtigen Überweisung mit größerer Genauigkeit unterscheiden könnten. Eine kritische Frage blieb jedoch unbeantwortet: Wenn sich eine Bank für eines dieser neuen Modelle gegenüber einem anderen entscheidet, spielt das tatsächlich eine Rolle? Oder sind sie alle nur verschiedene Versionen desselbe Werkzeugs, austauschbar und vorhersehbar?
Ein Team unabhängiger Forscher setzte sich zum Ziel, die Antwort zu finden, indem es die Wahl des Modells nicht als einfache Softwareentscheidung, sondern als grundlegendes Risiko für den Betrieb der Bank betrachtete. Sie sammelten fünf verschiedene, kommerziell verfügbare große Sprachmodelle von zwei großen Technologieanbietern. Sie trainierten diese Modelle nicht mit Bankdaten und passten ihre Einstellungen nicht an; stattdessen baten sie jedes Modell, als frischer „Zero-Shot“-Prüfer zu agieren, was bedeutet, dass es eine Entscheidung allein auf der Grundlage seines bestehenden Wissens treffen musste. Um einen fairen Test zu gewährleisten, erstellten die Forscher einen kontrollierten Satz von sechshundert synthetischen Transaktionsfällen. Dreihundert dieser Fälle wurden exakt so gestaltet, dass sie bekannten Geldwäschemodellen entsprachen, während die anderen dreihundert perfekt legitime Transaktionen waren, die so gestaltet wurden, dass sie verdächtig genug erschienen, um ein weniger vorsichtiges System zu täuschen. Dies waren die „harten Negativfälle“ – die unschuldigen Transaktionen, die oft fälschlicherweise gemeldet werden.
Die Forscher speisten dann jeden dieser sechshundert Fälle in alle fünf Modelle ein und baten jedes Modell zu entscheiden, ob die Transaktion verdächtig sei oder nicht. Die Ergebnisse waren verblüffend. Als die Modelle die dreihundert legitimen Transaktionen betrachteten, variierte ihr Verhalten drastisch. Ein Modell markierte nur einen winzigen Bruchteil dieser als verdächtig, während ein anderes die überwältigende Mehrheit als verdächtig einstufte. Tatsächlich war der Unterschied darin, wie oft sie Fehlalarme auslösten, zwischen dem besten und dem schlechtesten Akteur enorm. Für dieselbe Menge an unschuldigen Transaktionen machte ein Modell weniger als einmal unter hundert Fehlern einen Fehler, während ein anderes öfter als acht von zehn Mal einen Fehler machte. Die Modelle waren sich nicht nur bei ein paar kniffligen Fällen uneinig; sie waren sich bei fast neunzig Prozent der legitimen Transaktionen uneinig. Ob ein spezifischer unschuldiger Kunde zur Untersuchung markiert wurde, hing fast ausschließlich davon ab, welches spezifische Computermodell die Prüfung durchführte.
Die Studie zeigte auch ein klares Muster innerhalb der Modellfamilien der jeweiligen Unternehmen auf. In beiden Fällen waren die kleineren, kostengünstigeren Modelle weitaus aggressiver und markierten unschuldige Aktivitäten mit einer viel höheren Rate als ihre leistungsfähigeren, teureren Gegenstücke. Die Forscher fanden heraus, dass diese Modelle nicht einfach nur besser oder schlechter bei derselben Aufgabe waren, sondern dass sie an völlig unterschiedlichen Punkten des Spektrums der Vorsicht operierten. Ein Modell war so bestrebt, Kriminelle zu fassen, dass es fast jeden beschuldigte, während ein anderes so vorsichtig war, dass es einige verdächtige Aktivitäten durchgehen ließ, um unschuldige Menschen nicht zu belästigen. Dieser Kompromiss bedeutete, dass die Wahl eines Modells nicht nur eine technische Entscheidung war, sondern eine Entscheidung darüber, wie viele Fehlalarme das Personal der Bank jeden Tag bewältigen müsste.
Um zu verstehen, was dies für eine reale Bank bedeutete, stellten sich die Forscher ein Szenario vor, in dem ein Institut pro Tag eine Million Transaktionen verarbeitet, wobei ein sehr kleiner Prozentsatz tatsächlich verdächtig ist. Unter diesen Bedingungen übersetzte sich der Unterschied in der Modellwahl in einen massiven Unterschied im Arbeitsaufwand. Das vorsichtigste Modell würde eine handhabbare Anzahl von Alarmen erzeugen, die von Ermittlern überprüft werden müssen. Das aggressivste Modell hingegen würde eine Warteschlange von Alarmen erzeugen, die fast zweihundertmal größer ist. In diesem Szenario würde das aggressivste Modell eine Flut von Fehlalarmen produzieren, bei denen fast jeder einzelne Alarm ein Irrtum wäre, was die wenigen echten Bedrohungen förmlich untergehen ließe. Dies zeigte, dass die Wahl des Modells die tägliche Realität des Compliance-Teams grundlegend verändern kann – von einem Zustand fokussierter Ermittlung hin zu einem Zustand überwältigenden Rauschens.
Die Forscher prüften auch, ob diese Modelle auf die gleiche Weise scheitern würden, ein Problem, das als „algorithmische Monokultur“ bekannt ist – wenn alle dasselbe Werkzeug nutzen und somit dieselben Fehler machen. Sie fanden heraus, dass dies nicht der Fall war. Die Modelle übersahen nicht dieselben verdächtigen Transaktionen, sondern unterschiedliche. Die wahre Gefahr bestand nicht darin, dass sie alle gemeinsam einem Kriminellen die Flucht ermöglichten, sondern dass sie alle uneinig darüber waren, wer unschuldig ist. Diese Divergenz bedeutete, dass zwei Banken, die unterschiedliche Modelle verwenden, völlig unterschiedliche Ansichten über die Aktivitäten desselben Kunden haben könnten. Eine Bank könnte ein normales Geschäftsmuster sehen, während die andere ein Verbrechen sieht.
Die Studie kam zu dem Schluss, dass es ein gefährlicher Fehler ist, diese großen Sprachmodelle als austauschbare Komponenten zu betrachten. Im Gegensatz zu herkömmlicher Software, bei der der Code fixiert und vom Benutzer kontrolliert wird, können diese kommerziellen Modelle von den Anbietern aktualisiert, ersetzt oder geändert werden, ohne dass die Bank dies direkt erfährt. Ein Modell, das heute gut funktioniert, könnte morgen durch eine andere Version ersetzt werden, die sich völlig anders verhält und die gesamte Operation der Bank von einem Zustand hoher Präzision in einen Zustand des Chaos versetzt, ohne dass sich an den eigenen Systemen der Bank etwas geändert hat. Die Forscher argumentierten, dass Banken die spezifische Identität des Modells als kritischen Teil ihres Risikomanagements behandeln müssen. Sie müssen genau wissen, welche Version sie verwenden, ihr Verhalten regelmäßig überwachen und verstehen, dass der Wechsel des Modells ein bedeutendes Ereignis ist, das ihre Fähigkeit, Verbrechen zu erfassen, ohne ihre Kunden zu belästigen, drastisch verändern kann. Die Wahl des Modells ist nicht nur ein Beschaffungsdetail; sie ist die Einstellung, die bestimmt, wie das System die Welt sieht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.