← Ultimi articoli
💻 computer science

AI foundation model choice and false positive variation in Anti Money Laundering transaction screening

Questo studio dimostra che la selezione di diversi modelli linguistici di grandi dimensioni per lo screening delle transazioni anti-riciclaggio porta a variazioni drastiche nei tassi di falsi positivi e nei carichi di lavoro operativi, stabilendo la scelta del modello come un parametro di rischio operativo critico che richiede una governance e un monitoraggio espliciti.

Autori originali: Samir Chincholikar, Robin Chawla

Pubblicato 2026-09-17
📖 6 min di lettura🧠 Approfondimento

Autori originali: Samir Chincholikar, Robin Chawla

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Ogni anno, enormi somme di denaro transitano attraverso il sistema finanziario globale, parte delle quali destinata a nascondere le origini di profitti illegali. Per fermare questo fenomeno, le banche e altre istituzioni finanziarie sono tenute a monitorare attentamente le transazioni dei loro clienti, cercando schemi che suggeriscano il riciclaggio di denaro. Per decenni, hanno fatto affidamento su sistemi informatici per svolgere questo primo controllo. Questi sistemi agiscono come un setaccio, catturando tutto ciò che appare anche solo leggermente sospetto e segnalandolo a un investigatore umano per una revisione. Il problema è che questi setacci sono spesso troppo grossolani. Catturano una quantità enorme di attività innocue insieme alle vere minacce, creando una montagna di falsi allarmi. Ciò costringe gli analisti a passare ore a indagare su persone innocenti, sprecando risorse e causando stress non necessario ai clienti.

Recentemente, un nuovo tipo di intelligenza artificiale è entrato nella conversazione. Si tratta di modelli linguistici di grandi dimensioni, potenti strumenti addestrati su enormi quantità di testo che possono comprendere e ragionare su situazioni complesse senza la necessità di essere istruiti su regole specifiche per ogni scenario. Poiché possono leggere gli storici delle transazioni e comprendere la storia dietro i numeri, molti esperti speravano che potessero risolvere il problema dei falsi allarmi. L'idea era che questi modelli potessero essere più intelligenti dei vecchi sistemi basati su regole, distinguendo tra un pagamento commerciale legittimo e un trasferimento sospetto con maggiore accuratezza. Tuttavia, rimaneva una domanda critica senza risposta: se una banca sceglie uno di questi nuovi modelli rispetto a un altro, conta davvero? O sono tutti solo versioni diverse dello stesso strumento, intercambiabili e prevedibili?

Un team di ricercatori indipendenti ha cercato di trovare la risposta trattando la scelta del modello non come una semplice decisione software, ma come un rischio fondamentale per le operazioni della banca. Hanno raccolto cinque diversi modelli linguistici di grandi dimensioni, disponibili commercialmente, da due grandi fornitori tecnologici. Non hanno addestrato questi modelli su dati bancari né ne hanno modificato le impostazioni; al contrario, hanno chiesto a ciascuno di agire come uno screener "zero-shot" puro, il che significa che dovevano prendere una decisione basandosi esclusivamente sulle proprie conoscenze pregresse. Per garantire un test equo, i ricercatori hanno creato un set controllato di seicento casi di transazioni sintetiche. Trecento di questi casi sono stati progettati per assomigliare esattamente a schemi noti di riciclaggio di denaro, mentre gli altri trecento erano transazioni perfettamente legittime, create per apparire abbastanza sospette da ingannare un sistema meno attento. Questi erano i "falsi negativi difficili", le transazioni innocenti che spesso vengono segnalate per errore.

I ricercatori hanno poi sottoposto ciascuno di questi seicento casi a tutti i cinque modelli, chiedendo a ciascuno di decidere se la transazione fosse sospetta o meno. I risultati sono stati sorprendenti. Quando i modelli hanno esaminato le trecento transazioni legittime, il loro comportamento è variato enormemente. Un modello ha segnalato solo una minima frazione di esse come sospetta, mentre un altro ne ha segnalate la stratta maggioranza. Infatti, la differenza nel modo in cui hanno generato falsi allarmi tra le migliori e le peggiori prestazioni è stata enorme. Per lo stesso set di transazioni innocenti, un modello ha commesso un errore meno di una volta su cento, mentre un altro ha commesso un errore più di otto volte su dieci. I modelli non erano solo in disaccordo su alcuni casi complicati; erano in disaccordo su quasi il novanta percento delle transazioni legittime. Il fatto che un cliente specifico innocente venisse segnalato per un'indagine dipendeva quasi interamente da quale specifico modello informatico stesse effettuando lo screening.

Lo studio ha anche rivelato un modello chiaro all'interno delle famiglie di modelli fornite da ciascuna azienda. In entrambi i casi, i modelli più piccoli e meno costosi erano molto più aggressivi, segnalando l'attività innocua a un tasso molto più elevato rispetto ai loro omologhi più potenti e costosi. I ricercatori hanno scoperto che questi modelli non erano semplicemente migliori o peggiori nello stesso compito; operavano a punti completamente diversi dello spettro della cautela. Un modello era così desideroso di catturare i criminali da accusare quasi tutti, mentre un altro era così cauto da lasciare sfuggire alcune attività sospette per evitare di disturbare le persone innocenti. Questo compromesso significava che scegliere un modello non era solo una scelta tecnica; era una scelta su quanti falsi allarmi il personale della banca avrebbe dovuto gestire ogni giorno.

Per capire cosa significasse questo per una banca reale, i ricercatori hanno immaginato uno scenario in cui un'istituzione elabora un milione di transazioni al giorno, con una percentuale molto piccola di esse effettivamente sospette. In queste condizioni, la differenza nella scelta del modello si traduceva in una differenza massiccia nel carico di lavoro. Il modello più cauto generava un numero gestibile di avvisi da sottoporre alla revisione degli investigatori. Il modello più aggressivo, tuttavia, generava una coda di avvisi quasi duecento volte più grande. In questo scenario, il modello più aggressivo produceva un'ondata di falsi allarmi, dove quasi ogni singolo avviso si rivelava un errore, sommergendo le poche minacce reali. Ciò ha dimostrato che la scelta del modello può alterare fondamentalmente la realtà quotidiana del team di conformità, spostandoli da uno stato di indagine focalizzata a uno stato di rumore travolgente.

I ricercatori hanno anche verificato se questi modelli fallirebbero nello stesso modo, una preoccupazione nota come monocultura algoritmica, in cui tutti si affidano allo stesso strumento e quindi commettono gli stessi errori. Hanno scoperto che non era così. I modelli non sbagliavano le stesse transazioni sospette; invece, sbagliavano quelle diverse. Il vero pericolo non era che tutti concordassero nel lasciar passare un criminale, ma che tutti dissentissero su chi fosse innocente. Questa divergenza significava che due banche che utilizzavano modelli diversi potevano avere visioni completamente diverse dell'attività dello stesso cliente. Una banca poteva vedere un normale schema commerciale, mentre l'altra vedeva un crimine.

Lo studio ha concluso che trattare questi modelli linguistici di grandi dimensioni come componenti intercambiabili è un errore pericoloso. A differenza del software tradizionale, dove il codice è fisso e controllato dall'utente, questi modelli commerciali possono essere aggiornati, sostituiti o modificati dal fornitore senza la diretta conoscenza della banca. Un modello che funziona bene oggi potrebbe essere sostituito domani con una versione diversa che si comporta in modo completamente differente, spostando l'intera operazione della banca da uno stato di alta precisione a uno stato di caos senza alcun cambiamento nei sistemi della banca stessa. I ricercatori hanno sostenuto che le banche devono trattare l'identità specifica del modello come una parte critica della gestione del rischio. Devono sapere esattamente quale versione stanno utilizzando, monitorare regolarmente il suo comportamento e comprendere che cambiare il modello è un evento importante che potrebbe alterare drasticamente la loro capacità di catturare il crimine senza molestare i propri clienti. La scelta del modello non è solo un dettaglio di approvvigionamento; è l'impostazione stessa che determina come il sistema vede il mondo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →