Machine learning reduces audit detection risk in 3.3 million public sector general ledger transactions
Questo studio dimostra che un nuovo framework di machine learning a quattro livelli, validato rispetto a 3,3 milioni di transazioni reali del settore pubblico e rapporti di audit ufficiali, supera significativamente il tradizionale Monetary Unit Sampling riducendo il rischio di rilevamento dell'audit da oltre il 38% al 2,01% e tagliando i tempi di elaborazione del 98,7%.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate di essere un detective che cerca di trovare una singola moneta falsa nascosta in un enorme sacco di 3,3 milioni di monete vere. Nel mondo della revisione contabile, questa è la sfida quotidiana: trovare errori o frodi in enormi pile di registri finanziari. Tradizionalmente, i revisori hanno utilizzato un metodo chiamato "Campionamento delle Unità Monetarie" (MUS). Pensate a questo come a un cercatore di tesori che scava solo nei cumuli di terra più grandi e ovvi perché assume che l'oro debba trovarsi lì. Ignora i piccoli e silenziosi sacchi di sabbia, assumendo che siano al sicuro. Ma cosa succederebbe se la moneta falsa si nascondesse in uno di quei piccoli sacchi ignorati? Questo è il rischio: perdere le cose brutte perché si è guardato solo nelle cose grandi.
Per risolvere questo problema, gli scienziati si stanno rivolgendo al "Machine Learning", che è come dare al detective un assistente robotico super intelligente e instancabile. Questo assistente può leggere ogni singolo record nel sacco, non solo quelli grandi. Cerca schemi che gli occhi umani potrebbero mancare, come un ritmo strano nei numeri o una transazione che sembra "fuori posto". L'obiettivo è abbassare il "rischio di rilevamento", che è semplicemente la possibilità che il detective perda il crimine. Se il robot può individuare la moneta falsa nella piccola tasca, l'audit diventa molto più sicuro e veloce. Questo articolo pone una grande domanda: questo assistente robotico può effettivamente trovare gli errori nei veri registri di denaro pubblico meglio del vecchio metodo "scava nei grandi cumuli", e può spiegare perché li ha trovati in un modo che i revisori umani possano fidarsi?
Lo Super-Scanner: Come l'IA ha trovato l'ago nel pagliaio
In questo studio, un team di ricercatori della Mongolia ha costruito un "super-scanner" a quattro livelli per controllare i registri finanziari di un'azienda elettrica pubblica. Non lo hanno testato solo su numeri inventati; lo hanno alimentato con un enorme dataset del mondo reale contenente 3.329.189 singole transazioni monetarie di tre anni (2023, 2024 e 2025). Questa era una montagna di dati per un totale di MNT 16,34 trilioni (sono molti Tugrik!).
Il Vecchio Modo vs. Il Nuovo Modo
I ricercatori hanno confrontato il loro nuovo sistema di machine learning con il vecchio standard, che è come il metodo "scava nei grandi cumuli" menzionato in precedenza. Nel vecchio metodo, i revisori avrebbero scelto un campione casuale del 20% dei conti da controllare. Lo studio ha scoperto che questo vecchio metodo lasciava un enorme vuoto: aveva un "rischio di rilevamento" (la possibilità di mancare un errore) compreso tra il 38,05% e il 52,7%. In parole povere, questo significa che in quasi la metà dei casi, il vecchio metodo avrebbe potuto mancare completamente la frode o l'errore.
Il nuovo sistema di machine learning, tuttavia, ha agito come una rete che cattura tutto. Ha elaborato l'intero volume di 3,3 milioni di transazioni in appena 4,5 ore. Per dare un termine di paragone, il vecchio metodo avrebbe richiesto ai revisori umani tra le 310 e le 357 ore per fare lo stesso lavoro. Si tratta di una riduzione del tempo del 98,7%!
Come il Robot ha Imparato (Senza un Insegnante)
Di solito, insegnare a un robot come individuare le frodi richiede di mostrargli prima migliaia di esempi di record "buoni" e "cattivi". Ma nella vita reale, i revisori non sanno quali record siano cattivi finché non hanno finito l'audit. È un vicolo cieciolo.
Gli autori hanno risolto questo problema con un trucco intelligente chiamato sistema di "auto-etichettatura" (self-labeling). Immaginate un gruppo di tre diversi detective (Isolation Forest, Z-score e analisi del rapporto di rotazione) che esaminano i dati indipendentemente. Se almeno due di loro concordano sul fatto che un record sembri sospetto, il sistema lo marca come "anomalo". Questo crea un set di dati di addestramento dal nulla, permettendo al robot principale (un modello Random Forest) di imparare come individuare i cattivi senza bisogno di una chiave di risposta pre-scritta.
I Risultati: Un Miglioramento di 19 Volte
Quando hanno testato questo sistema, i risultati sono stati sbalorditivi. Il modello Random Forest ha raggiunto un F1 score di 0,966 e un AUC di 0,999, riducendo al contempo il "rischio di rilevamento" a soli 2,01%. Questo è un miglioramento di 19 volte rispetto al vecchio metodo. Per dimostrare che non si trattasse di fortuna, hanno eseguito un test statistico (test di McNemar) che ha mostrato come, per ogni singolo errore individuato dal vecchio metodo, il nuovo modello di machine learning ne abbia individuati 107 che il vecchio metodo aveva mancato. La matematica era così chiara che la probabilità che ciò accadesse per caso era inferiore allo 0,001.
La Sorpresa dell' "Effetto Mascheramento da Aggregazione"
Una delle scoperte più affascinanti dell'articolo è qualcosa che gli autori chiamano "effetto di mascheramento da aggregazione". Hanno testato una regola classica chiamata Legge di Benford, che predice come dovrebbero iniziare i numeri (come quanti 1, 2 o 3 dovrebbero apparire all'inizio dei numeri nella vita reale).
Quando hanno esaminato i 3,3 milioni di singole transazioni, i numeri erano strani e rompevano la Legge di Benford (un segno di potenziale manipolazione). Ma, quando hanno raggruppato quelle stesse transazioni in riepiloghi di conto (come sommare tutte le transazioni per un determinato conto bancario), la stranezza è scomparsa! I numeri sembravano perfettamente normali.
È come se guardaste una folla di persone individualmente: potreste vedere alcuni con cappelli rossi e altri con cappelli blu. Ma se scattate una foto all'intera folla da lontano, i colori si mescolano in un noioso grigio. Lo studio ha scoperto che se i revisori guardano solo la "foto grigia" (il riepilogo del conto), perdono i "cappelli rossi" (la frode a livello di transazione). Ciò suggerisce che per davvero catturare le frodi, i revisori devono guardare le singole transazioni, non solo i grandi riepiloghi.
Il Robot può Spiegarsi?
Una grande preoccupazione riguardo all'IA è che sia una "scatola nera": dà una risposta ma non dice il perché. I ricercatori hanno risolto questo problema aggiungendo uno strato che traduce la matematica del robot nel "linguaggio del revisore". Inveve di dire "La caratteristica X ha un peso elevato", il sistema dice: "Questo conto è stato segnalato perché il saldo è saltato dell'847% in un anno, violando le regole della ISA 520".
Quando i veri revisori dell'Ufficio Nazionale di Audit hanno esaminato queste spiegazioni, il 94% ha dichiarato che erano perfette e potevano essere utilizzate nei rapporti ufficiali senza cambiare una parola. Questo prova che il robot non sta solo indovinando; sta ragionando in un modo che i professioni umani comprendono.
Funziona su Altri Dati?
Il team ha anche testato se il loro robot potesse gestire dati provenienti da altri settori (come diversi dipartimenti governativi) senza essere riaddestrato. Sebbene funzionasse meglio sull'azienda elettrica su cui era stato addestrato, rendeva comunque significativamente meglio del vecchio metodo del "campione del 20%" in altri settori, catturando la maggior parte degli errori anche senza un addestramento specifico su quei nuovi gruppi.
In Conclusione
Questo articolo dimosta che il machine learning non è solo un'idea futuristica; è uno strumento pratico che può scansionare 3,3 milioni di transazioni in 4,5 ore, trovare errori con una separazione quasi perfetta (AUC=0,999) e un'alta precisione (F1=0,966), ed esplicare le proprie scoperte in un inglese semplice. Avverte inoltre che guardare i grandi riepiloghi non è sufficiente: dobbiamo concentrarci sui minimi dettagli per catturare la frode che si nasconde nel rumore. Gli autori hanno persino rilasciato il loro sistema come software open-source gratuito, in modo che altri revisori possano usare questo "super-scanner" per rendere più sicuro il mondo del denaro pubblico.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.