Revisiting Energy-based Tabular Anomaly Detection: Energy and Reconstruction are Complementary
Questo articolo dimostra che i modelli classici basati sull'energia, specificamente le Deep Boltzmann Machines, forniscono una prospettiva non ridondante e complementare ai metodi basati sulla ricostruzione per l'anomalia di dati tabulari, migliorando significativamente le prestazioni quando i loro punteggi di energia vengono fusi con gli output degli Autoencoder.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di essere un detective che cerca di trovare una singola moneta falsa in un sacco di migliaia di monete vere. Nel mondo della scienza dei dati, questo è chiamato "rilevamento delle anomalie" (anomaly detection). Di solito, le "monete" sono righe di numeri in un foglio di calcolo — come la lista clienti di una banca o i registri del traffico di una rete informatica. La parte difficile è che questi numeri non hanno una forma naturale come l'immagine di un gatto o una frase in un libro; sono solo un ammasso disordinato di fatti non correlati. Per trovare la moneta falsa, la maggior parte dei detective oggi usa due trucchi principali. Il primo è il trucco della "Ricostruzione": costruiscono una macchina che cerca di memorizzare come appare una moneta "vera". Se la macchina prova a copiare una moneta falsa e fallisce miseramente, capisce che qualcosa non va. Il secondo trucco è quello della "Densità": cercano monete che si trovano da sole in mezzo a una folla, lontane dal gruppo principale. Entrambi i metodi sono ottimi, ma sono indiretti; indovinano cosa c'è che non va guardando ciò che manca o dove le cose sono affollate, piuttosto che comprendere le regole profonde e nascoste che rendono una moneta "vera".
Questo articolo entra in quella stanza da detective e pone una domanda audace: e se riportassimo in gioco uno strumento vecchio e leggermente polveroso chiamato "Modello basato sull'Energia" (Energy-Based Model) per aiutare? Nello specifico, l'autore rivisita una struttura classica del machine learning chiamata Deep Boltzmann Machine (DBM). Pensa a questo non come a una macchina che cerca di copiare un'immagine, ma come a una macchina che assegna un "punteggio di comfort" a ogni possibile combinazione di dati. Se i dati si sentono "a proprio agio" (bassa energia), è probabile che siano reali. Se si sentono "a disagio" (alta energia), è probabile che siano falsi. L'autore voleva vedere se questo vecchio "punteggio di comfort" potesse funzionare meglio delle moderne "macchine di copia" e, cosa più importante, se l'uso di entrambi insieme potesse rendere il detective ancora più acuto.
Il vecchio strumento riceve un nuovo lavoro
La storia inizia con un'ipotesi: il metodo della "Ricostruzione" (la macchina di copia) e il metodo dell' "Energia" (il punteggio di comfort) osservano i dati da due angolazioni completamente diverse. La macchina di copia controlla se può ricostruire i dati pezzo per pezzo, come una stampante 3D che tenta di ricreare un giocattolo. Il modello di energia, invece, guarda l'intera immagine in un colpo solo, controllando se le relazioni tra tutti i pezzi abbiano senso insieme. L'autore, Junichiro Niimi, si è chiesto se queste due visioni fossero così diverse da potersi completare perfettamente, invece di limitarsi a ripetere la stessa informazione.
Per testare questo, hanno allestito un esperimento massiccio utilizzando due dataset molto diversi. Il primo era una lista di marketing bancario (Bank Marketing), cercando di individuare i clienti che avrebbero effettivamente acquistato un deposito a termine. Il secondo era un registro di sicurezza di rete (NSL-KDD), cercando di individuare attacchi informatici. Hanno messo alla prova il loro detective dell' "Energia" contro altri otto famosi detective, inclusi i campioni attuali come gli Autoencoder (le macchine di copia), le Isolation Forest e diversi moderni scorer non parametrici. Hanno eseguito i test 20 volte con diversi seed casuali per assicurarsi che i risultati non fossero dovuti alla fortuna.
I risultati: un pareggio sorprendente e una squadra potente
I risultati sono stati affascinanti. Quando il detective dell' "Energia" basato su DBM lavorava da solo, otteneva prestazioni incredibili. Sui dati del marketing bancario, ha pareggiato statisticamente per il primo posto con la migliore macchina di copia (l'Autoencoder), eguagliandone l'accuratezza. Sui dati della sicurezza di rete, ha addirittura battuto l'Autoencoder, ottenendo un punteggio di accuratezza leggermente superiore. Questo è stato un grande traguardo perché il DBM è un modello molto più vecchio, e sia riuscito a competere con i pesi massimi moderni senza alcuna modifica speciale per i dati tabulari.
Ma la vera magia è accaduta quando hanno unito le forze. L'autore ha preso il punteggio di "Energia" e il punteggio di "Ricostruzione" e li ha fusi insieme. Il risultato è stato una squadra statisticamente più forte di ciascun detective che lavorava da solo. Sui dati bancari, la squadra ha migliorato l'accuratezza di un margine piccolo ma significativo. Sui dati della sicurezza di rete, dove tutti stavano già facendo un lavoro quasi perfetto, la squadra è riuscita comunque a estrarre un briciolo in più di accuratezza.
Ecco la parte più critica della storia: l'autore ha testato se qualsiasi coppia di metodi diversi funzionasse bene insieme. Ha provato ad accoppiare l'Autoencoder con altri sette metodi (come Isolation Forest o LOF). Quasi ogni volta, la squadra è diventata peggio o è rimasta uguale. Era solo quando ha accoppiato l'Autoencoder con il DBM (o un punteggio di ricostruzione derivato dal DBM stesso) che la squadra è migliorata. Questo dimostra che il DBM non è solo un altro detective che fa la stessa cosa; porta una prospettiva unica che gli altri semplicemente non hanno.
Perché questo è importante
L'articolo conclude che, sebbene il metodo della "Ricostruzione" sia l'attuale re del rilevamento delle anomalie tabulari, esso ha un punto cieco. Guarda i dati coordinata per coordinata, come controllare se ogni mattone in un muro ha la forma giusta. Il metodo dell' "Energia" del DBM guarda il muro nel suo insieme, controllando se i mattoni si incastrano in un modo che abbia senso strutturale. Poiché vedono il problema in modo diverso, non si limitano ad aggiungere i propri valori, ma moltiplicano le reciproche forze.
L'autore ha anche scoperto un trucco intelligente nel modo in cui ha utilizzato il DBM. Di solito, questi modelli calcolano un punteggio di "energia libera" che include un termine per l' "incertezza" (entropia). Tuttavia, ha scoperto che per individuare le anomalie è in realtà meglio ignorare quel termine di incertezza e usare solo il punteggio di "comfort" grezzo. Si è scoperto che il termine di incertezza nasconde in realtà alcuni degli indizi necessari per catturare i falsi.
In definitiva, questo articolo suggerisce che non dovremmo gettare via gli strumenti classici del mestiere. Revisitando la Deep Boltzmann Machine e accoppiando la sua visione di "energia" con le moderne visioni di "ricostruzione", possiamo costruire un sistema più robusto per trovare gli elementi discordanti nei nostri dati. È un promemoria del fatto che, a volte, il modo migliore per andare avanti è guardare indietro da un'angolazione diversa.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.