← Ultimi articoli
🤖 machine learning

Is the Statistical Advantage Worth the Cost? An Empirical Comparison of KANs and MLPs for Structured Data Classification

Questo studio empirico dimostra che, sebbene le reti Kolmogorov-Arnold (KAN) superino statisticamente i Multi-Layer Perceptrons (MLP) nei compiti di classificazione tabulare strutturata, la loro superiore capacità di generalizzazione comporta costi computazionali e di parametri significativamente più elevati, rendendo le KAN ideali per applicazioni di alta precisione e gli MLP più adatti ad ambienti con risorse limitate.

Autori originali: Matthew Steven P. Toledo, Justine Raphael H. Jacinto, Vivekjeet Singh Chambal, Rodolfo C. Camaclang III, Jamlech Iram N. Gojo Cruz, Reginald Neil C. Recario

Pubblicato 2026-07-16
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Matthew Steven P. Toledo, Justine Raphael H. Jacinto, Vivekjeet Singh Chambal, Rodolfo C. Camaclang III, Jamlech Iram N. Gojo Cruz, Reginald Neil C. Recario

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un computer come prendere decisioni basandosi su un foglio di calcolo pieno di numeri e categorie, come predire se un fungo è velenoso o se uno studente abbandonerà la scuola. Questo è il mondo dei "dati tabulari strutturati", il pane quotidiano di molti sistemi di apprendimento automatico del mondo reale. Per anni, lo strumento d'elezione per questo compito è stato il Multi-Layer Perceptron, o MLP. Puoi pensare a un MLP come a una rigida catena di montaggio di tipo industriale: riceve informazioni, le passa attraverso strati di operai che applicano le stesse regole fisse (come "se il numero è grande, moltiplicalo per 2") e sputa fuori un risultato. È affidabile e veloce, ma a volte fatica a individuare i modelli sottili e sinuosi nascosti nei dati.

Recentemente, un nuovo sfidante è entrato nell'arena, chiamato Kolmogorov-Arnold Network, o KAN. Se un MLP è una rigida catena di montaggio, un KAN è più simile a una squadra di maestri scultori. Invece di usare regole fisse, ogni connessione tra gli strati è una curva flessibile e apprendibile che può piegarsi e torcersi per adattarsi perfettamente ai dati, proprio come una spline (un righello liscio e flessibile usato dagli architetti). La grande domanda che tutti si pongono è: questa scultura elegante e flessibile vale l'impegno extra? Produce davvero previsioni migliori, o è solo un giocattolo lento e costoso? Questo è l'enigma che un team di ricercatori dell'Università delle Filippine Los Baños ha deciso di risolvere.

I ricercatori hanno organizzato un enorme scontro testa a testa tra questi due tipi di architetti dell'IA. Non si sono limitati a guardare uno o due esempi; hanno testato entrambi i modelli su dodici diversi dataset del mondo reale, coprendo tutto, dalle scelte binarie (sì/no) a scenari complessi con molte possibili risposte o persino sistemi di classificazione. Per garantire che la gara fosse equa, hanno dato a entrambi i team lo stesso programma di addestramento, la stessa quantità di dati e le stesse regole iniziali, rifiutandosi di modificare le impostazioni per favorire uno o l'altro. Volevano vedere come le versioni "vanilla" di questi modelli si sarebbero comportate direttamente "out of the box".

I risultati sono stati una storia di due capacità molto diverse. Quando si trattava di pura accuratezza, i flessibili scultori KAN hanno generalmente vinto la corsa. Nei test, i KAN hanno classificato correttamente più punti dati rispetto ai rigidi MLP in 9 dei 12 dataset, e hanno ottenuto un migliore equilibrio tra precisione e richiamo (l'F1-Score) in 10 casi su 12. La differenza era statisticamente significativa, il che significa che non è stata solo fortuna; i KAN erano genuinamente migliori nel trovare le risposte corrette, specialmente nei problemi binari e multiclasse. I ricercatori hanno scoperto che i KAN potevano raggiungere il loro picco di prestazioni più velocemente e stabilizzarsi prima degli MLP nella maggior parte dei casi.

Tuttavia, c'era un intoppo, ed era uno grosso. La "flessibilità" del KAN aveva un prezzo salato. Mentre l'MLP era uno sprinter leggero, il KAN era un campione dei pesi massimi che portava uno zaino enorme. Lo studio ha dimostrato che i KAN richiedevano circa 16 volte più parametri (le manopole e i cursori interni che l'IA impara) rispetto agli MLP. Questo ingombro extra li rendeva incredibilmente lenti. In alcuni test, l'MLP ha terminato l'addestramento in meno di un secondo, mentre il KAN ha impiegato oltre un minuto. In termini di velocità, l'MLP era spesso 100 volte più veloce durante l'inferenza (effettuando una previsione). I ricercatori hanno calcolato che il miglioramento delle prestazioni offerto dai KAN era un miglioramento "medio", non un salto enorme e rivoluzionario.

Quindi, chi vince? Il documento suggerisce che la risposta dipende interamente dalla propria situazione. Se si lavora su un problema ad alto rischio dove essere leggermente più accurati vale l'attesa più lunga e l'uso di più potenza di calcolo — come diagnosticare una malattia rara o fare una previsione finanziaria critica — il KAN è la scelta preferita. Offre una capacità statisticamente superiore di generalizzare e trovare schemi. Ma se si sta costruendo un'app che deve funzionare istantaneamente su un telefono o su un dispositivo con batteria e memoria limitate, l'MLP rimane l'eroe robusto, efficiente e pratico. Lo studio conclude che, sebbene i KAN siano una nuova direzione promettente e potente per i dati strutturati, non sono una soluzione magica che rende obsoleti i vecchi MLP; sono semplicemente uno strumento diverso per un lavoro diverso.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →