← Ultimi articoli
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

Il documento introduce LEAP, un metodo di pruning adattivo apprendibile end-to-end che utilizza un rilassamento Bernoulli per peso tramite sigmoide di Gumbel per abilitare l'apprendimento della sparsità non strutturata trattabile nei grandi modelli linguistici, superando significativamente le baseline esistenti a livello di strato in termini di accuratezza zero-shot a livelli elevati di sparsità.

Autori originali: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Pubblicato 2026-05-19
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere una biblioteca enorme e incredibilmente intelligente (un Modello Linguistico di grandi dimensioni) che sa quasi tutto. Ma questa biblioteca è così grande da occupare un intero magazzino, richiede una centrale elettrica gigantesca per funzionare ed è troppo lenta perché chiunque possa usarla effettivamente su un computer normale.

Per risolvere questo problema, vuoi buttare via dal 50% al 60% dei libri (i "pesi" o le connessioni nel modello) per renderla più piccola e veloce. L'obiettivo è mantenere la biblioteca ugualmente intelligente, anche con la metà dei libri.

È qui che entra in gioco il paper LEAP. Ecco la storia di come hanno risolto il problema, spiegata in modo semplice:

Il Problema: La Trappola delle "Troppe Scelte"

Per molto tempo, gli scienziati hanno cercato di eliminare libri utilizzando due strategie principali:

  1. L'Approccio "Strato per Strato" (Vecchio Metodo): Immagina un bibliotecario che guarda uno scaffale alla volta e decide: "Questo libro sembra inutile, buttalo". Lo fanno per ogni scaffale senza parlare con gli altri scaffali.

    • Il Difetto: A volte un libro sembra inutile sul suo scaffale ma è in realtà cruciale per una storia che attraversa tutta la biblioteca. Guardando gli scaffali in isolamento, questo metodo butta accidentalmente via connessioni importanti, rendendo la biblioteca meno intelligente.
  2. L'Approccio "Pattern" (Il Metodo Più Recente, Ma Rotto): Recentemente, alcuni ricercatori hanno provato a guardare l'intera biblioteca tutta insieme. Hanno detto: "Impariamo esattamente quali libri tenere". Ma hanno cercato di farlo raggruppando i libri in piccoli insiemi (come 4 libri alla volta) e chiedendo: "Quale pattern di questi 4 dovremmo tenere?"

    • Il Difetto: Questo funziona benissimo per piccoli gruppi. Ma se provi a farlo per un'intera fila di 4.000 libri (che è ciò che hanno i moderni modelli di IA), il numero di possibili "pattern" diventa un numero così enorme che è impossibile scriverlo. È come cercare di elencare ogni possibile combinazione di numeri del lotto per un miliardo di biglietti. Il computer si blocca; la matematica si rompe.

La Soluzione: LEAP (Il Sistema del "Voto Individuale")

Gli autori di questo paper, LEAP, hanno capito che avevano bisogno di un nuovo modo per votare su quali libri tenere senza essere sopraffatti dalla matematica.

Invece di chiedere: "Quale pattern di gruppo teniamo?" (il che è impossibile per gruppi enormi), hanno posto una domanda molto più semplice per ogni singolo libro: "Questo libro specifico deve restare o andare?"

  • L'Analogia: Immagina un'elezione enorme in cui ogni singolo elettore (ogni peso nel modello) riceve un piccolo scheda elettorale. Invece di votare per una complessa "strategia di squadra", votano semplicemente "Sì" (tenere) o "No" (scartare).
  • Il Trucco Magico: Per far funzionare questo, hanno usato un trucco matematico (chiamato "Gumbel-sigmoid") che permette al computer di "indovinare" i voti in modo fluido all'inizio, per poi rendere gradualmente questi indovinelli più duri e netti finché ogni voto non diventa un chiaro "Sì" o "No".

Come l'Hanno Fatto (La Ricetta)

Non hanno iniziato da zero. Hanno usato un punto di partenza intelligente:

  1. Il Warm Start: Hanno prima usato un metodo rapido e semplice (chiamato Wanda) per avere un'idea approssimativa di quali libri fossero probabilmente inutili. L'hanno usata come un "vantaggio iniziale" in modo che il computer non dovesse indovinare alla cieca.
  2. L'Addestramento: Hanno lasciato che il computer "imparasse" il miglior insieme di voti leggendo una piccola quantità di testo (un flusso di calibrazione) e regolando i voti "Sì/No" per mantenere alta l'intelligenza della biblioteca.
  3. Congelare i Libri: Fondamentalmente, non hanno cambiato le parole all'interno dei libri (i pesi del modello). Hanno cambiato solo la decisione su quali libri tenere. Questo mantiene intatta la "personalità" e la conoscenza originale della biblioteca, solo in un pacchetto più piccolo.

I Risultati: Più Intelligente, Più Veloce, Più Snella

Hanno testato questo su cinque diversi modelli di IA famosi (che vanno da piccoli a molto grandi) e li hanno ridotti del 50% e del 60%.

  • Il Tabellone dei Punteggi: Hanno confrontato LEAP con i migliori metodi esistenti.
  • La Vittoria: LEAP è stato costantemente migliore. In media, ha migliorato l'accuratezza del modello di 2,59 punti rispetto al miglior metodo precedente. In alcuni casi, il miglioramento è stato fino a 5,40 punti.
  • La Velocità: Poiché hanno tagliato il modello in un modo che si adatta perfettamente ai nuovi e veloci chip informatici (GPU) progettati proprio per questo lavoro, il modello risultante gira molto più velocemente senza perdere la sua intelligenza.

Perché Questo È Importante

Prima di questo, se volevi rendere un modello di IA enorme più piccolo e veloce, dovevi scegliere tra:

  • Opzione A: Mantenerlo accurato ma enorme e lento.
  • Opzione B: Renderlo piccolo e veloce, ma stupido.

LEAP mostra che puoi avere la torta e mangiarla anche tu. Fornisce un modo pratico per rimpicciolire questi enormi cervelli di IA della metà, mantenendoli ugualmente intelligenti, in modo che possano girare su computer normali invece di aver bisogno di un supercomputer.

In breve: LEAP è un nuovo modo più intelligente per modificare un modello di IA gigante permettendo a ogni singola connessione di votare se dovrebbe restare, risultando in un'IA più piccola, più veloce e ancora molto intelligente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →