← Ultimi articoli
🤖 machine learning

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

HARP introduce un processore ortogonale strutturato a due lati e apprendibile che adatta la base di quantizzazione a specifici strati e dati di calibrazione, migliorando significativamente l'accuratezza della quantizzazione di LLM a bit estremamente bassi (2-4 bit) rispetto ai metodi Hadamard fissi, pur mantenendo l'efficienza di deployment.

Autori originali: Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov

Pubblicato 2026-05-29
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere una biblioteca enorme e incredibilmente dettagliata (un Modello Linguistico di grandi dimensioni) che desideri portare in tasca. Il problema è che i libri sono troppo pesanti e gli scaffali troppo larghi per stare in una piccola borsa. Per renderla portatile, decidi di ridurre i libri a minuscole note compresse. Questo si chiama quantizzazione.

Tuttavia, quando riduci questi libri troppo (a soli 2 o 3 bit di informazione), alcune pagine si accartocciano o vanno perse. Queste "pagine accartocciate" sono chiamate valori anomali (outlier)—numeri estremamente importanti che sono molto più grandi degli altri. Se provi a comprimere l'intero libro usando un metodo standard, questi valori anomali rovinano la compressione, rendendo le note difficili da leggere.

Il Vecchio Metodo: Il "Mescolamento Casuale"

In precedenza, gli scienziati utilizzavano un trucco chiamato RHT (Trasformata di Hadamard Randomizzata). Pensa a questo come prendere tutte le pagine del tuo libro, mescolarle casualmente e poi comprimerle.

  • Il Buono: È veloce e distribuisce le pagine accartocciate in modo che non vengano tutte schiacciate in un unico punto.
  • Il Cattivo: È un mescolamento fisso. È come usare lo stesso schema di mescolamento casuale per ogni singolo libro, indipendentemente dal fatto che sia un libro di cucina, un romanzo o un dizionario. Non si adatta alla storia specifica all'interno.

Il Nuovo Metodo: HARP (Il "Sarto Intelligente")

Gli autori di questo articolo introducono HARP (Processore di Rotazione Adattiva Precondizionata con Hadamard). Pensa a HARP come a un sarto intelligente che non si limita a usare un mescolamento generico.

  1. Impara la Calzata: Invece di un mescolamento casuale, HARP esamina la specifica "forma" dei dati in ogni strato del modello (come guardare il tessuto specifico di una camicia). Impara il modo perfetto di riorganizzare i numeri in modo che si adattino allo spazio compresso minuscolo senza perdere dettagli importanti.
  2. È un Aggiornamento Plug-and-Play: La parte migliore è che HARP inizia sembrando esattamente il vecchio "Mescolamento Casuale" (RHT). È come un abito che inizia come una taglia standard pronta da indossare, ma ha cerniere nascoste e cuciture regolabili. Una volta indossato, il sarto (il processo di calibrazione) regola rapidamente la calzata per essere perfetta per te. Questo significa che puoi sostituire il vecchio metodo con HARP senza ricostruire l'intero sistema.
  3. È Strutturato e Veloce: HARP non si limita a fare un riarrangiamento disordinato e complesso. Utilizza un pattern a "farfalla" (un modo specifico ed efficiente di mescolare le cose) che è matematicamente garantito come reversibile e veloce. È come organizzare una biblioteca non lanciando i libri ovunque in modo casuale, ma utilizzando un sistema di ordinamento altamente efficiente e pre-pianificato che richiede pochi secondi.

Cosa Succede Quando lo Usi?

L'articolo ha testato questo su modelli che vanno dal piccolo (1 miliardo di parametri) all'enorme (70 miliardi di parametri).

  • Migliore Qualità: Quando hanno compresso i modelli a dimensioni estreme (da 2 a 4 bit), HARP ha reso i modelli "più intelligenti" (perplessità inferiore, accuratezza superiore) rispetto al vecchio metodo di mescolamento casuale. È stato particolarmente efficace nel salvare le "pagine accartocciate" (valori anomali) che solitamente vanno perse.
  • Ancora Veloce: Anche se HARP impara una calzata personalizzata, non rallenta il modello. In effetti, i modelli compressi con HARP erano ancora molto più veloci (128 token al secondo) rispetto ai modelli originali non compressi (61 token al secondo).
  • Versatile: Hanno dimostrato che HARP funziona non solo con uno specifico strumento di compressione, ma può essere inserito in diversi sistemi di compressione (come QTIP) continuando a migliorarli.

La Conclusione

HARP è uno strumento che prende il mescolamento casuale "taglia unica" utilizzato nella compressione dell'IA e lo trasforma in una calzata su misura. Impara da un piccolo campione di dati per trovare il modo perfetto di riorganizzare i numeri prima di schiacciarli. Il risultato è un modello di IA più piccolo e veloce che legge meglio e commette meno errori, tutto senza bisogno di riaddestrare l'intero modello da zero.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →