← Ultimi articoli
💬 NLP

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

Questo articolo introduce l'Hidden Decoding, un nuovo metodo di scaling che potenzia i Large Language Models espandendo il calcolo dei token lungo la dimensione della lunghezza della sequenza attraverso la fattorizzazione a flusso, consentendo significativi guadagni di prestazioni alle scale di frontiera senza modificare il backbone Transformer fisso o incorrendo in costi di addestramento proibitivi.

Autori originali: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Sh
Pubblicato 2026-07-10
📖 6 min di lettura🧠 Approfondimento

Autori originali: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un cervello robotico super intelligente (un Large Language Model) che è già piuttosto straordinario. Di solito, per renderlo ancora più intelligente, gli scienziati cercano di rendere il cervello più grande — aggiungendo più strati, più neuroni, più di tutto. Ma questo è come cercare di costruire un grattacielo sopra un grattacielo: costa una fortuna, richiede un tempo infinito e, a volte, la squadra di costruzione (i computer per l'addestramento) non riesce a gestire le dimensioni.

Il team di WeChat AI si è posto una domanda diversa: E se mantenessimo la dimensione del cervello esattamente la stessa, ma gli dessimo più tempo per pensare a ogni parola?

Il problema del "Looping"

Alcuni ricercatori hanno cercato di risolvere questo problema facendo "ruotare" il pensiero del robot. Immagina uno studente che legge una frase, poi la rilegge, poi ancora, usando le stesse cellule cerebrali più volte per ottenere una risposta migliore. Questo è chiamato un modello "a ciclo" o "ricorrente".

Ma ecco il problema: quando provi ad addestrare i robot pi più grandi (quelli con centinaia di miliardi di parametri), questa idea del looping rompe la catena di montaggio. I computer che addestrano questi modelli lavorano in una pipeline, dove ogni parte del cervello svolge il proprio compito una volta sola e passa il testimone. Se fai sì che il robot si fermi e rilegga la stessa frase, l'intera linea si blocca, e i costosi computer rimangono inattivi. È come una catena di montaggio di una fabbrica che continua a fermarsi per lasciare che un operaio rifaccia lo stesso bullone; la fabbrica si blocca completamente.

La soluzione: "Hidden Decoding" (La catena di montaggio segreta)

Il team di WeChat ha ideato un trucco astuto chiamato Hidden Decoding (Decodifica Nascosta). Inve Instead di far leggere al robot la stessa parola ripetutamente in un ciclo, lo fanno leggere la parola più volte contemporaneamente, ma in corsie parallele segrete.

Pensa a una squadra di corse automobilistiche. Invece di far fare a un'auto tre giri intorno alla pista per ottenere il miglior tempo sul giro, inviano quattro auto identiche (stream) lungo la pista simultaneamente.

  1. L'impostazione: Quando il robot vede una parola (come "mela"), non la trasforma solo in un codice. La trasforma in quattro codici diversi, ognuno dei quali entra nella propria corsia segreta.
  2. Il lavoro segreto: Queste quattro corsie attraversano gli strati del cervello. Le prime tre corsie sono "nascoste". Esse svolgono tutto il lavoro pesante, il pensiero e il ragionamento, ma non possono ancora pronunciare la risposta. Sono come il team di brainstorming nella stanza sul retro.
  3. L'ultima parola: Solo la quarta corsia (lo stream finale) ha il permesso di urlare la parola successiva. Il cervello viene valutato solo su questa risposta finale.
  4. La memoria: Fondamentalmente, il cervello ricorda ciò che hanno pensato le prime tre corsie. Conserva i loro appunti (chiamati "cache Key-Value") in modo che la parola successiva possa leggere gli appunti del brainstorming della parola precedente.

In questo modo, il robot ottiene quattro volte la potenza di pensiero per ogni parola, ma non ha bisogno di costruire un cervello più grande o di fermare la catena di montaggio. Semplicemente elabora una sequenza di dati più lunga in un colpo solo.

Rendere il tutto accessibile: Il trucco dello "Stream-Factorized"

Potresti pensare: "Aspetta, se ho quattro corsie che parlano tra loro, la matematica non diventerà complicatissima?". Se ogni corsia cercasse di parlare con tutte le altre ad ogni passaggio, il costo esploderebbe (salirebbe di 16 volte!).

Per risolvere questo, il team ha utilizzato un metodo chiamato Stream-Factorized Attention.

  • La maggior parte del tempo: Le corsie rimangono nelle proprie bolle. La Corsia 1 parla con la Corsia 1, la Corsia 2 con la Corsia 2. Non si disturbano a vicenda.
  • A volte: Solo alcuni strati specifici permettono alle corsie di scambiarsi appunti e mescolare le proprie idee.

Questo mantiene basso il costo. Invece di un aumento di 16 volte, il costo aumenta solo di circa 4,4 - 5,1 volte (che è vicino all'aumento di 4 volte delle corsie). Questo rende possibile addestrare questi modelli super-grandi senza svuotare il portafoglio.

Ha funzionato?

Il team ha testato questo approccio su due modelli massicci: uno con 80 miliardi di parametri e uno gigante con 617 miliardi di parametri. Non hanno cambiato la dimensione del cervello; hanno solo attivato la modalità "a 4 corsie".

  • I Risultati: I modelli sono diventati più intelligenti. Nei test difficili di matematica e scienza, il modello da 617 miliardi ha migliorato il suo punteggio nel test "GPQA Diamond" da 89,1 a 91,2. Nel test di fisica "PHYBench", è passato da 75,3 a 76,3.
  • Il Trend: Hanno anche testato con 2 corsie, 4 corsie e 8 corsie. Man mano che aggiungevano corsie, i punteggi continuavano a salire. Ciò suggerisce che aggiungere più "corsie di pensiero" è un modo reale per rendere i modelli più intelligenti senza ricostruirli.

Cosa hanno escluso

Il team è stato attento a verificare che non fosse solo un caso fortuito. Hanno provato altri modi per usare le corsie extra:

  • Costringere ogni corsia a indovinare: Se avessero costretto anche le prime tre corsie a prevedere la risposta (invece di lasciare che lo facesse solo l'ultima), il modello sarebbe diventato peggio.
  • Mescolare le risposte: Se avessero semplicemente fatto la media dei pensieri di tutte e quattro le corsie, non avrebbe funzionato bene quanto lasciare che la corsia finale decidesse.
  • Condividere gli appunti: Se avessero fatto condividere alle corsie gli stessi appunti di memoria invece di tenerli separati, il modello sarebbe stato leggermente meno accurato.

Questo dimostra che il "ingrediente segreto" è lasciare che le prime corsie facciano un pensiero silenzioso e privato e mantenere i loro appunti separati, in modo che la corsia finale possa utilizzare quella saggezza profonda e accumulata per fare la scelta migliore.

In sintesi

L'Hidden Decoding dimostra che non serve sempre un cervello più grande per essere più intelligenti. A volte, basta dare al cervello più tempo per pensare in parallelo. Trasformando una singola parola in una segreta catena di montaggio di pensieri, il team di WeChat ha trovato un modo per potenziare l'intelligenza dei modelli di frontiera senza l'enorme costo di costruirne uno nuovo e più grande. È un modo pratico e orientato all'ingegneria per spremere più intelligenza dai modelli che già possediamo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →