← Ultimi articoli
🤖 machine learning

Amortizing intractable inference in large language models

Questo articolo propone l'uso delle GFlowNets per ammortizzare l'inferenza intrattabile nei grandi modelli linguistici, consentendo loro di campionare da distribuzioni a posteriori complesse per compiti quali la generazione vincolata e il ragionamento chain-of-thought come alternativa efficiente dal punto di vista dei dati rispetto all'addestramento tradizionale basato sulla massima verosimiglianza o sulla massimizzazione della ricompensa.

Autori originali: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Pubblicato 2026-09-01
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I grandi modelli linguistici sono vaste biblioteche di conoscenza umana, compresse in reti digitali che predicono la parola successiva in una frase sulla base di ciò che è venuto prima. Sono addestrati per essere eccellenti nel continuare una storia o nel rispondere a una domanda quando viene fornito un punto di partenza, un processo che fluisce naturalmente da sinistra a destra. Tuttavia, molti dei compiti più interessanti che vogliamo far eseguire a questi modelli richiedono di pensare al contrario o di riempire il mezzo di una storia. Immaginate di ricevere l'inizio e la fine di un racconto e di esservi chiesto di inventare la parte centrale. In questi scenari, il modello non può semplicemente indovinare la parola successiva; deve cercare attraverso un paesaggio massiccio e complesso di possibilità per trovare il percorso specifico che colleghi l'inizio alla fine. Questo è un problema matematico difficile perché il numero di percorsi possibili è così enorme che controllarli uno per uno è impossibile, e i metodi standard per navigare in questo paesaggio spesso si bloccano su uno o due percorsi comuni, perdendo la ricca varietà di soluzioni valide esistenti.

Ricercatori del Mila – Quebec AI Institute e dell'Università di Oxford hanno sviluppato un nuovo modo per insegnare a questi modelli come navigare in quel complesso paesaggio. Invece di addestrare il modello a massimizzare semplicemente un punteggio per la "migliore" risposta, il che spesso porta a un pensiero ripetitivo e ristretto, hanno utilizzato un metodo chiamato inferenza ammortizzata. Questo approccio tratta il problema come una ricerca di un insieme diversificato di percorsi corretti piuttosto che di uno singolo e perfetto. Per fare ciò, hanno impiegato una tecnica nota come rete di flusso generativo, che agisce come una guida che impara a campionare dall'intero intervallo di possibili soluzioni, assicurando che il modello esplori diversi percorsi di ragionamento validi invece di collassare in un unico schema troppo utilizzato.

Il team ha dimostrato questo aspetto perfezionando (fine-tuning) grandi modelli linguistici per risolvere problemi che richiedono un ragionamento multi-step, come calcoli aritmetici o la classificazione se una recensione cinematografica esprime un'opinione o un fatto. In un esperimento, hanno chiesto al modello di riempire la frase centrale mancante di una breve storia, dato l'inizio e la fine. I metodi standard producevano spesso frasi che erano grammaticalmente corrette ma che non si adattavano al flusso narrativo. Il nuovo metodo, tuttavia, ha generato con successo frasi centrali che collegavano l'inizio e la fine in modo coerente, mostrando una capacità molto più elevata di comprendere l'intero contesto. In un altro test riguardante semplici problemi di matematica, il modello è stato dotato di uno strumento calcolatrice ed è stato chiesto di scomporre il calcolo in passaggi. Mentre altri metodi di addestramento causavano la ripetizione di numeri da parte del modello o il mancato utilizzo corretto dello strumento, il nuovo approccio ha insegnato al modello a pianificare i suoi passaggi con cura, portando a un miglioramento drammatico dell'accuratezza, specialmente su problemi che non aveva mai visto prima.

I risultati suggeriscono che questo metodo è particolarmente potente quando i dati sono scarsi. In un test con soli dieci esempi di recensioni cinematografiche da cui imparare, il nuovo metodo ha raggiunto un'accuratezza significativamente superiore rispetto alle tecniche di addestramento standard, e ha continuato a superarle anche con cinquanta esempi. I ricercatori hanno scoperto che, incoraggiando il modello a campionare una vasta gamma di percorsi di ragionamento e poi combinando le loro conclusioni, il sistema diventava più robusto e affidabile. Questa è una distinzione cruciale perché significa che il modello non sta solo memorizzando un singolo modo per risolvere un problema, ma sta imparando la struttura sottostante di come affrontarlo attraverso il ragionamento. Lo studio indica che, spostando l'obiettivo dal trovare la singola risposta più probabile all'esplorare l'intera diversità delle risposte corrette, possiamo rendere questi potenti strumenti più flessibili e più adatti a compiti di ragionamento complesso.

Il lavoro evidenzia anche un limite nel modo in cui gli attuali modelli vengono spesso addestrati. Quando i modelli vengono spinti a massimizzare una ricompensa, tendono a trovare scorciatoie, come ripetere la stessa frase o ignorare la logica reale di un problema, solo per ottenere un punteggio alto. I ricercatori hanno dimostrato che il loro metodo evita questa trappola facendo corrispondere l'intera distribuzione delle possibili soluzioni, assicurando che il modello non collassi in un unico, difettoso modo di pensare. Questo approccio permette al modello di generalizzare meglio a nuove situazioni, come la risoluzione di problemi aritmetici con più numeri rispetto a quelli per cui è stato addestrato, dove altri metodi fallivano. Le scoperte offrono una strada promettente per rendere l'intelligenza artificiale più capace di un vero ragionamento, andando oltre il semplice riconoscimento di pattern verso una comprensione più sfumata di come costruire argomentazioni e risolvere problemi passo dopo passo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →