← Ultimi articoli
🤖 machine learning

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

Questo articolo mette in discussione la pratica standard di applicare l'apprendimento per rinforzo (RL) solo dopo il fine-tuning supervisionato (SFT), dimostrando che integrare l'RL prima nel pre-addestramento, ottimizzare la composizione dei dati e fondere l'RL con gli obiettivi di SFT può potenziare efficacemente le capacità di ragionamento ed espandere le distribuzioni del modello preservando al contempo le abilità generali.

Autori originali: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

Pubblicato 2026-06-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di stare addestrando uno studente brillante ma inesperto (il modello AI) per risolvere problemi di matematica. Per anni, la ricetta standard è stata composta da tre fasi:

  1. Pre-addestramento: Lo studente legge milioni di libri per imparare il linguaggio generale e i fatti.
  2. SFT (Fine-Tuning Supervisionato): Un insegnante dà allo studente un libro di testo con i problemi e le loro risposte esatte, costringendolo a memorizzare il percorso della soluzione.
  3. RL (Apprendimento per Rinforzo): Lo studente viene messo in un gioco dove riceve punti solo se indovina la risposta finale, incoraggiandolo a trovare nuovi modi per risolvere i problemi da solo.

Questo articolo si chiede: Dobbiamo davvero aspettare che lo studente abbia letto tutti i libri e memorizzato il libro di testo prima di lasciarlo giocare al gioco?

Ecco cosa hanno scoperto i ricercatori, spiegato in modo semplice:

1. Puoi iniziare il gioco presto

La regola standard dice: "Aspetta che lo studente sia completamente addestrato prima di dargli il gioco". I ricercatori hanno provato a dare il gioco (RL) allo studente mentre stava ancora leggendo i suoi primi capitoli (all'inizio del pre-addestramento).

  • Il Risultato: Ha funzionato sorprendentemente bene! Anche quando lo studente aveva letto solo una minima frazione dei libri, giocare al gioco lo aiutava a risolvere i problemi matematici molto meglio rispetto al semplice leggere più libri. Infatti, giocare al gioco presto era spesso altrettanto efficace che aspettare la fine e fare l'intero percorso "Leggi → Memorizza → Gioca".

2. Il "Gioco" è migliore quando non hai un libro di testo

Di solito, la fase di "Memorizzazione" (SFT) richiede un libro di testo con le risposte corrette. Ma cosa succede se non hai abbastanza libri di testo?

  • La Scoperta: Se hai solo uno o due esempi di come risolvere un problema, la fase di "Memorizzazione" (SlFT) fallisce. Ma il "Gioco" (RL) prospera. Lo studente impara a esplorare e a trovare soluzioni da solo senza bisogno di una chiave di risposta perfetta. Il gioco è un insegnante molto più forte quando hai pochi esempi a disposizione.

3. L'ingrediente segreto è il Tipo di Libri, non la dimensione dello Studente

Le persone spesso pensano: "Se lo studente è più grande (più potente), imparerà meglio". I ricercatori hanno testato questo aspetto rendendo lo studente più grande.

  • Il Colpo di Scena: Rendere lo studente più grande non lo ha aiutato ad imparare il gioco più velocemente. Tuttavia, dargli più libri di matematica specificamente durante la sua fase iniziale di lettura ha fatto la differenza.
  • La Lezione: Se vuoi che lo studente sia bravo in matematica, dagli storie di matematica fin dall'inizio. Il contenuto di ciò che legge conta più di quanto sia grande il suo cervello.

4. Il mito dell' "Affilatura" vs. l' "Espansione"

C'è un dibattito recente: Il "Gioco" (RL) rende solo le risposte esistenti dello studente più affilate e sicure, o insegna davvero loro nuovi modi di pensare?

  • La Vecchia Visione: Molti pensavano che l'RL servisse solo ad "affilare" lo studente, rendendolo sicuro di sé ma non necessariamente più intelligente.
  • La Nuova Scoperta: I ricercatori hanno scoperto che l'effetto di "affilatura" avviene in realtà a causa della fase di "Memorizzazione" (SFT). Quando costringi uno studente a memorizzare prima un libro di testo, gli impedisci di esplorare.
  • La Vera Magia: Se lasci che lo studente giochi al gioco direttamente senza memorizzare prima il libro di testo, egli in realtà espande il suo pensiero. Prova molti percorsi diversi e scopre nuove soluzioni che non conosceva prima. La fase di "Memorizzazione" è ciò che limita la sua creatività, non il gioco stesso.

5. La ricetta dello "Super-Studente"

I ricercatori hanno combinato il meglio di entrambi i mondi. Invece di fare "Memorizza" poi "Gioca", hanno fatto sì che lo studente facesse entrambi contemporaneamente.

  • Come funziona: Immagina lo studente che risolve un problema. Una parte del suo cervello sta controllando il libro di testo (SFT), e un'altra parte sta sperimentando nuove idee (RL). Essi mediano i consigli di entrambe le parti per aggiornare il loro cervello.
  • Il Risultato: Questo "Super-Studente" (Mediazione Parallela) è diventato il migliore nel risolvere problemi. Otteneva le risposte corrette più spesso di chiunque altro e, a differenza degli studenti che hanno solo memorizzato il libro di testo, non ha dimenticato come fare altre cose (come la conversazione generale).

Sintesi dei punti chiave

  • Non aspettare: Puoi usare l'Apprendimento per Rinforzo (il gioco) molto presto nella vita di un modello, anche prima che abbia finito la sua fase di "lettura".
  • I dati contano più della dimensione: Nutrire il modello con dati specifici (come la matematica) durante il pre-addestramento è più importante che rendere semplicemente il modello più grande.
  • L'RL non è il cattivo: L'RL non rovina le abilità generali di un modello né serve solo ad "affilarlo". Quegli effetti negativi derivano dalla fase di "Memorizzazione" (SFT). L'RL aiuta effettivamente i modelli a esplorare e trovare nuove soluzioni.
  • Fallo insieme: I risultati migliori si ottengono mescolando le fasi di "Memorizzazione" e "Gioco" simultaneamente, invece di farle una dopo l'altra.

In breve, il paper suggerisce che dovremmo smettere di trattare l'Apprendimento per Rinforzo come una lucidatura finale alla fine del processo. Inveve, dovremmo intrecciarlo nel processo di addestramento molto prima e mescolarlo con altri metodi per ottenere modelli più intelligenti e capaci.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →