SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR
Questo articolo dimostra che un eccessivo Supervised Fine-Tuning (SFT) può comprimere la distribuzione dei rollout, causando un collasso dell'entropia che porta all'inversione del rango e al degrado delle prestazioni nel successivo addestramento tramite Group Relative Policy Optimization (GRPO), un modo di fallimento che può essere previsto e mitigato monitorando l'entropia pre-RL e la dinamica iniziale del GRPO.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il quadro generale: La trappola della "Perfezione Eccessiva"
Immaginate di stare addestrando un robot a scrivere codice. La ricetta standard prevede due passaggi:
- Fine-Tuning Supervisionato (SFT): Mostrate al robot migliaia di esempi di codice corretto affinché impari i pattern.
- Apprendimento per Rinforzo (RL): Lasciate che il robot provi a risolvere nuovi problemi da solo. Se ci riesce, riceve un premio (una ricompensa); se fallisce, non riceve nulla.
Il Problema: Il paper ha scoperto che se addestrate il robot troppo nel Passaggio 1 (Overtraining dell'SFT), questo diventa effettivamente peggio nel Passaggio 2.
Di solito pensiamo: "Più esempi il robot memorizza nel Passaggio 1, meglio sarà". Gli autori hanno scoperto l'opposto: il robot che memorizza di più nel Passaggio 1 è in realtà quello che performa peggio nel Passaggio 2. Infatti, il robot che memorizza meno finisce per essere il campione.
La Metafora: Il Ballerino Rigido vs Il Ballerino Flessibile
Per capire perché accade questo, immaginateate due ballerini che si preparano per una competizione dove devono improvvisare una coreografia basata su musica casuale.
- Il Ballerino "Sovra-addestrato" (SFT Profondo): Questo ballerino ha praticato le stesse 10 coreografie perfette migliaia di volte. È incredibilmente preciso. Ma quando la musica cambia, si blocca. Conosce solo quelle 10 mosse. Non ha idea di come muoversi in nessun altro modo.
- Il Ballerino "Giusto quanto basta" (SFT Superficiale): Questo ballerino ha praticato le basi ma ha mantenuto il corpo sciolto e flessibile. Conosce le regole, ma può ancora ondeggiare, torcersi e provare cose nuove quando la musica cambia.
La Competizione (RL):
La competizione richiede ai ballerini di provare molte mosse diverse contemporaneamente per vedere quale funziona meglio.
- Il Ballerino Sovra-addestrato prova a fare la stessa identica mossa perfetta ogni volta. Poiché sono tutte uguali, i giudici (l'algoritmo) non riescono a capire quale mossa sia migliore. Il ballerino rimane bloccato e non riesce a imparare nulla di nuovo.
- Il Ballerino Flessibile prova una grande varietà di mosse. I giudici possono dire: "Ah, questa mossa ha funzionato, quella no!" e il ballerino impara rapidamente.
Il "Perché" Tecnico: Il Collasso dell'Entropia
Il paper usa una parola sofisticata per indicare "varietà" o "flessibilità": Entropia.
- Collasso dell'Entropia: Quando il robot è sovra-addestrato, la sua "mente" diventa troppo stretta. Smette di esplorare diverse possibilità e si limita a ripetere le stesse poche risposte. In termini tecnici del paper, la sua entropia collassa.
- Il Segnale Muore: L'algoritmo di apprendimento (chiamato GRPO) funziona confrontando risposte diverse. Se il robot dà la stessa risposta 8 volte di seguito, l'algoritmo si confonde. Non può calcolare un "gradiente" (una direzione per migliorare) perché non c'è differenza da confrontare. È come cercare di sterzare un'auto quando il volante è bloccato dritto davanti a sé.
- L'Inversione del Ranking: Questo porta a un risultato bizzarro chiamato Inversione del Ranking.
- Prima della seconda fase di addestramento, il robot sovra-addestrato sembra un genio (ottiene la risposta corretta il 100% delle volte nel test di pratica).
- Dopo la seconda fase di addestramento, diventa un disastro.
- Nel frattempo, il robot "meno perfetto", che all'inizio sembrava leggermente peggiore, diventa la superstar.
I Due Modelli: Una Storia di Due Città
Gli autori hanno testato questo su due diversi cervelli robotici (modelli):
- Qwen (La Vittima): Questo modello è caduto nella trappola. Più lo addestravano nel Passaggio 1, più diventava rigido. Il checkpoint "migliore" (con il punteggio più alto) si è rivelato essere il punto di partenza peggiore per la fase successiva.
- DeepSeek (Il Sopravvissuto): Questo modello era naturalmente più flessibile. Anche dopo un addestramento pesante, non è diventato rigido. È rimasto nella "zona sicura" dove poteva ancora imparare. Questo ha dimostrato che il problema non era la seconda fase di addestramento in sé, ma specificamente come la prima fase avesse rovinato la flessibilità del modello Qwen.
La Soluzione: Un Controllo in Due Fasi
Gli autori non si sono limitati a trovare il problema; hanno costruito uno strumento diagnostico per individuarlo prima di sprecare tempo e denaro.
- Fase 1: Il Test di "Stretching" (Entropia Pre-RL): Prima di iniziare la seconda fase di addestramento, controllano quanto la mente del robot sia "sciolta". Se il robot è troppo rigido (bassa entropia), lo segnalano come ad alto rischio.
- Fase 2: Monitoraggio di "Allerta Precoce": Se iniziano la seconda fase, osservano i primi minuti. Se il robot smette di provare cose nuove e inizia immediatamente a ripetersi, interrompono l'addestramento per risparmiare risorse.
Cosa Non Ha Funzionato?
Gli autori hanno provato a riparare il robot rotto con trucchi standard, come:
- Aggiungere una penalità: "Non deviare troppo dal tuo addestramento originale". (Questo lo ha reso peggio).
- Levigare le etichette (Smoothing): "Sii un po' meno sicuro delle tue risposte". (Questo ha fatto sembrare il robot di nuovo sicuro di sé, ma ha fallito comunque la competizione).
La Conclusione: Non puoi riparare un ballerino rigido dicendogli di "impegnarsi di più" durante la competizione. Devi smettere di addestrarlo in modo così rigido fin dall'inizio. Il paper dimostra che la varietà (entropia) è più importante della perfezione quando vuoi che un modello continui a imparare.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.