← Ultimi articoli
🤖 AI

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

Questo articolo introduce un nuovo framework che analizza i percorsi di ragionamento a livello di traiettoria e di singolo passo per rivelare che l'Apprendimento per Rinforzo con Ricompense Verificabili (RLVR) comprime le traiettorie errate e concentra il ragionamento in meno passi, mentre il Fine-Tuning Supervisionato (SFT) espande le traiettorie corrette e distribuisce il ragionamento su molti passi, spiegando così il successo complementare dell'attuale paradigma di addestramento in due fasi.

Autori originali: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Pubblicato 2026-05-28
📖 6 min di lettura🧠 Approfondimento

Autori originali: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Quadro Generale: Due Modi per Insegnare a un Robot a Pensare

Immagina di avere un robot che è bravo a parlare ma non eccelle nel risolvere complessi problemi di matematica o di programmazione. Per renderlo più intelligente, i ricercatori utilizzano due principali metodi di addestramento:

  1. SFT (Fine-Tuning Supervisionato): Questo è come l'imitazione. Mostri al robot un esempio perfetto di come un esperto umano risolve un problema, passo dopo passo, e dici: "Fai esattamente questo".
  2. RL (Apprendimento per Rinforzo): Questo è come il tentativo ed errore con una scheda di punteggio. Lasci che il robot provi a risolvere il problema da solo. Se ottiene la risposta corretta, riceve una "stellina d'oro" (ricompensa). Se sbaglia, non riceve nulla. Col tempo, impara a evitare i percorsi che portano al fallimento.

Il documento si chiede: Cosa succede esattamente nel cervello del robot quando utilizziamo questi due metodi diversi? Cambiano come il robot pensa, o solo cosa risponde?

Gli autori hanno scoperto che questi due metodi fanno cose opposte al "processo di pensiero" del robot.


Analogia 1: La "Pista di Ragionamento" (Livello della Traiettoria)

Immagina il processo di pensiero del robot come un escursionista che cammina attraverso una vasta foresta nebbiosa per trovare un tesoro nascosto (la risposta corretta). Ci sono molti percorsi: alcuni portano al tesoro, mentre molti altri portano a vicoli ciechi o scogliere.

  • SFT (L'Imitatore) "Espande" i Percorsi Buoni:
    Quando mostri al robot la mappa di un esperto (SFT), impara a camminare sul percorso corretto. Ma ecco il punto critico: inizia anche a camminare su molte diverse variazioni di quel percorso corretto. Diventa molto creativo e diversificato nel modo in cui trova il tesoro.

    • Il Punto Critico: Non smette di camminare sui percorsi cattivi. Se il robot stava già vagando in una palude (commettendo errori), l'SFT gli insegna nuovi modi di camminare, ma potrebbe ancora vagare nella palude occasionalmente. "Espande" il numero di percorsi corretti, ma non necessariamente elimina quelli sbagliati.
  • RL (Il Punteggiatore) "Stringe" i Percorsi Cattivi:
    Quando lasci che il robot giochi al gioco con le ricompense (RL), capisce rapidamente che i percorsi della palude portano a zero punti. Quindi, smette di camminarci. "Stringe" tutti i percorsi errati, confusi o che portano a vicoli ciechi, facendoli scomparire.

    • Il Punto Critico: Tende anche a "stringere" i percorsi buoni. Potrebbe smettere di esplorare le variazioni creative della risposta corretta e attenersi solo al percorso che sa funzionare meglio. Diventa molto focalizzato, ma meno diversificato.
  • La Combinazione Vincente (SFT + RL):
    Il documento spiega perché la pratica corrente migliore è fare prima SFT, poi RL.

    1. Prima, usa SFT per insegnare al robot nuovi modi per trovare il tesoro (espandendo i percorsi corretti).
    2. Poi, usa RL per punire il robot per il vagare nella palude (stringendo i percorsi errati).
    • Risultato: Ottieni un robot che conosce molti modi per risolvere il problema ma è molto disciplinato nell'evitare gli errori.

Analogia 2: La "Città dei Pensieri" (Livello del Passo)

Ora, esaminiamo il pensiero del robot non come un singolo percorso, ma come una mappa della città. Ogni "passo" nel ragionamento (come "calcolare l'area" o "verificare la formula") è un edificio in questa città. Le connessioni tra i passi sono le strade.

  • RL Crea una Città "Hub e Raggi":
    Dopo l'addestramento RL, la città cambia. Il robot inizia a fare affidamento pesantemente su pochi edifici specifici e super-importanti (hub). Visita questi passaggi chiave ripetutamente.

    • L'Effetto: La città diventa molto efficiente ma affollata intorno a questi pochi punti. Il robot concentra la sua "potenza di pensiero" in un piccolo numero di passaggi critici. È come un pendolare che usa solo tre ponti specifici per attraversare il fiume, ignorando tutti gli altri.
  • SFT Crea una Città "Distribuita":
    Dopo l'addestramento SFT, la città appare diversa. Il robot distribuisce il suo pensiero. Visita molti edifici diversi, e nessun singolo edificio viene visitato in modo così schiacciante come nella città RL.

    • L'Effetto: Il pensiero è "omogeneizzato" o distribuito uniformemente. È come una città dove tutti usano una vasta varietà di strade, e nessuna singola strada è un ingorgo.

La Scoperta Chiave:

  • RL rende il pensiero del robot intenso e focalizzato su pochi passaggi chiave (Stringendo).
  • SFT rende il pensiero del robot ampio e distribuito su molti passaggi (Espandendo).

La Forma della Città (Topologia)

I ricercatori hanno anche esaminato la "forma" di queste città di pensiero utilizzando la geometria.

  • Il Modello Base (Prima dell'addestramento): La città è divisa in quartieri isolati (comunità). È difficile passare da un quartiere all'altro. Il robot rimane intrappolato in loop locali.
  • RL: Abbatte i muri tra i quartieri. Crea una città dominata da pochi enormi "hub" che collegano tutto insieme. Questo rende il robot molto veloce nel trovare la risposta se colpisce l'hub giusto, ma si affida a quegli hub specifici.
  • SFT: Abbatte anche i muri, ma invece di creare hub, costruisce una rete in cui tutto è connesso a tutto il resto. Questo rende la città molto robusta e facile da navigare da qualsiasi punto a qualsiasi altro punto.

Riepilogo delle Affermazioni del Documento

  1. RL è un "Stringitore": Frantuma i percorsi di pensiero errati e concentra il ragionamento del robot in pochi passaggi altamente efficienti e ad alto traffico. Rende il robot molto bravo a ottenere la risposta corretta al primo tentativo (Pass@1) eliminando le opzioni sbagliate.
  2. SFT è un "Espansore": Insegna al robot nuovi, corretti modi di pensare e distribuisce il carico del ragionamento su molti passaggi. Tuttavia, non elimina automaticamente i percorsi cattivi che il robot potrebbe aver usato in precedenza.
  3. Perché SFT + RL Funziona: I migliori risultati derivano dall'uso di SFT per insegnare al robot come pensare correttamente (espandendo i percorsi buoni) e poi dell'uso di RL per costringerlo a smettere di commettere errori (stringendo i percorsi cattivi).
  4. La Struttura Conta: RL crea una struttura di ragionamento "pesante sugli hub", mentre SFT crea una struttura "distribuita". Entrambe sono diverse dalla struttura "frammentata" di un modello non addestrato.

Il documento conclude che comprendere queste differenze meccaniche aiuta a spiegare perché la ricetta attuale di addestramento "a due stadi" (SFT seguito da RL) è così efficace per creare AI di ragionamento intelligenti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →