← Ultimi articoli
🤖 machine learning

Weight-Space Geometry of Offline Reasoning Training

Questo articolo analizza la geometria dello spazio dei pesi di sei metodi di addestramento del ragionamento offline su un modello Qwen3-4B, rivelando che mentre SFT, RFT e RIFT convergono verso aggiornamenti quasi collineari con accuratezza simile, DPO adotta un sottospazio distinto e quasi ortogonale che raggiunge prestazioni significativamente superiori sui benchmark GSM8K e AIME26, mentre Offline GRPO introduce una componente ortogonale sostanziale pur rimanendo all'interno del bacino di perdita di SFT.

Autori originali: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Pubblicato 2026-06-24
📖 5 min di lettura🧠 Approfondimento

Autori originali: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un brillante e gigante tutor di matematica (l' "Insegnante") che sa risolvere problemi complessi. Vuoi insegnare a uno studente più piccolo e meno costoso (lo "Studente") a pensare come quel tutor. Fornisci allo studente le soluzioni passo dopo passo dell'insegnante (chiamate "rollout") e gli chiedi di imparare da esse.

Il documento pone una domanda semplice ma profonda: importa come diciamo allo studente di imparare?

Esistono molte diverse "formule di insegnamento" (funzioni di perdita o loss functions) che i ricercatori utilizzano. Alcuni dicono: "Guarda solo le risposte corrette". Altri dicono: "Guarda tutte le risposte, ma dai crediti extra a quelle buone". Altri ancora dicono: "Confronta le risposte buone con quelle cattive".

Gli autori volevano sapere: queste diverse formule fanno cambiare il cervello dello studente (i pesi del computer) nello stesso modo, o creano tipi di pensatori completamente diversi?

Ecco la ripartizione delle loro scoperte, utilizzando analogie semplici:

1. Il gruppo "Imitatore" (SFT, RFT, RIFT)

L'analogia: Immagina tre studenti che cercano di copiare un disegno.

  • Lo Studente A copia ogni singola linea.
  • Lo Studente B copia solo le linee che sono perfette.
  • Lo Studente C copia ogni linea, ma disegna quelle perfette in modo leggermente più scuro.

La scoperta: Anche se usano regole leggermente diverse, finiscono tutti per disegnare quasi esattamente lo stesso disegno.

  • Matematicamente, i cambiamenti ai loro cervelli sono quasi identici (97% di somiglianza).
  • Ottengono tutti circa lo stesso punteggio nei test di matematica (intorno all'87–88%).
  • Conclusione: Se vuoi solo che uno studente imiti il ragionamento dell'insegnante, non importa molto quale di queste tre specifiche formule utilizzi. Stanno effettivamente facendo la stessa cosa.

2. L' "Auto-regolatore" (DFT)

L'analogia: Questo studente usa la stessa carta dello Studente A, ma ha un'abitudine strana: rende automaticamente la penna più leggera quando è già sicuro di sé e più scura quando non lo è.

La scoperta: Questo piccolo accorgimento cambia significativamente la direzione del disegno. Il cervello di questo studente cambia in un modo molto diverso da quello del gruppo Imitatore, anche se non ha usato alcun punteggio di "ricompensa" per guidarlo. È un percorso unico, ma non porta necessariamente a un punteggio migliore.

3. Il "Passo Laterale" (Offline GRPO)

L'analogia: Questo studente guarda il lavoro dell'insegnante ma decide di fare un grande passo laterale. Rimane comunque nella stessa zona generale (il "bacino di perdita" o loss basin), ma sta percorrendo un sentiero diverso.

La scoperta: Questo metodo spinge il cervello dello studente in una direzione che è 67% diversa da quella del gruppo Imitatore. Negli strati successivi del cervello (i "pensieri finali"), questa differenza cresce fino a quasi l'86%.

  • Tuttavia, ottengono ancora un punteggio simile (circa 87%).
  • Conclusione: Questo metodo esplora una nuova direzione, ma non sembra sbloccare un "superpotere" in termini di accuratezza rispetto agli Imitatori.

4. L' "Outlier" (DPO)

L'analogia: Mentre tutti gli altri stanno disegnando sulla stessa carta nella stessa stanza, questo studente sta disegnando su una tela completamente diversa, in una stanza diversa, con uno stile del tutto differente.

La scoperta:

  • Geometria: I cambiamenti al cervello di questo studente sono quasi a 90 gradi (ortogonali) rispetto a tutti gli altri. Sta facendo qualcosa di fondamentalmente diverso.
  • La Barriera: Se provassi a mescolare il cervello di questo studente con quello del gruppo Imitatore (un'interpolazione lineare), il risultato si romperebbe. Si trovano in "universi" di soluzioni differenti.
  • Il Punteggio: Nonostante sia così diverso, questo studente ha ottenuto i punteggi più alti (93,5% in matematica, 30% nei puzzle difficili).
  • Il Rovescio della Medaglia: Questo studente è stato addestrato con un learning rate 10 volte più piccolo (ha fatto passi molto più piccoli e cauti). Gli autori avvertono che non possiamo essere sicuri al 100% se l'alto punteggio sia dovuto alla formula o solo al fatto che ha fatto passi più piccoli e precisi.

5. La sorpresa "Dal vivo vs Registrato"

Il documento ha anche esaminato cosa succede se lo studente impara dalla pratica dal vivo (Online) rispetto alla pratica registrata (Offline).

  • Offline: Quando impara da un set fisso di risposte registrate dell'insegnante, lo studente del "Passo Laterale" (Offline GRPO) rimane abbastanza vicino agli Imitatori.
  • Online: Quando lo studente genera i propri problemi di pratica (Online GRPO), diventa completamente ortogonale (totalmente diverso) rispetto agli Imitatori.
  • Conclusione: Il fatto che i metodi "Offline" sembrino simili agli Imitatori è dovuto in parte al fatto che stanno tutti fissando lo stesso identico set di risposte fisse dell'insegnante. Se li lasci generare la propria pratica, divergono selvaggiamente.

Riassunto

  • La maggior parte dei metodi (SFT, RFT, RIFT) sono solo modi diversi per dire "Copia l'insegnante". Risultano nella stessa struttura cerebrale e punteggi simili.
  • DPO è l'outlier. Costruisce una struttura cerebrale completamente diversa. Ottiene i punteggi migliori, ma lo fa con uno stile di addestramento molto specifico e cauto (piccolo learning rate) che rende difficile il confronto diretto con gli altri.
  • La natura "Offline" dei dati di addestramento è una ragione importante per cui molti di questi metodi finiscono per apparire così simili tra loro.

Il documento mappa essenzialmente la "geografia" di questi metodi di apprendimento, mostrando quali sono vicini di casa e quali vivono su pianeti diversi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →