← Ultimi articoli
💬 NLP

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

Questo articolo introduce GTPO e GRPO-S, due nuovi algoritmi di apprendimento per rinforzo che migliorano il ragionamento dei Large Language Model implementando una modellazione dinamica della ricompensa basata sull'entropia per ottenere un'assegnazione del credito granulare, a livello di token e di sequenza, superando così i limiti a grana grossa di metodi esistenti come GRPO e DAPO.

Autori originali: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Pubblicato 2026-02-06
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Grande Problema: Il Voto "Tutto o Niente"

Immaginate di insegnare a uno studente (l'IA) a risolvere un problema di matematica molto lungo e complesso. Lo studente scrive una soluzione di 50 passaggi.

  • I passaggi dal 1 al 49 sono brillanti, logici e corretti.
  • Il passaggio 50 (la risposta finale) è sbagliato a causa di un piccolo errore di calcolo.

Con i metodi mainstream attuali (come GRPO), l'insegnante guarda il risultato finale, vede che è sbagliato e dà a tutto il saggio di 50 passaggi un voto insufficiente (0 punti).

  • Il Risultato: Lo studente pensa: "Oh, immagino che anche i passaggi dal 1 al 49 fossero inutili". Dimentica le parti buone e la prossima volta potrebbe provare un approccio completamente diverso e casuale.
  • Il Difetto: Questo è chiamato assegnazione del credito a grana grossa (coarse-grained credit assignment). Tratta l'intera catena di pensiero come un unico blocco, ignorando che gran parte di essa era in realtà perfetta.

La Soluzione: La Bussola dell' "Entropia"

Gli autori di questo paper propongono un nuovo modo per dare il voto allo studente. Introducono un concetto chiamato Entropia della Politica (Policy Entropy).

Pensate all'Entropia come a una misura di "pensare intensamente" o di "incertezza".

  • Bassa Entropia: Lo studente è molto sicuro di sé. Sta solo scrivendo ciò che già sa (es. "1 + 1 = 2").
  • Alta Entropia: Lo studente si ferma, considera più opzioni e lotta con una scelta difficile. Sta esplorando diversi percorsi.

Il paper sostiene che l'Alta Entropia è buona quando sei giusto (significa che hai esplorato il percorso corretto con attenzione), ma l'Alta Entropia è cattiva quando sei sbagliato (significa che stavi indovinando con sicurezza nella direzione sbagliata).

I Due Nuovi Algoritmi

Il paper introduce due nuovi "insegnanti" (algoritmi) che usano questa bussola dell'Entropia per dare un feedback migliore.

1. GTPO (Group Token Policy Optimization)

L'Analogia: L'Insegnante con l' "Evidenziatore"
Invece di valutare l'intero saggio in una volta sola, GTPO valuta ogni singola parola (token) individualmente.

  • Se il saggio è Corretto: L'insegnante evidenzia le parole dove lo studente ha esitato o esplorato diverse opzioni (Alta Entropia) e dà loro dei punti bonus extra. Questo dice allo studente: "Ottimo lavoro nel pensare intensamente a quel passaggio specifico!"
  • Se il saggio è Errato: L'insegnante cerca le parole dove lo studente era troppo sicuro di sé ma ha sbagliato (Bassa Entropia). A queste parole assegna una pesante penalità. Questo dice allo studente: "Eri troppo sicuro di te qui, e hai sbagliato. Non essere così sicuro la prossima volta."

Perché aiuta: Salva le parti buone del ragionamento e punisce i momenti specifici di eccessiva fiducia che hanno portato al fallimento.

2. GRPO-S (Sequence-Level GRPO)

L'Analogia: L'Insegnante della "Pagella"
A volte, valutare ogni singola parola è troppo lento o computazionalmente pesante. GRPO-S è una versione più leggera.

  • Invece di guardare le singole parole, osserva l'impegno medio di "pensiero" dell'intero saggio.
  • Se il saggio è Corretto: Controlla: "Lo studente ha generalmente pensato intensamente ed esplorato?" Se sì, l'intero saggio riceve una spinta positiva.
  • Se il saggio è Errato: Controlla: "Lo studente era sicuramente sbagliato?" Se sì, l'intero saggio riceve una penalità maggiore.

Perché aiuta: È più veloce ma comunque più intelligente del vecchio metodo "Tutto o Niente". È particolarmente efficace nel mantenere stabile lo studente durante compiti di ragionamento molto lunghi.

I Risultati: Cosa è Successo?

Gli autori hanno testato questi nuovi insegnanti su difficili benchmark matematici (come AIME e MATH).

  • Il Vecchio Modo (GRPO/DAPO): Lo studente spesso si incagliava. O rinunciava troppo velocemente o rimaneva "bloccato" in un ciclo di risposte sicure ma errate (Collasso della Politica/Policy Collapse).
  • Il Nuovo Modo (GTPO/GRPO-S):
    • Esplorazione: Gli studenti hanno continuato a provare diversi percorsi più a lungo perché venivano premiati per "pensare intensamente" (alta entropia) quando avevano ragione.
    • Precisione: Hanno imparato a non essere erroneamente sicuri di sé.
    • Performance: Hanno ottenuto punteggi significativamente più alti in problemi matematici difficili, risolvendo catene di ragionamento più complesse rispetto a prima.

Riassunto in una frase

Questo paper insegna ai modelli di IA a smettere di trattare una lunga catena di pensiero come un singolo voto "passato o fallito", e invece fornisce loro una pagella dettagliata che premia il pensare intensamente quando si è nel giusto e l'essere umili quando si è nel torto, portando a un ragionamento molto più intelligente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →