← Ultimi articoli
💬 NLP

Group Entropy-Controlled Policy Optimization

Questo articolo introduce la Group Entropy-Controlled Policy Optimization (GEPO), un'estensione leggera alla GRPO che affronta i limiti della regolazione dell'entropia globale nei compiti di RL eterogenei utilizzando stime dell'entropia a livello di gruppo per eseguire una modellazione asimmetrica del vantaggio, bilanciando così esplorazione e sfruttamento per ottenere prestazioni superiori tra i diversi compiti.

Autori originali: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Pubblicato 2026-07-21
📖 1 min di lettura☕ Lettura da pausa caffè

Autori originali: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Riepilogo Tecnico: Group Entropy-Controlled Policy Optimization (GEPO)

1. Definizione del Problema

L'Apprendimento per Rinforzo (RL) è diventato un paradigma dominante per il post-training dei Large Language Models (LLM) al fine di migliorare l'allineamento e il ragionamento. Tuttavia, bilanciare il compromesso tra esplorazione ed esploitazione rimane una sfida critica, in particolare quando si addestra su miscele di task eterogenee (ad esempio, combinando matematica, coding, fisica e instruction following).

Gli attuali metodi di controllo dell'entropia in RL operano principalmente a due granularità:

  1. Livello di policy: Calcolo dell'entropia sull'intero batch e applicazione di un segnale di regolazione uniforme (Figura 1a).
  2. Livello di token: Calcolo della covarianza dei token e regolazione dei singoli token (Figura 1b).

Il documento identifica un difetto fondamentale in questi approcci quando applicati al Group Relative Policy Optimization (GRPO): l'Eterogeneità dell'Entropia. Diversi domini di task esibiscono regimi di entropia distinti sotto la stessa policy. Ad esempio, i prompt di fisica possono naturalmente concentrarsi attorno a una bassa entropia, mentre i prompt di instruction-following esibiscono un'alta entropia.

Questa eterogeneità induce due patologie specifiche nel GRPO standard:

  • Bias dipendente dall'entropia: La normalizzazione degli advantage all'interno dei gruppi crea segnali statisticamente non comparabili tra gruppi con diversi livelli di entropia. I gruppi a bassa entropia (spesso task ad alta accuratezza) producono segnali di gradiente forti e coerenti, mentre i gruppi ad alta entropia (spesso task a bassa accuratezza) producono segnali deboli e rumorosi.
  • Squilibrio dell'ottimizzazione: L'ottimizzazione a livello di batch viene dominata dai task a bassa entropia, causando una diminuzione dei segnali di apprendimento per i task ad alta entropia. Ciò porta a un ciclo di auto-rinforzo in cui i task a bassa entropia convergono prematuramente, mentre i task ad alta entropia non riescono a esplorare efficacemente o soffrono di "entropia incontrollata" che porta a output degeneri.

2. Metodologia: GEPO

Gli autori propongono il Group Entropy-Controlled Policy Optimization (GEPO), un'estensione leggera e agnostica rispetto al modello di GRPO che esegue uno shaping dell'advantage asimmetrico condizionato all'entropia a livello di gruppo.

Meccanismo Core

GEPO utilizza l'Entropia di Gruppo (Hg\mathcal{H}_g), stimata dai campioni di gruppo esistenti di un prompt, come segnale diagnostico. Inveve di applicare un target di entropia globale, GEPO modella lo shaping del segnale di advantage (AiA_i) per ogni risposta in base allo stato di entropia del gruppo:

A^i=ω(Ai,Hg)Ai \hat{A}_i = \omega(A_i, \mathcal{H}_g) \cdot A_i

La funzione di shaping applica coefficienti di scaling asimmetrici (αlow,αhigh(0,1)\alpha_{low}, \alpha_{high} \in (0, 1)):

  • Gruppi a bassa entropia (Hg<Hlow\mathcal{H}_g < \mathcal{H}_{low}): Gli advantage positivi sono attenuati da αlow\alpha_{low}. Questo previene l'over-exploitation e la convergenza prematura nei task in cui il modello è già fiducioso.
  • Gruppi ad alta entropia (Hg>Hhigh\mathcal{H}_g > \mathcal{H}_{high}): Gli advantage negativi sono attenuati da αhigh\alpha_{high}. Questo previene la soppressione prematura dell'esplorazione nei task in cui il modello è incerto, permettendo alla policy di scoprire percorsi di ragionamento corretti.
  • Altrimenti: L'advantage rimane invariato.

Scelte di Design Chiave

  1. Shaping Asimmetrico (αhigh<αlow\alpha_{high} < \alpha_{low}): Gli autori osservano empiricamente che i gruppi a bassa entropia sono più fragili; una penalizzazione aggressiva degli advantage negativi in questi gruppi può innescare il "collasso della lunghezza" (dove il modello accorcia le risposte per ridurre l'incertezza). Pertoco, GEPO applica una spinta più dolce (αlow\alpha_{low} è più alto) ai gruppi a bassa entropia rispetto all'attenuazione più forte (αhigh\alpha_{high} è più basso) applicata ai gruppi ad alta entropia.
  2. Threshold Adaptive (Soglie Adattive): Le soglie di entropia fisse sono fragili tra diversi modelli base e fasi di addestramento. GEPO deriva le soglie (Hlow,Hhigh\mathcal{H}_{low}, \mathcal{H}_{high}) dinamicamente dalla distribuzione dell'entropia del batch (media e deviazione standard) e le ammorbidisce usando una Media Mobile Esponenziale (EMA). Ciò consente al metodo di calibrarsi automaticamente sulla scala di entropia specifica del modello base senza tuning specifico per il task.

3. Contributi Chiave

  • Insight Teorico: Il documento fornisce un'analisi teorica (Proposizioni 2.1 e 2.2) dimostrando che gli advantage normalizzati in GRPO sono strutturalmente distorti dall'entropia di gruppo. Dimostra che la discrepanza tra le distribuzioni di reward pesate dalla policy e quelle di riferimento è dipendente dall'entropia, portando a segnali di advantage non comparabili tra task eterogenei.
  • Innovazione Algoritmica: GEPO introduce il primo meccanismo di controllo dell'entropia a livello di gruppo che esegue uno shaping asimmetrico dell'advantage. A differenza dei metodi precedenti che trattano l'entropia come una proprietà globale o a livello di token, GEPO tratta l'entropia come un diagnostico del gruppo di prompt per riequilibrare le pressioni di ottimizzazione.
  • Implementazione a Costo Zero: Il metodo non richiede campionamento aggiuntivo o stima della funzione di valore. Sfrutta i campioni di gruppo esistenti in GRPO, aggiungendo un carico computazionale trascurabile.

4. Risultati Sperimentali

Gli autori hanno valutato GEPO su due modelli base (Intern-S1-mini e Qwen3.5-9B) attraverso tredici benchmark che coprono matematica, fisica, scienze, generazione di codice e instruction following.

  • Performance: GEPO ha superato costantemente GRPO e i recenti baseline controllati dall'entropia (AEPO, Clip_Cov, KL_Cov).
    • Su Intern-S1-mini, GEPO ha ottenuto il miglior punteggio medio (54.2) e ha vinto su 7 dei 13 benchmark, inclusi guadagni significativi su AIME25, IMO-Bench e GPQA.
    • Su Qwen3.5-9B, GEPO ha ottenuto il punteggio medio più alto (71.2), superando solidi baseline come Clip_Cov (70.9) e KL_Cov (69.9).
  • Stabilità: GEoma ha dimostrato una stabilità di addestramento superiore. Mentre GRPO ha subito un collasso delle prestazioni catastrofico (ad esempio, su Qwen3.5-9B intorno allo step 170) a causa di una crescita incontrollata dell'entropia, e AEPO ha mostrato oscillazioni persistenti, GEPO ha mantenuto curve di validazione lisce e in miglioramento monotono.
  • Dinamiche dell'Entropia: L'analisi delle dinamiche di addestramento ha mostrato che GEPO preserva livelli di esplorazione differenziati tra i task. A differenza di AEPO, che forza un pattern di entropia uniforme, GEPO permette ai task che richiedono una vasta esplorazione di mantenere un'entropia più alta, mentre i task deterministici si assestano su un'entropia più bassa, prevenendo sia il collasso prematuro che l'entropia incontrollata.

5. Significato e Rivendicazioni

Il documento sostiene che GEPO affronta una lacuna critica nel post-training RL multi-task: l'incapacità degli attuali metodi di gestire il bias strutturale introdotto dall'eterogeneità dell'entropia tra diversi task.

Gli autori affermano che:

  1. La Regolazione Specifica per Task è Essenziale: Spingere task eterogenei verso un pattern di entropia uniforme è subottimale. L'apprendimento multi-task efficace richiede la preservazione dei regimi di esplorazione specifici per ogni task.
  2. L'Asimmetria è Cruciale: La fragilità dei gruppi a bassa entropia necessita di un approccio asimmetrico allo shaping dell'advantage per evitare il collasso della lunghezza pur incoraggiando l'esplorazione.
  3. Scalabilità: Basandosi sull'entropia di gruppo stimata dai rollout esistenti e su soglie adattive, GEPO offre una soluzione scalabile e agnostica rispetto al modello che migliora sia la performance media che l'equilibrio tra i task senza richiedere annotazioni specifiche per il task o costi di campionamento aggiuntivi.

In conclusione, il documento posiziona GEPO come un framework robusto per stabilizzare l'addestramento RL in scenari complessi di post-training di LLM multi-dominio, garantendo che il processo di ottimizzazione rispetti l'incertezza intrinseca e la diversità dei diversi tipi di task.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →