← Nieuwste papers
💬 NLP

Group Entropy-Controlled Policy Optimization

Dit artikel introduceert Group Entropy-Controlled Policy Optimization (GEPO), een lichtgewicht uitbreiding van GRPO die de beperkingen van globale entropieregulatie in heterogene RL-taken aanpakt door groepsniveau-entropieschattingen te gebruiken om asymmetrische advantage-shaping uit te voeren, waardoor exploratie en exploitatie worden gebalanceerd om superieure cross-task prestaties te bereiken.

Oorspronkelijke auteurs: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Gepubliceerd 2026-07-21
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Group Entropy-Controlled Policy Optimization (GEPO)

1. Probleemstelling

Reinforcement Learning (RL) is een dominant paradigma geworden voor de post-training van Large Language Models (LLMs) om afstemming (alignment) en redeneren te verbeteren. Het balanceren van de exploratie-exploitatie-afweging blijft echter een kritieke uitdaging, met name bij het trainen op heterogene taakmengsels (bijv. het combineren van wiskunde, coderen, natuurkunde en instructievolging).

Huidige entropie-gecontroleerde RL-methoden opereren primair op twee granulariteiten:

  1. Policy-niveau: Het berekenen van entropie over de gehele batch en het toepassen van een uniform regulatiesignaal (Figuur 1a).
  2. Token-niveau: Het berekenen van token-covariantie en het reguleren van individuele tokens (Figuur 1b).

Het artikel identificeert een fundamenteel gebrek in deze benaderingen wanneer ze worden toegepast op Group Relative Policy Optimization (GRPO): Entropie-heterogeniteit. Verschillende taakdomeinen vertonen onder dezelfde policy verschillende entropie-regimes. Bijvoorbeeld, natuurkundige prompts kunnen van nature concentreren rond een lage entropie, terwijl instructievolgende prompts een hoge entropie vertonen.

Deze heterogeniteit induceert twee specifieke pathologieën in standaard GRPO:

  • Entropie-afhankelijke Bias: De normalisatie van voordelen (advantages) binnen groepen creëert statistisch niet-vergelijkbare signalen over groepen met verschillende entropieniveaus. Groepen met lage entropie (vaak taken met een hoge nauwkeurigheid) produceren sterke, consistente gradiëntsignalen, terwijl groepen met hoge entropie (vaak taken met een lage nauwkeurigheid) zwakke, ruisgevoelige signalen produceren.
  • Optimalisatie-imbalans: De optimalisatie op batch-niveau wordt gedomineerd door taken met lage entropie, waardoor taken met hoge entropie minder leer-signalen ontvangen. Dit leidt tot een zelfversterkende cyclus waarbij taken met lage entropie voortijdig convergeren, terwijl taken met hoge entropie niet effectief kunnen exploreren of lijden onder "runaway entropy" die leidt tot degeneratieve outputs.

2. Methodologie: GEPO

De auteurs stellen Group Entropy-Controlled Policy Optimization (GEPO) voor, een lichtgewicht, model-agnostische uitbreiding van GRPO die entropie-geconditioneerde asymmetrische advantage-shaping uitvoert op groepsniveau.

Kernmechanisme

GEPO maakt gebruik van Groep-entropie (Hg\mathcal{H}_g), geschat uit de bestaande gegroepeerde samples van een prompt, als een diagnostisch signaal. In plaats van een globale entropie-target toe te passen, vormt GEPO het advantage-signaal (AiA_i) voor elke respons op basis van de entropiestatus van de groep:

A^i=ω(Ai,Hg)Ai \hat{A}_i = \omega(A_i, \mathcal{H}_g) \cdot A_i

De shaping-functie past asymmetrische schaleringscoëfficiënten (αlow,αhigh(0,1)\alpha_{low}, \alpha_{high} \in (0, 1)) toe:

  • Groepen met lage entropie (Hg<Hlow\mathcal{H}_g < \mathcal{H}_{low}): Positieve advantages worden gedempt door αlow\alpha_{low}. Dit voorkomt over-exploitatie en voortijdige convergentie in taken waar het model al zelfverzekerd is.
  • Groepen met hoge entropie (Hg>Hhigh\mathcal{H}_g > \mathcal{H}_{high}): Negatieve advantages worden gedempt door αhigh\alpha_{high}. Dit voorkomt de voortijdige onderdrukking van exploratie in taken waar het model onzeker is, waardoor de policy in staat wordt gesteld correcte redeneerpaden te ontdekken.
  • Anders: Het advantage blijft ongewijzigd.

Belangrijke Ontwerpkeuzes

  1. Asymmetrische Shaping (αhigh<αlow\alpha_{high} < \alpha_{low}): De auteurs observeren empirisch dat groepen met lage entropie kwetsbaarder zijn; agressieve bestraffing van negatieve advantages in deze groepen kan "length collapse" triggeren (waarbij het model responsen inkort om onzekerheid te verminderen). Daarom past GEPO een mildere duw toe (αlow\alpha_{low} is hoger) op groepen met lage entropie vergeleken met de sterkere demping (αhigh\alpha_{high} is lager) die wordt toegepast op groepen met hoge entropie.
  2. Adaptieve Drempelwaarden: Vaste entropie-drempels zijn fragiel over verschillende basismodellen en trainingsfasen heen. GEPO afleidt drempelwaarden (Hlow,Hhigh\mathcal{H}_{low}, \mathcal{H}_{high}) dynamisch uit de entropie-distributie van de batch (gemiddelde en standaarddeviatie) en vlakt deze af met behulp van een Exponential Moving Average (EMA). Dit stelt de methode in staat om automatisch te kalibreren naar de specifieke entropie-schaal van het basismodel zonder taakspecifieke afstemming.

3. Belangrijkste Bijdragen

  • Theoretisch Inzicht: Het artikel biedt een theoretische analyse (Proposities 2.1 en 2.2) die aantoont dat genormaliseerde advantages in GRPO structureel beïnvloed worden door groep-entropie. Het bewijst dat het verschil tussen de policy-gewogen en de referentie-reward distributies entropie-afhankelijk is, wat leidt tot niet-vergelijkbare advantage-signalen over heterogene taken.
  • Algoritmische Innovatie: GEPO introduceert de eerste controlemechanisme op groepsniveau voor entropie dat asymmetrische advantage-shaping uitvoert. In tegenstelling tot eerdere methoden die entropie behandelen als een globaal of token-niveau eigenschap, behandelt GEPO het als een prompt-groep diagnostisch middel om de optimalisatiedruk te herbalanceren.
  • Implementatie zonder Extra Kosten: De methode vereist geen extra sampling of waarde-functie schatting. Het maakt gebruik van de bestaande gegroepeerde samples in GRPO, wat een verwaarloosbare computationele overhead toevoegt.

4. Experimentele Resultaten

De auteurs evalueerden GEPO op twee basismodellen (Intern-S1-mini en Qwen3.5-9B) over dertien benchmarks die wiskunde, natuurkunde, wetenschap, codegeneratie en instructievolging beslaan.

  • Prestaties: GEPO presteerde consequent beter dan GRPO en recente entropie-gecontroleerde baselines (AEPO, Clip-Cov, KL-Cov).
    • Op Intern-S1-mini behaalde GEPO de beste gemiddelde score (54.2) en won op 7 van de 13 benchmarks, inclusief significante winst op AIME25, IMO-Bench en GPQA.
    • Op Qwen3.5-9B behaalde GEPO de hoogste gemiddelde score (71.2), waarmee het sterke baselines zoals Clip-Cov (70.9) en KL-Cov (69.9) overtrof.
  • Stabiliteit: GEPO demonstreerde superieure trainingsstabiliteit. Terwijl GRPO leed onder catastrofale prestatie-instorting (bijv. op Qwen3.5-9B rond stap 170) door ongecontroleerde entropiegroei, en AEPO aanhoudende oscillaties vertoonde, handhaafde GEPO vloeiende, monotoon verbeterende validatiecurves.
  • Entropie-dynamiek: Analyse van de trainingsdynamiek toonde aan dat GEPO gedifferentieerde exploratieniveaus over taken behoudt. In tegen tegenstelling tot AEPO, dat een uniform entropiepatroon afdwingt, staat GEPO taken die brede exploratie vereisen toe om een hogere entropie te behouden, terwijl deterministische taken zich op een lagere entropie vestigen, wat zowel voortijdige instorting als runaway entropy voorkomt.

5. Betekenis en Claims

Het artikel beweert dat GEPO een kritiek gat in multi-task RL post-training adresseert: het onvermogen van huidige methoden om de structurele bias te hanteren die wordt geïntroduceerd door entropie-heterogeniteit over diverse taken.

De auteurs stellen dat:

  1. Taakspecifieke Regulatie Essentieel is: Het drijven van heterogene taken naar een uniform entropiepatroon is suboptimaal. Effectief multi-task leren vereist het behoud van taakspecifieke exploratie-regimes.
  2. Asymmetrie Cruciaal is: De kwetsbaarheid van groepen met lage entropie vereist een asymmetrische aanpak van advantage-shaping om length collapse te voorkomen, terwijl nog steeds exploratie wordt aangemoedigd.
  3. Schaalbaarheid: Door te vertrouwen op groep-entropie geschat uit bestaande rollouts en adaptieve drempelwaarden, biedt GEPO een schaalbare, model-agnostische oplossing die zowel de gemiddelde prestaties als de inter-taak balans verbetert zonder dat expliciete taakannotaties of extra samplingkosten nodig zijn.

Concluderend positioneert het artikel GEPO als een robuust framework voor het stabiliseren van RL-training in complexe, multi-domein LLM post-training scenario's, waarbij wordt gewaarborgd dat het optimalisatieproces de inherente onzekerheid en diversiteit van verschillende typen taken respecteert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →