Group Entropy-Controlled Policy Optimization
Este artigo introduz o Group Entropy-Controlled Policy Optimization (GEPO), uma extensão leve ao GRPO que aborda as limitações da regulação de entropia global em tarefas de RL heterogêneas ao utilizar estimativas de entropia em nível de grupo para realizar o modelamento assimétrico de vantagem, equilibrando assim exploração e explotação para alcançar um desempenho superior entre tarefas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: Otimização de Política Controlada por Entropia de Grupo (GEPO)
1. Definição do Problema
O Aprendizado por Reforço (RL) tornou-se um paradigma dominante para o pós-treinamento de Grandes Modelos de Linguagem (LLMs) para aprimorar o alinhamento e o raciocínio. No entanto, equilibrar o compromisso entre exploração e explotação (exploration-exploitation trade-off) continua sendo um desafio crítico, particularmente ao treinar em misturas de tarefas heterogêneas (ex: combinando matemática, codificação, física e seguimento de instruções).
Os métodos atuais de controle de entropia por RL operam principalmente em duas granularidades:
- Nível da política: Calculando a entropia sobre todo o lote (batch) e aplicando um sinal de regulação uniforme (Figura 1a).
- Nível do token: Calculando a covariância do token e regulando tokens individuais (Figura 1b).
O artigo identifica uma falha fundamental nessas abordagens quando aplicadas à Otimização de Política Relativa de Grupo (GRPO): a Heterogeneidade de Entropia. Diferentes domínios de tarefas exibem regimes de entropia distintos sob a mesma política. Por exemplo, prompts de física podem naturalmente concentrar-se em baixa entropia, enquanto prompts de seguimento de instruções exibem alta entropia.
Essa heterogeneidade induz duas patologias específicas no GRPO padrão:
- Viés Dependente de Entropia: A normalização das vantagens dentro dos grupos cria sinais estatisticamente não comparáveis entre grupos com diferentes níveis de entropia. Grupos de baixa entropia (frequentemente tarefas de alta precisão) produzem sinais de gradiente fortes e consistentes, enquanto grupos de alta entropia (frequentemente tarefas de baixa precisão) produzem sinais fracos e ruidosos.
- Desequilíbrio de Otimização: A otimização em nível de lote torna-se dominada por tarefas de baixa entropia, fazendo com que tarefas de alta entropia recebam sinais de aprendizado decrescentes. Isso leva a um ciclo de auto-reforço onde as tarefas de baixa entropia convergem prematuramente, enquanto as tarefas de alta entropia falham em explorar efetivamente ou sofrem de "entropia desenfreada", levando a saídas degeneradas.
2. Metodologia: GEPO
Os autores propõem a Otimização de Política Controlada por Entropia de Grupo (GEPO), uma extensão leve e agnóstica ao modelo para o GRPO que realiza o moldamento de vantagem assimétrico condicionado pela entropia ao nível do grupo.
Mecanismo Central
O GEPO utiliza a Entropia de Grupo (), estimada a partir das amostras agrupadas existentes de um prompt, como um sinal de diagnóstico. Em vez de aplicar um alvo de entropia global, o GEPO molda o sinal de vantagem () para cada resposta com base no estado de entropia do grupo:
A função de moldagem aplica coeficientes de escala assimétricos ():
- Grupos de Baixa Entropia (): As vantagens positivas são atenuadas por . Isso evita a explotação excessiva e a convergência prematura em tarefas onde o modelo já está confiante.
- Grupos de Alta Entropia (): As vantagens negativas são atenuadas por . Isso evita a supressão prematura da exploração em tarefas onde o modelo está incerto, permitindo que a política descubra caminhos de raciocínio corretos.
- Caso contrário: A vantagem permanece inalterada.
Escolhas de Design Chave
- Moldagem Assimétrica (): Os autores observam empiricamente que os grupos de baixa entropia são mais frágeis; a penalização agressiva de vantagens negativas nesses grupos pode desencadear o "colapso de comprimento" (onde o modelo encurta as respostas para reduzir a incerteza). Portanto, o GEPO aplica um estímulo mais suave ( é maior) aos grupos de baixa entropia em comparação com a atenuação mais forte ( é menor) aplicada aos grupos de alta entropia.
- Limiares Adaptativos: Limiares de entropia fixos são frágeis entre diferentes modelos base e estágios de treinamento. O GEPO deriva limiares () dinamicamente da distribuição de entropia do lote (média e desvio padrão) e os suaviza usando uma Média Móvel Exponencial (EMA). Isso permite que o método se calibre automaticamente para a escala de entropia específica do modelo base sem ajuste específico para a tarefa.
3. Principais Contribuições
- Insight Teórico: O artigo fornece uma análise teórica (Proposições 2.1 e 2.2) demonstrando que as vantagens normalizadas no GRPO são estruturalmente enviesadas pela entropia do grupo. Ele prova que a discrepância entre as distribuições de recompensa ponderadas pela política e de referência é dependente da entropia, levando a sinais de vantagem não comparáveis entre tarefas heterogêneas.
- Inovação Algorítmica: O GEPO introduz o primeiro mecanismo de controle de entropia ao nível de grupo que realiza o moldagem assimétrica de vantagem. Ao contrário de métodos anteriores que tratam a entropia como uma propriedade global ou de nível de token, o GEPO trata a entropia como um diagnóstico de grupo de prompt para reequilibrar as pressões de otimização.
- Implementação de Custo Zero: O método não requer amostragem adicional ou estimativa de função de valor. Ele aproveita as amostras agrupadas existentes no GRPO, adicionando um overhead computacional negligenciável.
4. Resultados Experimentais
Os autores avaliaram o GEPO em dois modelos base (Intern-S1-mini e Qwen3.5-9B) em treze benchmarks cobrindo matemática, física, ciência, geração de código e seguimento de instruções.
- Desempenho: O GEPO superou consistentemente o GRPO e os recentes baselines de controle de entropia (AEPO, Clip_Cov, KL_Cov).
- No Intern-S1-mini, o GEPO alcançou a melhor pontuação média (54.2) e venceu em 7 de 13 benchmarks, incluindo ganhos significativos no AIME25, IMO-Bench e GPQA.
- No Qwen3.5-9B, o GEPO alcançou a pontuação média mais alta (71.2), superando baselines fortes como Clip_Cov (70.9) e KL_Cov (69.9).
- Estabilidade: O GEPO demonstrou superior estabilidade de treinamento. Enquanto o GRPO sofreu colapso catastrófico de desempenho (ex: no Qwen3.5-9B por volta do passo 170) devido ao crescimento ilimitado da entropia, e o AEPO exibiu oscilações persistentes, o GEPO manteve curvas de validação suaves e de melhoria monotônica.
- Dinâmica de Entropia: A análise das dinâmicas de treinamento mostrou que o GEPO preserva níveis de exploração diferenciados entre as tarefas. Ao contrário do AEPO, que força um padrão de entropia uniforme, o GEPO permite que tarefas que exigem ampla exploração mantenham uma entropia mais alta, enquanto tarefas determinísticas se estabelecem em entropias mais baixas, evitando tanto o colapso prematuro quanto a entropia desenfreada.
5. Significância e Alegações
O artigo afirma que o GEPO aborda uma lacuna crítica no pós-treinamento de RL multitarefa: a incapacidade dos métodos atuais de lidar com o viés estrutural introduzido pela heterogeneidade de entropia entre diversas tarefas.
Os autores afirmam que:
- A Regulação Específica da Tarefa é Essencial: Conduzir tarefas heterogêneas para um padrão de entropia uniforme é suboptimal. O aprendizado multitarefa eficaz requer a preservação de regimes de exploração específicos de cada tarefa.
- A Assimetria é Crucial: A fragilidade dos grupos de baixa entropia exige uma abordagem assimétrica de moldagem de vantagem para evitar o colapso de comprimento, enquanto ainda incentiva a exploração.
- Escalabilidade: Ao depender da entropia de grupo estimada a partir de rollouts existentes e de limiares adaptativos, o GEPO oferece uma solução escalável e agnóstica ao modelo que melhora tanto o desempenho médio quanto o equilíbrio entre tarefas sem exigir anotações de tarefas explícitas ou custos de amostragem adicionais.
Em conclusão, o artigo posiciona o GEPO como um framework robusto para estabilizar o treinamento de RL em cenários complexos de pós-treinamento de LLM de múltiplos domínios, garantindo que o processo de otimização respeite a incerteza inerente e a diversidade dos diferentes tipos de tarefas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.