← Últimos artigos
📊 statistics

Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

Este artigo identifica que os objetivos padrão de Aprendizado por Reforço com Recompensas Verificáveis (RLVR) causam colapso de diversidade por serem indiferentes à distribuição de massa de probabilidade entre soluções corretas e propõe a Otimização de Política Uniforme-Correta (UCPO) para impor uniformidade sobre as saídas válidas, melhorando assim significativamente a diversidade e a cobertura de múltiplas amostras enquanto mantém a precisão de tentativa única.

Autores originais: Anamika Lochab, Bolian Li, Ruqi Zhang

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Anamika Lochab, Bolian Li, Ruqi Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Armadilha do "Tamanho Único"

Imagine que você está treinando um aluno brilhante para resolver problemas de matemática. Você diz a ele: "Seu objetivo é obter a resposta correta."

No mundo da IA, isso é chamado de RLVR (Aprendizado por Reforço com Recompensas Verificáveis). A IA tenta resolver um problema e, se a resposta estiver correta, recebe uma "estrelinha dourada".

O Problema:
O artigo argumenta que os métodos de treinamento padrão (como GRPO) estão focados demais em conseguir a estrelinha e não se importam com como o aluno a obtém.

Imagine um problema de matemática que tem três maneiras diferentes válidas de ser resolvido (Método A, Método B e Método C).

  • O Jeito Antigo (GRPO): A IA tenta os três. Por pura sorte, ela resolve um problema usando o Método A. Ela recebe uma estrelinha. Como ganhou uma estrela, a IA pensa: "O Método A é o melhor! Farei esse da próxima vez." Ela para de tentar os Métodos B e C.
  • O Resultado: A IA torna-se mestre do Método A. Ela obtém a resposta correta quase todas as vezes que tenta uma vez (Pass@1). Mas, se você pedir para ela tentar 64 vezes para ver se consegue encontrar qualquer solução, ela falha. Por quê? Porque ela esqueceu os Métodos B e C. Ela colapsou em um único hábito estreito.

O artigo chama isso de "Colapso da Diversidade". A IA torna-se um unicórnio de um único truque.

O Diagnóstico: Por Que Isso Acontece?

Os autores encontraram duas razões principais para isso acontecer:

  1. O Objetivo é Muito Vago: A regra de treinamento diz: "Maximize as respostas corretas". Não diz: "Maximize as respostas corretas e tente usar todos os métodos possíveis". Assim, a IA é indiferente. Ela não sabe que deveria ser diversa.
  2. O Ciclo "O Rico Fica Mais Rico":
    • Imagine que a IA tem um pouco mais de probabilidade de escolher o Método A apenas por acaso.
    • Como ela escolhe o Método A com mais frequência, ela pratica mais com ele.
    • As atualizações de treinamento tornam o Método A ainda mais forte.
    • Agora, ela escolhe o Método A ainda mais frequentemente.
    • Eventualmente, os Métodos B e C nunca são escolhidos, então a IA nunca tem a chance de aprendê-los novamente. Eles desaparecem.

A Solução: A Política "Uniforme-Correta"

Os autores perguntaram: "Qual é a maneira perfeita para uma IA se comportar quando há múltiplas respostas corretas?"

Eles concluíram que a IA deve ser Uniforme-Correta.

  • Uniforme: Ela deve tratar cada solução válida (Método A, B e C) exatamente da mesma forma. Deve dar a eles uma chance igual (33% cada).
  • Correta: Ela nunca deve desperdiçar tempo com respostas erradas.

Pense nisso como um chef que conhece três maneiras diferentes de fazer uma omelete perfeita. O chef "Uniforme-Correto" não se limita àquela que fez primeiro; ele alterna entre os três métodos igualmente para nunca esquecer como fazer os outros.

A Nova Ferramenta: UCPO

Para corrigir a armadilha do "Tamanho Único", os autores criaram um novo método de treinamento chamado UCPO (Otimização de Política Uniforme-Correta).

Como funciona (A Analogia):
Imagine que a IA é um professor avaliando uma turma de alunos (as diferentes soluções).

  • Método Antigo (GRPO): O professor só elogia o aluno que levantou a mão primeiro. Os outros alunos ficam quietos e, eventualmente, param de levantar a mão.
  • Novo Método (UCPO): O professor olha para a turma inteira. Se o Aluno A levantou a mão muito, o professor diz: "Bom trabalho, mas vamos dar um bônus especial ao Aluno B e ao Aluno C, que ainda não levantaram a mão muito."

O UCPO adiciona uma "penalidade" ao treinamento. Se a IA começar a favorecer uma solução demais, o treinamento empurra de volta e diz: "Não, você precisa espalhar sua atenção de forma mais uniforme entre todas as respostas corretas."

Os Resultados: O Que Aconteceu?

A equipe testou isso em três modelos de IA diferentes (variando de pequenos a grandes) usando benchmarks difíceis de matemática (como a competição de matemática AIME).

  1. A precisão manteve-se alta: A IA continuou tão boa em obter a resposta correta na primeira tentativa (Pass@1) quanto os métodos antigos.
  2. A diversidade disparou: Quando pediram à IA para gerar 64 tentativas diferentes, ela encontrou muitas mais soluções corretas e únicas.
    • No teste mais difícil (AIME24), o novo método melhorou a capacidade de encontrar qualquer solução correta entre 64 tentativas em 10%.
    • A variedade das equações matemáticas usadas nas respostas aumentou em 45%.

Resumo

O artigo mostra que o treinamento padrão de IA torna os modelos muito rígidos: eles encontram uma maneira de estar certos e se apegam a ela, esquecendo todas as outras maneiras válidas. O novo método, UCPO, força a IA a manter todas as suas opções abertas, tratando cada caminho correto como igualmente valioso. Isso torna a IA mais robusta e criativa sem sacrificar sua precisão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →