← Últimos artigos
💬 NLP

Constrained Group Relative Policy Optimization

Este artigo introduz o Constrained GRPO, uma extensão baseada em Lagrange do Group Relative Policy Optimization que melhora a imposição de restrições e a estabilidade do treinamento ao escalar vantagens padronizadas em vez de recompensas brutas para eliminar os efeitos de acoplamento prejudiciais causados pela normalização dentro do grupo.

Autores originais: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Publicado 2026-09-03
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo em rápida evolução da inteligência artificial, pesquisadores estão ensinando grandes modelos de computador a resolver problemas complexos, desde navegar em carros autônomos até resolver enigmas matemáticos difíceis. Esses modelos aprendem por tentativa e erro, um processo conhecido como aprendizado por reforço. Imagine um estudante tentando resolver um labirinto; ele recebe uma recompensa ao alcançar a saída e uma penalidade ao bater em uma parede. Com o tempo, o estudante aprende a maximizar recompensas e evitar penalidades. No entanto, um grande desafio surge quando queremos que o modelo siga regras estritas, como "nunca atingir um pedestre" ou "sempre usar gramática correta", enquanto ainda tenta ser útil. Se as regras forem muito rígidas, o modelo pode se tornar inútil; se forem muito frouxas, ele pode quebrá-las. Para resolver isso, cientistas usam uma estrutura matemática que equilibra o desejo de ter sucesso com a necessidade de obedecer a restrições, ajustando a importância de cada regra conforme o modelo aprende.

Um método popular para ensinar esses modelos, chamado Otimização de Política Relativa de Grupo (Group Relative Policy Optimization), tornou-se um favorito porque é eficiente e não requer um modelo "juiz" separado para avaliar cada etapa. Em vez disso, ele compara um grupo de respostas geradas para a mesma pergunta para decidir quais são melhores. Embora este método funcione bem para tarefas gerais, pesquisadores descobriram que aplicá-lo a regras de segurança estritas era complicado. Em um novo estudo, uma equipe do Mila – Quebec AI Institute e da École Polytechnique de Montréal descobriu que a maneira padrão de combinar diferentes objetivos em uma única pontuação estava, na verdade, quebrando a capacidade do sistema de seguir regras. Eles introduziram uma nova abordagem, a Otimização de Política Relativa de Grupo com Restrições (Constrained Group Relative Policy Optimization), que corrige essa falha e permite que os modelos aprendam comportamentos complexos enquanto aderem estritamente aos limites de segurança.

O problema central que os pesquisadores identificaram foi como o computador lida com múltiplos objetivos ao mesmo tempo. Na abordagem padrão, o modelo pega todas as suas recompensas e penalidades, mistura-as em um único número e, em seguida, normaliza esse número para facilitar o aprendizado. Os pesquisadores mostraram que esse processo de mistura cria uma interferência oculta. Quando o computador ajusta o peso de uma regra, ele altera involuntariamente a importância relativa de todas as outras regras também. É como tentar ajustar o volume de um único instrumento em uma orquestra girando um botão que também altera o equilíbrio de toda a banda; você pode tentar fazer os violinos ficarem mais altos, mas, ao fazer isso, acidentalmente faz com que os tambores fiquem muito baixos e as flautas fiquem muito altas. Isso torna muito difícil para o modelo aprender exatamente qual regra seguir, muitas vezes fazendo com que ele ignore as restrições de segurança ou se torne instável durante o treinamento.

Para corrigir isso, os pesquisadores mudaram a ordem das operações. Em vez de misturar as recompensas e penalidades primeiro, eles deixam o modelo calcular o valor de cada regra separadamente e normalizá-las individualmente. Somente após cada regra ter sido tratada justamente por conta própria é que eles as combinam usando os pesos aprendidos. Essa simples mudança remove a interferência oculta. Ao manter os sinais separados até o final, o modelo consegue ver claramente o quanto está melhorando em cada regra específica. O resultado é um processo de aprendizado muito mais estável e previsível. Os pesquisadores testaram este novo método em três ambientes muito diferentes: um jogo simples baseado em grade onde um agente tinha que evitar a lava e gerenciar uma bateria, uma simulação realista de direção autônoma com milhares de cenários de tráfego complexos e uma tarefa de raciocínio matemático envolvendo problemas de matemática de nível escolar.

No jogo baseado em grade, o novo método permitiu que o agente aprendesse de forma muito mais suave. A abordagem padrão fazia com que o agente se tornasse excessivamente cauteloso, evitando a lava de forma tão agressiva que mal se movia, enquanto o novo método permitiu que o agente usasse seu "orçamento" de risco de forma eficaz, alcançando o objetivo enquanto permanecia seguro. Na simulação de direção autônoma, a nova abordagem produziu motoristas que não eram apenas mais seguros, mas também mais eficazs em completar suas rotas. Os modelos treinados com o novo método alcançaram pontuações mais altas em conformidade de segurança e progresso de rota em comparação com métodos anteriores que misturavam os sinais primeiro. Eles conseguiram evitar colisões e seguir as leis de trânsito sem sacrificar sua capacidade de dirigir para frente, um equilíbrio que outros métodos tiveram dificuldade em manter.

O teste final envolveu ensinar um modelo de linguagem a resolver problemas matemáticos enquanto garantia que as respostas fossem curtas, formatadas corretamente e contivessem números válidos. Aqui, o novo método provou ser superior novamente. Modelos treinados com a abordagem de mistura padrão frequentemente sacrificavam a correção para tornar suas respostas mais curtas ou para se ajustarem a um formato específico. Em contraste, o novo método garantiu que o modelo priorizasse acertar a matemática, mantendo ainda padrões elevados para formatação e extensão. Em diferentes tamanhos de modelos de computador, desde os menores com 1,5 bilhão de parâmetros até os maiores com 7 bilhões, a nova abordagem produziu consistentemente resultados mais precisos sem a necessidade de componentes de treinamento adicionais caros.

As descobertas sugerem que a maneira como combinamos diferentes sinais de aprendizado é tão importante quanto os próprios sinais. Ao simplesmente mudar a ordem em que o computador processa suas recompensas e regras, os pesquisadores foram capazes de criar um sistema que respeita restrições de forma muito mais confiável. Este trabalho não oferece apenas uma pequena melhoria; ele fornece um caminho mais claro para treinar a inteligência artificial para operar com segurança no mundo real, onde seguir as regras é frequentemente tão importante quanto alcançar o objetivo. O estudo confirma que, quando queremos que a IA seja tanto capaz quanto segura, devemos ter cuidado para não deixar que a maneira como medimos o sucesso confunda o modelo sobre o que ele realmente deve fazer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →