Constrained Group Relative Policy Optimization
Este artigo introduz o Constrained GRPO, uma extensão baseada em Lagrange do Group Relative Policy Optimization que melhora a imposição de restrições e a estabilidade do treinamento ao escalar vantagens padronizadas em vez de recompensas brutas para eliminar os efeitos de acoplamento prejudiciais causados pela normalização dentro do grupo.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo em rápida evolução da inteligência artificial, pesquisadores estão ensinando grandes modelos de computador a resolver problemas complexos, desde navegar em carros autônomos até resolver enigmas matemáticos difíceis. Esses modelos aprendem por tentativa e erro, um processo conhecido como aprendizado por reforço. Imagine um estudante tentando resolver um labirinto; ele recebe uma recompensa ao alcançar a saída e uma penalidade ao bater em uma parede. Com o tempo, o estudante aprende a maximizar recompensas e evitar penalidades. No entanto, um grande desafio surge quando queremos que o modelo siga regras estritas, como "nunca atingir um pedestre" ou "sempre usar gramática correta", enquanto ainda tenta ser útil. Se as regras forem muito rígidas, o modelo pode se tornar inútil; se forem muito frouxas, ele pode quebrá-las. Para resolver isso, cientistas usam uma estrutura matemática que equilibra o desejo de ter sucesso com a necessidade de obedecer a restrições, ajustando a importância de cada regra conforme o modelo aprende.
Um método popular para ensinar esses modelos, chamado Otimização de Política Relativa de Grupo (Group Relative Policy Optimization), tornou-se um favorito porque é eficiente e não requer um modelo "juiz" separado para avaliar cada etapa. Em vez disso, ele compara um grupo de respostas geradas para a mesma pergunta para decidir quais são melhores. Embora este método funcione bem para tarefas gerais, pesquisadores descobriram que aplicá-lo a regras de segurança estritas era complicado. Em um novo estudo, uma equipe do Mila – Quebec AI Institute e da École Polytechnique de Montréal descobriu que a maneira padrão de combinar diferentes objetivos em uma única pontuação estava, na verdade, quebrando a capacidade do sistema de seguir regras. Eles introduziram uma nova abordagem, a Otimização de Política Relativa de Grupo com Restrições (Constrained Group Relative Policy Optimization), que corrige essa falha e permite que os modelos aprendam comportamentos complexos enquanto aderem estritamente aos limites de segurança.
O problema central que os pesquisadores identificaram foi como o computador lida com múltiplos objetivos ao mesmo tempo. Na abordagem padrão, o modelo pega todas as suas recompensas e penalidades, mistura-as em um único número e, em seguida, normaliza esse número para facilitar o aprendizado. Os pesquisadores mostraram que esse processo de mistura cria uma interferência oculta. Quando o computador ajusta o peso de uma regra, ele altera involuntariamente a importância relativa de todas as outras regras também. É como tentar ajustar o volume de um único instrumento em uma orquestra girando um botão que também altera o equilíbrio de toda a banda; você pode tentar fazer os violinos ficarem mais altos, mas, ao fazer isso, acidentalmente faz com que os tambores fiquem muito baixos e as flautas fiquem muito altas. Isso torna muito difícil para o modelo aprender exatamente qual regra seguir, muitas vezes fazendo com que ele ignore as restrições de segurança ou se torne instável durante o treinamento.
Para corrigir isso, os pesquisadores mudaram a ordem das operações. Em vez de misturar as recompensas e penalidades primeiro, eles deixam o modelo calcular o valor de cada regra separadamente e normalizá-las individualmente. Somente após cada regra ter sido tratada justamente por conta própria é que eles as combinam usando os pesos aprendidos. Essa simples mudança remove a interferência oculta. Ao manter os sinais separados até o final, o modelo consegue ver claramente o quanto está melhorando em cada regra específica. O resultado é um processo de aprendizado muito mais estável e previsível. Os pesquisadores testaram este novo método em três ambientes muito diferentes: um jogo simples baseado em grade onde um agente tinha que evitar a lava e gerenciar uma bateria, uma simulação realista de direção autônoma com milhares de cenários de tráfego complexos e uma tarefa de raciocínio matemático envolvendo problemas de matemática de nível escolar.
No jogo baseado em grade, o novo método permitiu que o agente aprendesse de forma muito mais suave. A abordagem padrão fazia com que o agente se tornasse excessivamente cauteloso, evitando a lava de forma tão agressiva que mal se movia, enquanto o novo método permitiu que o agente usasse seu "orçamento" de risco de forma eficaz, alcançando o objetivo enquanto permanecia seguro. Na simulação de direção autônoma, a nova abordagem produziu motoristas que não eram apenas mais seguros, mas também mais eficazs em completar suas rotas. Os modelos treinados com o novo método alcançaram pontuações mais altas em conformidade de segurança e progresso de rota em comparação com métodos anteriores que misturavam os sinais primeiro. Eles conseguiram evitar colisões e seguir as leis de trânsito sem sacrificar sua capacidade de dirigir para frente, um equilíbrio que outros métodos tiveram dificuldade em manter.
O teste final envolveu ensinar um modelo de linguagem a resolver problemas matemáticos enquanto garantia que as respostas fossem curtas, formatadas corretamente e contivessem números válidos. Aqui, o novo método provou ser superior novamente. Modelos treinados com a abordagem de mistura padrão frequentemente sacrificavam a correção para tornar suas respostas mais curtas ou para se ajustarem a um formato específico. Em contraste, o novo método garantiu que o modelo priorizasse acertar a matemática, mantendo ainda padrões elevados para formatação e extensão. Em diferentes tamanhos de modelos de computador, desde os menores com 1,5 bilhão de parâmetros até os maiores com 7 bilhões, a nova abordagem produziu consistentemente resultados mais precisos sem a necessidade de componentes de treinamento adicionais caros.
As descobertas sugerem que a maneira como combinamos diferentes sinais de aprendizado é tão importante quanto os próprios sinais. Ao simplesmente mudar a ordem em que o computador processa suas recompensas e regras, os pesquisadores foram capazes de criar um sistema que respeita restrições de forma muito mais confiável. Este trabalho não oferece apenas uma pequena melhoria; ele fornece um caminho mais claro para treinar a inteligência artificial para operar com segurança no mundo real, onde seguir as regras é frequentemente tão importante quanto alcançar o objetivo. O estudo confirma que, quando queremos que a IA seja tanto capaz quanto segura, devemos ter cuidado para não deixar que a maneira como medimos o sucesso confunda o modelo sobre o que ele realmente deve fazer.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.