← Últimos artigos
💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

O artigo introduz o MDP-GRPO, uma variante estabilizada da Otimização de Política Relativa de Grupo que emprega amostragem de temperatura múltipla, vantagens de âncora dupla, modelagem de teoria da perspectiva e regularização KL assimétrica para superar a instabilidade em configurações de recompensa discretas e de baixa dispersão, melhorando significamente o desempenho de seguimento de instruções com múltiplas restrições.

Autores originais: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

Publicado 2026-06-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um chef muito talentoso, mas levemente caótico (a IA), a seguir uma receita muito específica. A receita não é apenas "fazer um bolo"; é uma lista rigorosa de regras: "Use exatamente 3 ovos", "Não use chocolate", "Escreva as instruções em LETRAS MAIÚSCULAS" e "Termine a nota com a frase 'Bon Appétit'".

No mundo da IA, isso é chamado de Seguimento de Instruções com Múltiplas Restrições. O problema é que os métodos de treinamento padrão de IA costumam se confundir quando as regras são tão estritas e o feedback é binário (ou você seguiu a regra ou não seguiu).

Aqui está uma divisão simples da solução do artigo, MDP-GRPO, usando analogias do cotidiano.

O Problema: A Armadilha da "Nota de Grupo"

O artigo começa explicando como o treinamento atual de IA (chamado GRPO) funciona. Imagine um professor dando um teste para um grupo de 8 alunos (as tentativas da IA) de uma só vez. Em vez de avaliar cada aluno contra um padrão perfeito, o professor os avalia em relação uns aos outros.

  • Se 7 alunos tiram "C" e 1 aluno tira "B", o aluno "B" recebe um bônus enorme, e os alunos "C" recebem uma penalidade enorme.
  • A Falha: No seguimento de regras estritas, é comum que todos no grupo recebam exatamente a mesma nota (por exemplo, todos falharam na regra de "letras maiúsculas").
    • Colapso de Variância Zero: Se todos recebem "0", o professor não tem como dizer quem foi melhor. A "nota" torna-se zero para todos, e a IA não aprende nada.
    • Cegueira de Centralização de Média: Se um grupo de alunos falha feio, e outro grupo também falha feio, o professor os trata da mesma forma porque são "igualmente ruins" em relação ao seu próprio grupo. A IA não sabe qual regra específica ela quebrou.
    • Amplificação de Baixa Variância: Se as notas são 99, 100, 100, 100, a pequena diferença entre 99 e 100 é amplificada em uma penalidade massiva, fazendo a IA reagir exageradamente e se tornar instável.

A Solução: MDP-GRPO

Os autores propõem um novo método de treinamento com quatro "ferramentas" para corrigir essas falhas. Pense nisso como atualizar o sistema de avaliação do professor.

1. O "Misturador de Sabores" (Amostragem Multi-Temperatura)

  • O Problema: Se você pedir à IA para escrever 8 variações de uma história, ela pode escrever 8 histórias quase idênticas. Se forem todas idênticas, todas recebem a mesma nota, e o treinamento trava.
  • A Correção: Os autores dizem à IA para escrever essas 8 histórias usando diferentes "níveis de criatividade". Algumas são escritas de forma muito estrita (temperatura baixa), e outras são escritas de forma selvagem e criativa (temperatura alta).
  • O Resultado: Isso garante que, mesmo que as regras sejam difíceis, as 8 tentativas serão diferentes o suficiente para ter notas diferentes. Isso evita o problema de "todos receberam zero".

2. O Sistema de "Dois Âncoras" (Vantagens de Âncora Dupla)

  • O Problema: Quando o grupo está um caos (todos falharam), o sistema de "avaliação relativa" quebra.
  • A Correção: Em vez de apenas comparar os alunos entre si, o professor também os compara com um "Aluno Neutro" fixo e imaginário.
    • Imagine um "Aluno Neutro" que acerta exatamente 50% das regras por pura sorte.
    • Se o grupo da IA estiver indo pior do que este Aluno Neutro, a IA recebe um sinal claro: "Você está indo pior que a média, tente mais difícil!"
    • Isso dá um sinal de aprendizado para a IA mesmo quando todo o grupo está falhando, evitando a "cegueira" em relação ao desempenho absoluto.

3. O "Medo Humano da Perda" (Modelagem de Teoria do Prospecto)

  • O Problema: O treinamento padrão trata uma pequena vitória e uma pequena perda como iguais, mas opostos. Mas, na vida real, os humanos odeiam perder mais do que amam ganhar.
  • A Correção: Os autores pegam emprestado um conceito da economia chamado Teoria do Prospecto. Eles programam a IA para sentir a "dor" de quebrar uma regra de forma muito mais intensa do que a "alegria" de segui-la.
    • Se a IA quebra uma regra, a penalidade é enorme e aguda.
    • Se a IA segue uma regra, a recompensa é limitada e suave.
    • Isso impede que a IA seja muito imprudente e a força a ser muito cuidadosa com restrições estritas.

4. O "Cinto de Segurança Assimétrico" (Regularização KL Assimétrica)

  • O Problema: Às vezes, ao tentar seguir regras, a IA esquece como falar normalmente ou torna-se muito rígida.
  • A Correção: Eles colocam um "cinto de segurança" nas mudanças da IA.
    • Se a IA está melhorando (seguindo as regras melhor), o cinto de segurança é frouxo, permitindo grandes mudanças.
    • Se a IA está piorando (quebrando regras), o cinto de segurança aperta instantaneamente, impedindo que ela cometa erros graves e prejudiciais.

Os Resultados

Os autores testaram este novo método em modelos como Llama-3.2 e Gemma-2.

  • Melhor em Regras: A IA tornou-se significativamente melhor em seguir instruções estritas e de múltiplas partes (um aumento de até 5% nas taxas de sucesso estrito).
  • Aprendizado Estável: O treinamento não travou nem ficou confuso quando a IA atingiu um muro de falhas.
  • Ainda Inteligente: Crucialmente, a IA não perdeu seu conhecimento geral (como responder curiosidades ou resolver enigmas de lógica) enquanto aprendia essas regras estritas.

Resumo

O artigo argumenta que ensinar uma IA a seguir regras estritas e múltiplas é como ensinar um chef a seguir uma receita com 10 pequenas restrições específicas. Os métodos padrão falham porque ficam confusos quando todos na classe falham. O MDP-GRPO corrige isso ao:

  1. Tornar as tentativas de prática mais diversas.
  2. Fornecer um ponto de referência fixo para que a IA saiba como está se saindo, mesmo quando está falhando.
  3. Fazer a IA "temer" os erros mais do que "amar" o sucesso.
  4. Impedir que a IA mude drasticamente quando comete um deslize.

O resultado é uma IA que é muito mais confiável ao seguir instruções complexas e estritas sem perder sua inteligência geral.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →