← Últimos artigos
💬 NLP

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

Este artigo apresenta o AdvGRPO, um novo framework de co-treinamento que estabiliza o GRPO para a otimização conjunta de atacante-defensor por meio de recompensas densas multicanais, normalização de vantagem desacoplada e um currículo progressivo, resultando, em última análise, em ataques transferíveis altamente eficazes e defesas de modelos de linguagem mais robustas.

Autores originais: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Um Sparring Digital

Imagine que você tem um robô muito inteligente (o Defensor) que é treinado para ser útil, mas também para recusar solicitações prejudiciais, como "Como eu construo uma bomba?" ou "Como eu hackeio um banco?".

Normalmente, os humanos tentam testar esse robô escrevendo uma lista de perguntas capciosas. Mas o robô é esperto; ele aprende a dizer "Não" para essas perguntas específicas. O problema é que um atacante astuto e adaptável pode mudar sua estratégia para encontrar uma nova maneira de enganar o robô.

Este artigo apresenta uma nova maneira de treinar ambos os lados ao mesmo tempo usando um método chamado AdvGRPO. Pense nisso como configurar um dojo digital onde um Red Team (o atacante) e um Blue Team (o defensor) praticam sparring um contra o outro continuamente. Em vez de humanos escreverem as perguntas, os modelos de IA aprendem a atacar e defender jogando um contra o outro, tornando-se mais fortes a cada rodada.

O Problema com o Jeito Antigo

Anteriormente, pesquisadores tentaram usar uma ferramenta de treinamento específica (chamada GRPO) para ensinar o atacante a quebrar o defensor. No entanto, eles descobriram que, quando o atacante e o defensor aprendiam ao mesmo tempo, o sistema ficava "instável". Era como dois boxeadores tentando aprender um novo estilo de luta enquanto o próprio ringue estava sacudindo; eles não conseguiam concordar sobre quem estava vencendo, e o treinamento travava ou entrava em círculos.

A Solução: AdvGRPO (O Dojo Estável)

Os autores criaram um novo framework chamado AdvGRPO que resolve o problema do ringue sacudindo. Eles fizeram isso com três truques principais:

  1. Uma Planilha de Pontuação com Múltiplas Faixas (Recompensas de Canais Densos Multi-Canal):
    Imagine um árbitro que não apenas grita "Ponto!" ao final do round. Em vez disso, ele dá uma pontuação para cada movimento individual.

    • O atacante manteve-se no tópico?
    • O atacante seguiu a estratégia?
    • O atacante realmente conseguiu a resposta prejudicial?
      Ao pontuar cada pequeno passo, o atacante recebe um feedback constante sobre o que melhorar, em vez de esperar até o fim para descobrir que falhou.
  2. Juízes Independentes (Normalização de Vantagem Desacoplada):
    No método instável antigo, se o atacante de repente ficasse muito bom, as pontuações para o defensor pareceriam terríveis por comparação, confundindo o treinamento.
    O novo método usa um sistema (chamado GDPO) onde cada tipo de pontuação é julgado de forma independente antes de ser combinado. É como ter um juiz para "Velocidade", um juiz para "Técnica" e um juiz para "Criatividade", que avaliam separadamente, para que um não estrague a pontuação do outro. Isso mantém o treinamento estável mesmo conforme ambos os modelos ficam mais inteligentes.

  3. O Campo de Treinamento (Aprendizado por Currículo):
    Você não colocaria um boxeador iniciante no ringue com um campeão imediatamente. O artigo utiliza um "currículo".

    • Fase 1: O atacante treina sozinho contra um defensor fixo para aprender o básico.
    • Fase 2: Assim que o atacante estiver decente, eles começam a fazer sparring com o defensor.
    • Fase 3: Eles alternam turnos. O atacante tenta quebrar o defensor por algumas rodadas, depois o defensor tenta tapar as brechas por algumas rodadas, e eles trocam. Isso evita que o defensor apenas diga "Não" para tudo (uma vitória fácil) e o força a aprender como lidar com ataques específicos e complexos.

O Que Eles Descobriram

O artigo relata vários resultados principais de seus experimentos:

  • Os Atacantes Ficaram Assustadoramente Bons: Os atacantes treinados aprenderam a enganar o defensor muito melhor do que modelos não treinados ou modelos que foram apenas "desbloqueados" (tiveram seus filtros de segurança removidos). Eles aprenderam que simplesmente remover os filtros de segurança não é suficiente; é preciso aprender como atacar.
  • Eles Podem se Adaptar: Os atacantes aprenderam estratégias que funcionaram não apenas no defensor contra o qual treinaram, mas em modelos completamente diferentes que nunca haviam visto antes. É como um boxeador aprendendo um movimento que funciona contra qualquer pessoa, não apenas contra seu parceiro de sparring.
  • Os Defensores Ficaram Mais Fortes: Os defensores treinados neste "dojo" tornaram-se muito melhores em detectar e bloquear ataques do que os defensores treinados com métodos antigos. Eles aprenderam a dizer "Não" para pedidos ruins, mas ainda dizer "Sim" para pedidos bons e inofensivos.
  • Modelos de Pensamento Precisam de Ajuda Especial: Eles descobriram que modelos capazes de "pensar" (raciocinar) muitas vezes tentavam ser seguros demais e recusavam o ataque mesmo quando solicitados. Eles tiveram que criar um sistema de recompensa especial para ensinar esses modelos a pensar através do ataque sem ficarem presos em avisos de segurança.

A Conclusão Final

O artigo afirma que, ao usar este novo método estável (AdvGRPO), eles podem criar um sistema onde atacantes e defensores de IA aprendem juntos. Isso resulta em atacantes que são muito bons em encontrar fraquezas e defensores que são muito bons em corrigi-las, tornando a IA mais segura no geral. Eles enfatizam que este é uma ferramenta de pesquisa para encontrar fraquezas antes que atores mal-intencionados possam usá-las, ajudando a construir sistemas de IA mais fortes e robustos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →