Learning diverse attacks on large language models for robust red-teaming and safety tuning
Este artigo propõe uma estrutura baseada em GFlowNet para red-teaming automatizado que supera as limitações de colapso de modo das abordagens de aprendizado por reforço existentes para gerar prompts de ataque diversos e eficazes, permitindo, assim, a criação de modelos de linguagem de grande escala mais robustos e com ajuste de segurança.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo em rápida evolução da inteligência artificial, os grandes modelos de linguagem tornaram-se ferramentas poderosas, capazes de escrever, raciocinar e conversar com fluidez semelhante à humana. No entanto, essa capacidade traz consigo um risco significativo: esses sistemas podem ser manipulados para produzir conteúdo prejudicial, tóxico ou perigoso. Para evitar isso, os desenvolvedores envolvem-se numa prática conhecida como red-teaming (equipa vermelha). Imagine uma equipa de segurança contratada para invadir um edifício antes de o público se mudar para lá; no reino digital, o red-teaming envolve tentar sistematicamente enganar uma inteligência artificial para que ela revele as suas fraquezas. O objetivo é encontrar as perguntas ou instruções específicas, chamadas prompts, que contornam os filtros de segurança do modelo e o forçam a gerar algo para o qual foi desenhado para recusar. Identificar estas vulnerabilidades é essencial para construir sistemas mais seguros, mas encontrá-las é difícil porque o espaço de perguntas possíveis é vasto, e os métodos utilizados para as encontrar muitas vezes ficam presos num ciclo, repetindo as mesmas poucas truques em vez de descobrir uma grande variedade de novas formas de quebrar o sistema.
Uma equipa de investigadores desenvolveu uma nova abordagem para este problema que gera com sucesso uma gama diversificada de prompts de ataque eficazes. Em vez de depender de métodos tradicionais que frequentemente convergem para uma solução única e repetitiva, eles utilizaram um framework probabilístico chamado rede de fluxo generativo (generative flow network). Este método trata a busca por prompts prejudiciais não como uma simples tarefa de otimização, mas como um processo de amostragem de um vasto panorama de possibilidades. Os investigadores treinaram um modelo de inteligência artificial para explorar este panorama, recolhendo uma ampla gama de prompts que desencadearam com sucesso respostas tóxicas de modelos alvo. Eles aplicaram então uma segunda etapa de suavização para refinar estas descobertas, garantindo que o conjunto final de ataques fosse tanto altamente eficaz quanto notavelmente variado. O resultado é um conjunto de ferramentas que pode descobrir vulnerabilidades que outros métodos perdem, proporcionando uma rede de segurança mais abrangente para os desenvolvedores.
O desafio central que os investigadores abordaram foi uma falha comum no red-teaming automatizado: a tendência dos sistemas para colapsarem na geração de apenas alguns prompts semelhantes e repetitivos. Tentativas anteriores de corrigir isto através da adição de regras para incentivar a variedade falharam frequentemente, resultando em sistemas que produziam ou perguntas diversas mas inofensivas, ou ataques eficazes mas idênticos. O novo método evita esta armadilha utilizando um processo de duas etapas. Na primeira etapa, o sistema explora o espaço de prompts possíveis, guiado por um sinal de recompensa que mede a probabilidade de um prompt desencadear uma resposta prejudicial. Esta exploração é desenhada para ser ampla, procurando muitos diferentes "modos" ou tipos de ataques, em vez de apenas o mais fácil. O sistema recolhe um grande conjunto de dados destes prompts bem-sucedidos e diversos durante esta fase.
Na segunda etapa, os investigadores pegam nos prompts recolhidos e utilizam-nos para treinar o modelo novamente, desta vez focando-se em aprender os padrões que tornaram esses prompts específicos bem-sucedidos. Esta etapa atua como um refinamento, suavizando a distribuição de ataques, de modo que o modelo possa gerar novas variações de alta qualidade que não foram explicitamente vistas antes, mas que partilham as mesmas características de sucesso. Esta combinação de exploração ampla seguida de aprendizagem focada permite que o sistema mantenha um alto nível de diversidade, garantindo ao mesmo tempo que os ataques permanecem potentes. Os investigadores testaram esta abordagem numa variedade de diferentes modelos de linguagem, incluindo alguns que tinham sido especificamente treinados para serem seguros e resistentes a ataques. Eles descobriram que o seu método superava consistentemente as técnicas existentes, gerando uma percentagem muito maior de prompts tóxicos enquanto mantinha uma ampla variedade de fraseologia e estrutura.
Uma das descobertas mais significativas foi a capacidade destes ataques de se transferirem entre diferentes modelos. Prompts gerados para atacar um modelo específico foram frequentemente bem-sucedidos contra outros modelos completamente diferentes, mesmo aqueles contra os quais os investigadores nunca tinham testado durante a fase de treino. Isto sugere que diferentes sistemas de inteligência artificial partilham fraquezas comuns no seu treino de segurança, e que um conjunto diversificado de ataques pode revelar estas vulnerabilidades partilhadas de forma mais eficaz do que os ataques estreitos e repetitivos. Por exemplo, quando os investigadores treinaram o seu sistema num modelo chamado Gemma, os prompts resultantes foram capazes de contornar com sucesso os filtros de segurança de vários outros modelos, incluindo Llama e Mistral, com altas taxas de sucesso. Esta transferibilidade é crucial porque significa que um único esforço de red-teaming bem desenhado pode melhorar a segurança de muitos sistemas diferentes ao mesmo tempo.
Os investigadores também demonstraram que utilizar o seu conjunto diversificado de ataques para treinar um modelo o torna significativamente mais robusto. Quando pegaram num modelo alvo e o ajustaram (fine-tuning) utilizando as respostas de recusa aos seus prompts gerados, o modelo resultante tornou-se muito mais difícil de quebrar. De facto, este modelo ajustado para segurança foi capaz de resistir a ataques gerados por outros métodos de red-teaming menos sofisticados que tinham sido anteriormente bem-sucedidos. Isto indica que expor um modelo a uma grande variedade de estilos de ataque durante o seu treino de segurança é muito mais eficaz do que expô-lo a apenas alguns exemplos repetidos. O estudo mostrou que esta melhoria na segurança não veio à custa das capacidades gerais do modelo; os modelos ajustados para segurança mantiveram a sua capacidade de seguir instruções e realizar tarefas de forma eficaz.
O trabalho também destacou as limitações das medidas de segurança atuais. Os investigadores notaram que a eficácia dos seus ataques depende do classificador utilizado para determinar se uma resposta é tóxica, e que o dano real pode ser subjetivo e dependente do contexto. Eles observaram que alguns métodos, particularmente aqueles que dependem de otimização simples, podem cair numa armadilha onde geram prompts que parecem tóxicos para um classificador, mas que não provocam realmente respostas prejudiciais do modelo, um fenómeno conhecido como "reward hacking" (exploração de recompensa). A sua abordagem de duas etapas ajudou a mitigar isto ao garantir que os prompts não eram apenas estatisticamente propensos a desencadear um classificador, mas sim genuinamente eficazes em provocar a resposta desejada do modelo alvo.
Em última análise, esta investigação fornece uma forma mais fiável de testar o stress de sistemas de inteligência artificial antes de serem lançados ao público. Ao afastar-se de métodos que ficam presos em ciclos repetitivos e ao abraçar uma estratégia que procura uma grande diversidade de ataques, os desenvolvedores podem identificar e corrigir uma gama mais ampla de vulnerabilidades. A capacidade de transferir estes ataques entre diferentes modelos sugere que os desafios de segurança enfrentados por estes sistemas estão interconectados, e que uma abordagem probabilística e diversificada de red-teaming oferece uma ferramenta poderosa para construir uma inteligência artificial mais resiliente e confiável. O código e os métodos desenvolvidos neste estudo estão disponíveis para que outros os utilizem, visando acelerar a criação de sistemas mais seguros para todos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.