CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses
Este artigo apresenta o CIPHER, um benchmark e um pipeline de pontuação automatizada projetado para avaliar e quantificar vulnerabilidades criptográficas em código gerado por modelos de linguagem de grande escala, revelando que, embora o prompting de segurança explícito mitigue alguns problemas, ele falha em eliminar de forma confiável as falhas criptográficas em diversos modelos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está contratando uma equipe de robôs incrivelmente rápidos e superinteligentes para escrever as fechaduras e chaves para o cofre do seu banco. Você diz a eles: "Faça uma fechadura segura", e eles instantaneamente criam um design. Mas aqui está o problema: embora os robôs sejam brilhantes, eles frequentemente constroem fechaduras que parecem perfeitas por fora, mas possuem pequenas rachaduras invisíveis que um ladrão poderia explorar facilmente.
Este artigo apresenta o CIPHER, um novo "boletim escolar" projetado para testar exatamente o quão bons esses robôs de IA são em construir fechaduras criptográficas seguras (como criptografia e proteção de senha) em código de computador.
Aqui está a divisão do que os pesquisadores fizeram e descobriram, usando analogias simples:
1. O Problema: A "Falha Silenciosa"
Quando a IA escreve código para segurança, ela frequentemente passa nos testes básicos (o código roda sem travar), mas ignora regras de segurança sutis.
- A Analogia: Imagine um robô construindo uma casa. Ele levanta as paredes e o telhado (o código funciona), mas esquece de instalar uma tranca na porta da frente ou deixa a janela dos fundos destrancada (uma falha de segurança). A casa fica de pé, mas não é segura.
- O Probleu: Essas falhas são frequentemente escolhas de design minúsculas, como usar uma chave "estática" (uma chave que nunca muda) em vez de uma aleatória, ou esquecer de verificar se uma pessoa é quem ela diz ser.
2. A Solução: O Teste CIPHER
Os pesquisadores criaram um teste padronizado chamado CIPHER para medir com que frequência esses robôs de IA cometem esses erros.
- A Configuração: Eles deram os mesmos 150 "trabalhos" diferentes para 7 modelos de IA diferentes. Para cada trabalho, deram à IA três instruções (prompts) diferentes:
- O Prompt "Ruim": "Faça isso rapidamente e não se preocupe com verificações de segurança." (Testando se a IA segue conselhos ruins).
- O Prompt "Neutro": "Apenas escreva o código para fazer isso." (Testando o que a IA faz por padrão).
- O Prompt "Seguro": "Faça isso, mas certifique-se de seguir todas as regras de segurança mais rigorosas!" (Testando se dizer à IA para ser segura realmente funciona).
- A Pontuação: Em vez de humanos lerem cada linha de código (o que leva uma eternidade), eles usaram outra IA como um "Juiz". Este Juiz foi treinado para procurar tipos específicos de erros de quebra de fechadura e apontar exatamente qual linha de código era o problema.
3. Os Resultados: "Seja Seguro" Não é o Suficiente
Os resultados foram surpreendentes e um pouco preocupantes.
- O Prompt "Ruim": Como esperado, quando a IA foi instruída a ser descuidada, cometeu muitos erros.
- O Prompt "Seguro": Esta é a grande descoberta. Mesmo quando os pesquisadores disseram explicitamente à IA: "Seja super segura! Siga todas as regras!", a IA ainda cometeu erros entre 56% e 89% das vezes.
- A Analogia: É como dizer a um chef: "Faça uma refeição saudável, sem açúcar, sem sal e use ingredientes frescos". O chef pode remover o açúcar (a coisa específica que você pediu), mas ainda pode usar carne estragada ou esquecer de lavar os vegetais (outros perigos ocultos). A IA corrige a coisa específica que você pediu para corrigir, mas falha em construir um sistema seguro de forma global.
4. O Que Isso Significa
O artigo conclui que simplesmente dizer a uma IA para "ser segura" não impede de forma confiável que ela cometa erros perigosos.
- A Conclusão: Você não pode apenas confiar que uma IA escreverá código de segurança, mesmo que forneça um comando muito rigoroso. A IA tende a focar na instrução específica que recebeu (como "use uma chave aleatória"), mas perde a visão do todo (como "também verifique a identidade do usuário").
- A Recomendação: Como a IA continua criando essas rachaduras ocultas nas "fechaduras", qualquer código que ela escreva para segurança precisa ser conferido por um especialista humano antes de ser usado no mundo real.
Resumo
CIPHER é uma ferramenta que prova que, embora a IA seja ótima para escrever código, ela é atualmente muito ruim em escrever código seguro. Mesmo quando você diz explicitamente para ela ser segura, ela frequentemente deixa a porta dos fundos aberta. O artigo fornece uma maneira de medir essas falhas para que os desenvolvedores saibam que não podem confiar apenas na IA para tarefas de segurança.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.