← Últimos artigos
💻 computer science

Can Developers rely on LLMs for Secure IaC Development?

Este estudo avalia o GPT-4o e o Gemini 2.0 Flash para o desenvolvimento seguro de Infraestrutura como Código, constatando que, embora prompts guiados melhorem a detecção de "security smells" tanto em trechos simplificados quanto em repositórios do mundo real, os modelos ainda têm dificuldade em gerar código seguro, com apenas uma pequena fração das saídas atendendo aos padrões de segurança mesmo quando explicitamente instruídos.

Autores originais: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

Publicado 2026-02-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo uma casa, mas em vez de usar tijolos e argamassa, você está usando código para montar automaticamente suas paredes, janelas e sistemas de segurança. Isso é chamado de Infraestrutura como Código (IaC). É como ter um robô que constrói sua infraestrutura digital para você.

O problema é que, se você der ao robô uma planta ruim, ele pode construir uma casa com portas destrancadas, janelas voltadas para a rua ou um cofre onde a chave está colada na porta da frente. Esses erros são chamados de "cheiros de segurança" (security smells).

Os autores deste artigo fizeram uma grande pergunta: Podemos confiar em chatbots de IA (como o GPT-4o e o Gemini) para nos ajudar a escrever essas plantas de forma segura, ou para detectar os erros nelas?

Aqui está o que eles descobriram, dividido em histórias simples:

1. O Teste "Encontre o Erro" (Detecção)

Os pesquisadores deram à IA dois tipos de tarefas: encontrar erros em trechos curtos de código (como os encontrados no Stack Overflow) e encontrar erros em arquivos de projetos reais e completos (do GitHub).

  • O Cenário do "Pedido Vago": Imagine pedir a um segurança: "Olhe para esta casa e diga-me se ela é segura".
    • O Resultado: A IA foi razoável ao detectar problemas óbvios em trechos curtos (cerca cerca de 70-80% de sucesso). Mas, ao olhar para projetos completos e complexos, a IA deixou passar mais da metade das falhas perigosas. Era como se o segurança percebesse apenas a porta da frente destrancada, mas não notasse a janela traseira quebrada.
  • O Cenário do "Passo a Passo": Os pesquisadores então deram à IA um checklist específico: "Primeiro, verifique as trancas. Segundo, verifique as janelas. Terceiro, procure por notas deixadas pelo proprietário anterior".
    • O Resultado: Isso funcionou muito melhor. A capacidade da IA de encontrar erros saltou significamente (atingindo quase 90% para um dos modelos).
    • A Pegadinha: Mesmo quando a IA encontrava o erro, ela raramente oferecia uma correção específica. Era como se o segurança dissesse: "Ei, aquela janela está quebrada", mas não entregasse o vidro para substituí-la.

2. O Teste "Construa Isso" (Geração)

Em seguida, pediram à IA para criar novas plantas do zero com base em pedidos específicos, alguns dos quais foram desenhados para enganar a IA e fazê-la cometer erros (ex: "Use uma tranca fraca" ou "Deixe a senha no código").

  • O Resultado: É aqui que a IA mais teve dificuldades.
    • Quando solicitada a construir uma casa segura, a IA construiu uma casa segura apenas 7% das vezes.
    • Nos outros 93% dos casos, ela construiu casas com armadilhas ocultas (falhas de segurança) e muitas vezes nem sequer avisava que as armadilhas estavam lá.
    • Mesmo quando os pesquisadores gritavam explicitamente: "Faça isso de forma SEGURA!", a IA ainda construía casas inseguras cerca de 80% das vezes.

3. O Efeito "Imitador"

Os pesquisadores também verificaram se a IA estava apenas copiando exemplos ruins que viu anteriormente. Eles descobriram que o código gerado pela IA frequentemente se parecia mais com outros códigos gerados por IA do que com as respostas "corretas" encontradas em fóruns escritos por humanos. É como se a IA tivesse aprendido com um grupo de pessoas que estavam cometendo os mesmos erros, em vez de aprender com os especialistas.

A Conclusão

O artigo conclui que, embora a IA seja uma ferramenta poderosa, você não pode confiar atualmente nela sozinha para manter sua infraestrutura digital segura.

  • Para encontrar erros: Ela ajuda, mas apenas se você der instruções muito específicas e passo a passo. Sem esse direcionamento, ela perde muitos perigos.
  • Para escrever código: Atualmente é muito arriscado deixar que ela escreva códigos de segurança do zero. Ela frequentemente constrói "casas" com portas destrancadas e não avisa você sobre isso.

A Analogia: Pense na IA como um aprendiz de construtor muito rápido e muito confiante. Se você pedir para "consertar isso", ela pode encontrar algumas rachaduras. Mas se você pedir para "construir uma fortaleza", ela provavelmente construirá um castelo de papelão com uma tranca de papel, e não dirá que aquilo não é realmente seguro. Você ainda precisa de um especialista humano para conferir tudo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →