← Últimos artigos
🤖 AI

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

Este estudo empírico conclui que os atuais agentes de LLM de propósito geral e de código aberto, alimentados por modelos Ollama, ainda não são adequados para substituir ferramentas estabelecidas de Teste Estático de Segurança de Aplicações (SAST), como o Bandit, em cenários realistas de cibersegurança.

Autores originais: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

Publicado 2026-06-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca enorme de livros (código) e precisa encontrar cada erro de digitação, furo no enredo ou segredo perigoso escondido dentro deles. Você tem dois ajudantes para fazer este trabalho:

  1. O Bibliotecário Veterano (Bandit): Esta é uma ferramenta tradicional. Ele não "pensa" ou "imagina". Ele possui um checklist rigoroso e pré-escrito de erros conhecidos (como "não deixe a porta dos fundos aberta" ou "não use uma fechadura enferrujada"). Ele escaneia os livros rapidamente, de forma metódica, e diz exatamente onde estão os problemas. É entediante, mas é confiável.
  2. O Estagiário Criativo (O Agente de IA): Este é um novo e sofisticado Modelo de Linguagem Grande (LLM). É como um estudante brilhante que leu toda a internet. Em vez de um checklist, você dá a ele uma descrição de cargo: "Encontre qualquer coisa que pareça perigosa". Ele usa sua imaginação para adivinhar o que pode estar errado.

O Experimento
Os pesquisadores deste artigo decidiram colocar esses dois ajudantes um contra o outro. Eles deram a eles três diferentes "bibliotecas" (projetos de software de código aberto) para escanear:

  • Um gerenciador de pacotes robusto, mas antigo (Yum).
  • Um aplicativo pessoal de rastreamento de hábitos (Beaverhabits).
  • Uma ferramenta de segurança que bloqueia tentativas de login maliciosas (Fail2ban).

Eles pediram ao Bibliotecário Veterano para escanear primeiro para criar uma lista de "padrão ouro" de problemas reais. Depois, pediram ao Estagiário Criativo (alimentado por três modelos de IA diferentes: Gemma, Llama e Qwen) para fazer o mesmo trabalho.

O Que Aconteceu? (Os Resultados)

Os resultados foram um pouco desastrosos para o Estagiário Criativo. Aqui está a divisão usando analogias simples:

  • O Problema da "Alucinação": O Estagiário continuava inventando problemas que não existiam. Ele olhava para uma linha de código perfeitamente normal e dizia: "Aha! Isso é um vazamento de senha secreta!", quando na verdade era apenas uma configuração padrão. No artigo, isso é chamado de Falso Positivo. O Estagiário estava tão ansioso para encontrar problemas que sinalizou coisas inofensivas como perigosas.
    • Analogia: É como um segurança que pensa que uma pessoa segurando uma maçã vermelha está segurando uma bomba porque "coisas vermelhas são perigosas".
  • O Problema da "Localização Perdida": Quando o Estagiário realmente encontrava um problema, ele frequentemente não conseguia dizer onde ele estava. Ele dizia: "Há um erro no código", mas quando você perguntava: "Qual arquivo? Qual linha?", ele inventava um nome de arquivo que não existia ou apontava para uma linha que estava vazia.
    • Analogia: É como um detetive dizendo: "O ladrão está na casa", mas quando você pergunta: "Em qual cômodo?", ele adivinha "No sótão", quando o ladrão está, na verdade, no porão.
  • O Problema das "Oportunidades Perdidas": O Estagiário perdeu uma enorme parte dos problemas reais que o Bibliotecário Veterano encontrou. Ele só detectou cerca de 25% dos problemas reais.
    • Analogia: O Bibliotecário encontrou 100 erros de digitação. O Estagiário encontrou apenas 25 deles, e 50 das coisas que ele encontrou nem eram erros de digitação.
  • O Problema da "Velocidade": O Bibliotecário Veterano terminou o trabalho em menos de um minuto. O Estagiário Criativo levou horas (às vezes de 1 a 4 horas por biblioteca) para fazer o mesmo trabalho.
    • Analogia: O Bibliotecário é um trem de alta velocidade. O Estagiário é um caracol que para para cheirar cada flor ao longo do caminho.

O Veredito
O artigo conclui que, no momento, o Estagiário Criativo não está pronto para substituir o Bibliotecário Veterano.

Embora o Estagiário seja ótimo para escrever histórias ou resumir e-mails, ele é atualmente muito pouco confiável para o trabalho específico e de alto risco de escaneamento de segurança. Ele cria muito "ruído" (alarmes falsos), perde muitos perigos reais e demora muito para realizar o trabalho.

Os pesquisadores sugerem que talvez o Estagiário pudesse ser usado como um ajudante para o Bibliotecário — talvez para detectar coisas que o Bibliotecário deixou passar — mas apenas se humanos verificassem cada um de seus palpites primeiro. Mas como uma ferramenta independente para substituir os métodos antigos e confiáveis? O artigo diz não. As "alucinações" (inventar coisas) e a falta de precisão tornam o uso em segurança muito arriscado no momento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →