← Últimos artigos
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Este artigo demonstra que, embora os LLMs agênticos exibam alta estabilidade ao reproduzir vulnerabilidades conhecidas, sua capacidade de descobrir novos problemas é altamente inconsistente, sugerindo que as revisões de segurança baseadas em LLM devem complementar, em vez de substituir, a análise estática de segurança de aplicações (SAST) determinística.

Autores originais: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou um segurança muito rigoroso e cumpridor de regras (vamos chamá-lo de SAST) e uma detetive brilhante, criativa, mas às vezes distraída (vamos chamá-la de LLM). Ambos foram contratados para inspecionar o mesmo pequeno edifício de JavaScript em busca de armadilhas ocultas (vulnerabilidades).

O artigo "Snyk VulnBench JS 1.0" faz uma pergunta simples, mas crucial: Se você enviar ambos para inspecionar o exato mesmo edifício cinco vezes seguidas, eles darão exatamente o mesmo relatório todas as vezes?

Aqui está o que eles descobriram, dividido em conceitos cotidianos:

1. O Guarda Rigoroso vs. A Detetive Criativa

  • O Guarda Rigoroso (SAST): Esta ferramenta é como um robô com um checklist. Se o código não mudou, o robô dá o mesmo relatório exatamente da mesma forma todas as vezes. Ele nunca se cansa, nunca se distrai e nunca perde a mesma coisa duas vezes. Neste estudo, ele foi 100% consistente.
  • A Detetive Criativa (LLM): Esta é uma IA que consegue "pensar" e raciocinar. Ela é ótima para detectar armadilhas complicadas e estranhas que um robô poderia deixar passar. No entanto, ela é como um ser humano: às vezes está afiada, às vezes está cansada e, às vezes, vê coisas que não existem de verdade.

2. O Teste das "Cinco Vezes"

Os pesquisadores enviaram a detetive de IA para inspecionar o código cinco vezes seguidas. Aqui está o que aconteceu:

  • Quando a IA encontrou uma armadilha "conhecida": Se a IA detectou uma armadilha que o Guarda Rigoroso já havia identificado, ela foi muito confiável. Ela encontrou essa mesma armadilha em quase todas as execuções (85% das vezes). Ela foi consistente quando concordou com as regras.
  • Quando a IA encontrou uma armadilha "nova": Foi aqui que as coisas ficaram bagunçadas. A IA começou a relatar novas armadilhas únicas que o Guarda Rigoroso não viu.
    • O Problema: Quase metade desses relatórios "novos" eram fenômenos de uma única vez. Eles apareceram em apenas uma das cinco execuções e depois desapareceram.
    • A Analogia: Imagine que a detetive diz: "Eu vi um fantasma no corredor!" na segunda-feira. Na terça-feira, ela diz: "Não, não vi fantasma nenhum". Na quarta-feira, ela diz: "Na verdade, era só um cabide". Na quinta-feira, "Fantasma!" novamente. Se você é o dono do edifício, você não sabe se deve ficar assustado ou se ela está apenas imaginando coisas.

3. O Fator "Ruído"

O estudo descobriu que os relatórios "extras" da IA eram muito ruidosos.

  • Os Relatos de "Uma Vez Só": Cerca de 50% das coisas únicas que a IA relatou aconteceram apenas uma vez. Se você executasse a varredura cinco vezes, obteria uma lista completamente diferente de avisos "extras" dependendo de qual execução você capturasse.
  • Os Relatos Estáveis: As coisas sobre as quais a IA e o Guarda Rigoroso concordavam eram estáveis. Elas não mudavam.

4. Maior Não Significa Melhor

Os pesquisadores testaram diferentes versões da IA, incluindo uma versão "super-cara" e "super-inteligente".

  • O Resultado: A IA mais cara e poderosa não fez o melhor trabalho. Na verdade, ela era mais cara, usava mais poder computacional e era menos consistente do que uma versão mais barata e menor.
  • A Lição: Só porque você paga pela detetive mais "inteligente", não significa que ela dará um relatório mais confiável. Às vezes, a detetive mais simples e focada é mais consistente.

5. Diferentes Forças, Diferentes Pontos Cegos

O artigo conclui que você não deve escolher um ou outro; você precisa de ambos.

  • O Guarda Rigoroso é incrível para verificar sistematicamente cada cano e fio em busca de vazamentos (como verificar fluxos de dados repetidos). Ele nunca perde o mesmo vazamento duas vezes.
  • A Detetive Criativa é ótima para detectar padrões complexos e estranhos que parecem uma armadilha, mas podem não estar em um checklist (como detectar uma injeção de SQL suspeita que o guarda deixou passar).
  • O Porém: A detetive às vezes deixa passar os vazamentos óbvios e repetidos que o guarda detecta, e às vezes a detetive se confunde com armadilhas falsas.

A Conclusão Final

Se você confiar apenas na detetive de IA, poderá receber um relatório de segurança diferente toda vez que fizer a verificação, e terá que gastar muito tempo tentando descobrir quais dos "fantasmas" dela são reais e quais são apenas cabides.

Se você confiar apenas no Guarda Rigoroso, poderá perder as armadilhas mais complicadas e criativas.

A Melhor Estratégia: Use o Guarda Rigoroso para pegar os vazamentos óbvios e repetidos (porque ele nunca muda de ideia) e use a Detetive Criativa para encontrar as coisas complicadas e incomuns, mas esteja preparado para duvidar de suas descobertas "extras", pois elas podem ser apenas um acaso. Eles funcionam melhor quando um ajuda o outro, não quando tentam substituir um ao outro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →