← Últimos artigos
💻 computer science

RealVuln: Benchmarking Rule-Based, General-Purpose LLM, and Security-Specialized Scanners on Real-World Code

O artigo apresenta o RealVuln, o primeiro benchmark de código aberto que compara scanners baseados em regras, LLMs de propósito geral e ferramentas especializadas em segurança em código real, demonstrando que os scanners especializados superam significativamente as outras categorias na detecção de vulnerabilidades.

Autores originais: John Pellew, Faizan Raza

Publicado 2026-04-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: John Pellew, Faizan Raza

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o dono de uma grande cidade (seu código de software) e precisa garantir que não há buracos nas calçadas, pontes fracas ou portas destrancadas que possam deixar ladrões entrarem. Para isso, você contrata três tipos diferentes de "inspetores de segurança":

  1. Os "Caçadores de Padrões" (Ferramentas Tradicionais): Eles usam uma lista de regras rígida. Se virem uma porta aberta, eles gritam "PERIGO!". Mas se a porta estiver trancada de um jeito estranho que não está na lista, eles não veem nada.
  2. Os "Polímatas Inteligentes" (LLMs Gerais): São como consultores superinteligentes que leram todos os livros do mundo. Eles tentam entender o contexto: "Hmm, essa porta parece estranha porque o dono da casa está dormindo perto dela". Eles são bons, mas às vezes se distraem ou demoram muito.
  3. Os "Especialistas em Segurança" (Ferramentas de IA Especializadas): São como detetives que nasceram para caçar ladrões. Eles usam a inteligência dos polímatas, mas têm um mapa específico da cidade e sabem exatamente onde os ladrões costumam esconder as chaves.

O artigo RealVuln é como um grande campeonato de inspeção organizado para ver quem realmente funciona na vida real.

O Cenário do Teste

Os autores pegaram 26 "cidades de treinamento" (repositórios de código Python) que foram construídas propositalmente com muitos defeitos e armadilhas.

  • O Desafio: Havia 676 buracos reais (vulnerabilidades) e 120 "iscas" (coisas que pareciam perigosas, mas eram seguras).
  • O Objetivo: Descobrir quem encontra mais buracos reais sem gritar "Fogo!" quando só é uma fumaça inofensiva.

Os Resultados: A Hierarquia de Três Níveis

O teste revelou uma diferença gigantesca entre os grupos, criando três "camadas" de desempenho:

🥇 O Nível de Ouro: Os Especialistas (Kolega.Dev)

  • A Analogia: Imagine um detetive que não só vê a porta aberta, mas cheira o ar, analisa a trilha de sapatos e sabe que o ladrão entrou pelo telhado.
  • O Resultado: A ferramenta especializada Kolega.Dev venceu de longe. Ela encontrou 81% de todos os buracos reais.
  • O Preço: Ela gritou um pouco mais de "falsos alarmes" (achou que algumas portas seguras estavam abertas), mas para segurança, é melhor errar pelo excesso de cautela do que deixar um ladrão passar. Ela foi a mais barata e eficiente também.

🥈 O Nível de Prata: Os Polímatas (LLMs Gerais como Claude Sonnet)

  • A Analogia: São consultores muito inteligentes que leem o manual da cidade. Eles entendem bem, mas às vezes se perdem em detalhes ou demoram para responder.
  • O Resultado: O modelo Claude Sonnet 4.6 ficou em segundo lugar, encontrando cerca de 50% dos buracos.
  • O Problema: Eles são bons, mas não são feitos apenas para segurança. Eles são "generalistas". Além disso, alguns modelos mais "inteligentes" (como o Opus) falharam em completar a inspeção de algumas cidades porque ficaram presos em detalhes ou demoraram demais.

🥉 O Nível de Bronze: Os Caçadores de Padrões (Semgrep, SonarQube)

  • A Analogia: São inspetores que só olham para a cor da porta. Se a porta for vermelha e aberta, eles avisam. Se for azul, eles ignoram, mesmo que esteja destrancada.
  • O Resultado: As ferramentas tradicionais encontraram menos de 20% dos buracos reais.
  • A Lição: No mundo moderno, onde os hackers são criativos, apenas seguir uma lista de regras não é suficiente.

Por que isso importa? (A Metáfora do "Falso Alarme")

O artigo explica algo crucial sobre como medimos o sucesso:

  • Precisão vs. Memória: Um inspetor pode ser muito "preciso" (só grita quando tem 100% de certeza), mas se ele gritar apenas 1 vez em 100, ele deixou 99 ladrões entrarem.
  • A Escolha: Em segurança, deixar um ladrão entrar é muito pior do que ter que investigar um falso alarme.
  • Por isso, o teste usou uma métrica chamada F3, que pune muito mais quem deixa passar um buraco do que quem dá um falso alarme. Sob essa lógica, o "Especialista" (Kolega) venceu porque ele garante que a cidade está segura, mesmo que tenha que checar algumas portas que estavam fechadas.

Conclusão Simples

O papel nos diz que:

  1. Ferramentas antigas (baseadas apenas em regras) estão ficando obsoletas para encontrar problemas complexos. Elas deixam passar a maioria dos perigos.
  2. Inteligência Artificial Geral (como o ChatGPT) é um grande avanço, ajudando muito mais que as ferramentas antigas, mas ainda não é perfeita para segurança profissional.
  3. O Futuro é a "IA Especializada": O vencedor foi uma ferramenta feita especificamente para segurança, que combina a inteligência da IA com um conhecimento profundo de como hackers atacam.

Resumo da Ópera: Se você quer proteger sua casa (ou seu software), não basta ter um guarda que só olha a cor da porta, nem um consultor que leu todos os livros. Você precisa de um detetive especializado que usa a tecnologia mais recente para caçar ameaças reais, mesmo que isso signifique checar algumas portas que parecem suspeitas, mas não estão.

O artigo também promete que isso é um "benchmark vivo", ou seja, eles vão continuar testando novas ferramentas e cidades (códigos) no futuro, mantendo tudo aberto para que qualquer pessoa possa verificar os resultados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →