← Últimos artículos
🤖 AI

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

Este estudio empírico concluye que los agentes de LLM de propósito general y de código abierto actuales, impulsados por modelos de Ollama, aún no son adecuados para reemplazar a las herramientas establecidas de Pruebas de Seguridad de Aplicaciones Estáticas (SAST) como Bandit en escenarios de ciberseguridad realistas.

Autores originales: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

Publicado 2026-06-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva de libros (código) y necesitas encontrar cada uno de los errores tipográficos, agujeros en la trama o secretos peligrosos ocultos en ellos. Tienes dos ayudantes para hacer este trabajo:

  1. El Bibliotecario Veterano (Bandit): Esta es una herramienta tradicional. No "piensa" ni "imagina". Tiene una lista de verificación estricta y preescrita de errores conocidos (como "no dejar la puerta trasera abierta" o "no usar una cerradura oxidada"). Escanea los libros rápidamente, metódicamente, y te dice exactamente dónde están los problemas. Es aburrido, pero es confiable.
  2. El Pasante Creativo (El Agente de IA): Este es un nuevo y sofisticado Modelo de Lenguaje Extenso (LLM). Es como un estudiante brillante que ha leído todo el internet. En lugar de una lista de verificación, le das una descripción del puesto: "Encuentra cualquier cosa que parezca peligrosa". Utiliza su imaginación para adivinar qué podría estar mal.

El Experimento
Los investigadores en este artículo decidieron poner a estos dos ayudantes uno contra el otro. Les dieron tres diferentes "bibliotecas" (proyectos de software de código abierto) para escanear:

  • Un gestor de paquetes robusto pero retirado (Yum).
  • Una aplicación personal de seguimiento de hábitos (Beaverhabits).
  • Una herramienta de seguridad que bloquea intentos de inicio de sesión malintencionados (Fail2ban).

Le pidieron al Bibliotecario Veterano que los escaneara primero para crear una lista de "estándar de oro" de problemas reales. Luego, le pidieron al Pasante Creativo (impulsado por tres modelos de IA diferentes: Gemma, Llama y Qwen) que hiciera el mismo trabajo.

¿Qué pasó? (Los Resultados)

Los resultados fueron un poco desastrosos para el Pasante Creativo. Aquí está el desglose usando analogías simples:

  • El problema de la "Alucinación": El Pasante seguía inventando problemas que no existían. Miraba una línea de código perfectamente normal y decía: "¡Ajá! ¡Esto es una filtración de contraseña secreta!", cuando en realidad era solo una configuración estándar. En el artículo, esto se llama un Falso Positivo. El Pasante estaba tan ansioso por encontrar problemas que marcó cosas inofensivas como peligrosas.
    • Analogía: Es como un guardia de seguridad que piensa que una persona que sostiene una manzana roja está sosteniendo una bomba porque "las cosas rojas son peligrosas".
  • El problema de la "Ubicación Perdida": Cuando el Pasante encontraba un problema real, a menudo no podía decirte dónde estaba. Decía: "Hay un error en el código", pero cuando le preguntabas "¿Qué archivo? ¿Qué línea?", inventaba un nombre de archivo que no existía o señalaba a una línea que estaba vacía.
    • Analogía: Es como un detective que dice: "El ladrón está en la casa", pero cuando le preguntas "¿En qué habitación?", responde "El ático", cuando el ladrón está en realidad en el sótano.
  • El problema de las "Oportunidades Perdidas": El Pasante perdió una gran parte de los problemas reales que el Bibliotecario Veterano encontró. Solo detectó aproximadamente el 25% de los problemas reales.
    • Analogía: El Bibliotecario encontró 100 errores tipográficos. El Pasante solo encontró 25 de ellos, y 50 de las cosas que encontró ni siquiera eran errores tipográficos.
  • El problema de la "Velocidad": El Bibliotecario Veterano terminó el trabajo en menos de un minuto. El Pasante Creativo tardó horas (a veces de 1 a 4 horas por biblioteca) en hacer el mismo trabajo.
    • Analogía: El Bibliotecario es un tren de alta velocidad. El Pasante es un caracol que se detiene a oler cada flor a lo largo del camino.

El Veredicto
El artículo concluye que, en este momento, el Pasante Creativo no está listo para reemplazar al Bibliotecario Veterano.

Aunque el Pasante es excelente escribiendo historias o resumiendo correos electrónicos, actualmente es demasiado poco confiable para el trabajo específico y de alto riesgo de escaneo de seguridad. Crea demasiado "ruido" (alarmas falsas), pierde demasiados peligros reales y tarda demasiado en hacer el trabajo.

Los investigadores sugieren que tal vez el Pasante podría ser usado como un ayudante para el Bibliotecario—quizás para detectar cosas que el Bibliotecario pasó por alto—pero solo si los humanos revisan cada uno de sus cálculos primero. Pero como una herramienta independiente para reemplazar los métodos antiguos y confiables, el artículo dice no. Las "alucinaciones" (inventar cosas) y la falta de precisión lo hacen demasiado arriesgado para confiarle la seguridad en este momento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →