← Últimos artículos
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Este artículo demuestra que, si bien los LLM agénticos exhiben una alta estabilidad al reproducir vulnerabilidades conocidas, su capacidad para descubrir nuevos problemas es altamente inconsistente, lo que sugiere que las revisiones de seguridad basadas en LLM deben complementar en lugar de reemplazar el análisis estático de seguridad de aplicaciones (SAST) determinista.

Autores originales: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un guardia de seguridad muy estricto y que sigue las reglas al pie de la letra (llamémoslo SAST) y a una detective brillante, creativa pero a veces distraída (llamémosla LLM). Ambos han sido contratados para inspeccionar el mismo pequeño edificio de JavaScript en busca de trampas ocultas (vulnerabilidades).

El documento "Snyk VulnBench JS 1.0" plantea una pregunta simple pero crucial: Si les envías a ambos a inspeccionar exactamente el mismo edificio cinco veces seguidas, ¿te entregarán el mismo informe exacto cada vez?

Esto es lo que encontraron, desglosado en conceptos cotidianos:

1. El Guardia Estricto vs. La Detective Creativa

  • El Guardia Estricto (SAST): Esta herramienta es como un robot con una lista de verificación. Si el código no ha cambiado, el robot entrega exactamente el mismo informe cada vez. Nunca se cansa, nunca se distrae y nunca pasa por alto lo mismo dos veces. En este estudio, fue 100% consistente.
  • La Detective Creativa (LLM): Esta es una IA que puede "pensar" y razonar. Es excelente para detectar trampas complicadas y extrañas que un robot podría pasar por alto. Sin embargo, es como un humano: a veces está aguda, a veces está cansada y a veces ve cosas que en realidad no están ahí.

2. La Prueba de las "Cinco Veces"

Los investigadores enviaron a la detective de IA a inspeccionar el código cinco veces seguidas. Esto es lo que sucedió:

  • Cuando la IA encontró una trampa "conocida": Si la IA detectaba una trampa que el Guardia Estricto ya había identificado, era muy confiable. Detectó esa misma trampa en casi todas las ejecuciones (el 85% de las veces). Era consistente cuando estaba de acuerdo con las reglas.
  • Cuando la IA encontró una trampa "nueva": Aquí es donde se volvió caótico. La IA comenzó a reportar trampas nuevas y únicas que el Guardia Estricto no vio.
    • El Problema: Casi la mitad de estos reportes "nuevos" fueron éxitos de un solo golpe. Aparecieron en solo una de las cinco ejecuciones y luego desaparecieron.
    • La Analogía: Imagina que la detective dice: "¡Vi un fantasma en el pasillo!" el lunes. El martes dice: "No, no hay fantasma". El miércoles dice: "En realidad, era solo un perchero". El jueves dice: "¡Fantasma!" otra vez. Si tú eres el dueño del edificio, no sabes si deberías tener miedo o si ella solo está imaginando cosas.

3. El Factor "Ruido"

El estudio encontró que los reportes "extra" de la IA eran muy ruidosos.

  • Los Reportes de "Un Solo Golpe": Cerca del 50% de las cosas únicas que la IA reportó ocurrieron solo una vez. Si ejecutaras el escaneo cinco veces, obtendrías una lista de advertencias "extra" completamente diferente dependiendo de qué ejecución te tocara capturar.
  • Los Reportes Estables: Las cosas en las que la IA y el Guardia Estricto estaban de acuerdo eran estables. No cambiaban.

4. Más Grande no Significa Mejor

Los investigadores probaron diferentes versiones de la IA, incluyendo una versión "súper costosa" y "súper inteligente".

  • El Resultado: La IA más cara y potente no fue la que mejor hizo el trabajo. De hecho, era más cara, usaba más potencia de cómputo y era menos consistente que una versión más pequeña y económica.
  • La Lección: No porque pagues por el detective más "inteligente" obtienes un informe más confiable. A veces, el detective más simple y enfocado es más consistente.

5. Diferentes Fortalezas, Diferentes Puntos Ciegos

El documento concluye que no deberías elegir uno sobre el otro; necesitas ambos.

  • El Guardia Estricto es increíble para revisar sistemáticamente cada tubería y cable en busca de fugas (como verificar flujos de datos repetidos). Nunca pierde la misma fuga dos veces.
  • La Detective Creativa es excelente para detectar patrones complejos y extraños que parecen una trampa pero que podrían no estar en una lista de verificación (como detectar una inyección SQL sospechosa que el guardia pasó por alto).
  • El Problema: La detective a veces pasa por alto las fugas obvias y repetidas que el guardia detecta, y a veces se confunde con trampas falsas.

La Conclusión Final

Si dependes solo de la detective de IA, podrías obtener un informe de seguridad diferente cada vez que revises, y tendrás que gastar mucho tiempo tratando de averiguar cuáles de sus "fantasmas" son reales y cuáles son solo percheros.

Si dependes solo del Guardia Estricto, podrías perderte las trampas más complicadas y creativas.

La Mejor Estrategia: Usa al Guardia Estricto para atrapar las fugas obvias y repetidas (porque nunca cambia de opinión), y usa a la Detective Creativa para encontrar las cosas extrañas y complicadas, pero prepárate para verificar dos veces sus hallazgos "extra", ya que podrían ser errores fortuitos. Funcionan mejor cuando se ayudan mutuamente, no cuando intentan reemplazarse el uno al otro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →