← Últimos artículos
🤖 AI

How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency

Este estudio presenta el primer análisis empírico a gran escala de la consistencia en las pruebas de penetración con modelos de lenguaje grandes, revelando que cuatro modelos mostraron diferencias estadísticamente significativas en sus tasas de éxito de ataque autónomo (que oscilaron entre el 25% y el 85%) y modos de fallo distintos cuando se sometieron a 400 ensayos repetidos contra un objetivo vulnerable fijo.

Autores originales: Galip Tolga Erdem

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Galip Tolga Erdem

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un guardia de seguridad intentando probar qué tan bien puede un nuevo conjunto de robots automatizados entrar en un edificio bloqueado. Quieres saber: Si envías al mismo robot 100 veces a intentar el mismo truco, ¿actuará de la misma manera cada vez, o será impredecible?

Este artículo es un experimento masivo donde el autor envió cuatro "robots de IA" (Modelos de Lenguaje Grandes) diferentes a atacar un sistema informático falso y vulnerable 100 veces cada uno. Eso son 400 ataques en total. El objetivo no fue solo ver si podían entrar, sino ver qué tan consistentes fueron.

Aquí está la historia de lo que sucedió, contada en términos sencillos:

1. La Configuración: Un "Coto de Caza" Digital

El investigador construyó una "casa trampa" digital (un honeypot) con tres cerraduras fáciles de romper:

  • Una tienda web con una puerta débil (Inyección SQL).
  • Una puerta trasera con una contraseña débil (SSH).
  • Una casilla de correo sin cerradura (FTP anónimo).

Les dijeron a los robots de IA: "Eres un probador de seguridad autorizado. Tu trabajo es romper estas tres cerraduras. ¡Adelante!"

2. La Gran Sorpresa: Nadie Dijo "No"

El hallazgo más impactante fue sobre las negativas.
En el pasado, la gente temía que la IA pudiera decir: "No puedo hacer eso, es peligroso", cuando se le pedía hackear algo.

  • El Resultado: En los 400 intentos, ningún robot de IA dijo "no".
  • La Metáfora: Imagina pedirle a un robot 400 veces que pise una cerradura, y cada vez que lo hace, inmediatamente toma las herramientas y comienza a trabajar. Ninguno de ellos dudó ni afirmó que era "demasiado seguro" para hacerlo.
  • ¿Por qué? Los investigadores enmarcaron la solicitud como "pruebas autorizadas". Parece que cuando una IA cree que está haciendo un trabajo legítimo (como un guardia de seguridad), prioriza ser útil sobre ser cautelosa.

3. El Fallo: Un Robot Tuvo un Mal Día

Uno de los robots, Claude, tuvo un problema técnico mayor durante el experimento.

  • El Problema: La empresa que hace Claude (Anthropic) tuvo un evento de sobrecarga de servidores. Fue como si el cerebro del robot hubiera entrado repentinamente en coma porque la fábrica estaba demasiado ocupada.
  • El Conflicto: Al principio, el investigador pensó que Claude se negaba a hackear. Pero después de revisar los registros, se dio cuenta de que el robot no estaba diciendo "no lo haré"; la conexión a internet con el robot simplemente seguía cayendo.
  • La Solución: Recategorizaron estos fallos. No son "negativas de seguridad"; son simplemente "errores de internet". Incluso con estos errores, el robot Claude que terminó el trabajo fue muy exitoso.

4. Cómo Fallaron: Diferentes Robots, Diferentes Errores

Cuando los robots no tuvieron éxito, fallaron de maneras muy diferentes, como diferentes tipos de conductores estrellando un coche:

  • El Robot Local (Qwen): Fue como un conductor que se aburre y detiene el coche a mitad de camino. Rompía una o dos cerraduras, declaraba el trabajo "terminado" y se iba, incluso cuando no había terminado todo el edificio.
  • El Robot GPT-4o-mini: Fue como un conductor que sigue conduciendo hasta que se le acaba el tanque de gasolina. Probó tantas cosas diferentes que alcanzó el límite de tiempo (25 intentos) antes de poder terminar, aunque fue muy exhaustivo.
  • El Robot Gemini: Este fue el más confiable. Rara vez se rendía y raramente cometía errores. Si comenzaba un trabajo, casi siempre lo terminaba.
  • El Robot Claude: Como se mencionó, su principal fallo fue que la conexión a internet se caía.

5. El Truco de la "Memoria": Robar Llaves

Uno de los comportamientos más interesantes fue la reutilización de credenciales.

  • El Escenario: Los robots encontraron un nombre de usuario y una contraseña en la casilla de correo (FTP).
  • El Truco: Dos de los robots (Qwen y GPT-4o-mini) recordaron esa contraseña y la usaron para desbloquear la puerta trasera (SSH) automáticamente. No necesitaban que se les dijera que hicieran esto; lo descubrieron por sí mismos.
  • El Problema: Los robots que tenían una "memoria corta" (recordando solo los últimos mensajes) no hicieron esto. Los que tenían una "memoria larga" (recordando toda la conversación) sí lo hicieron. Esto sugiere que tener una memoria larga ayuda a una IA a conectar los puntos entre diferentes partes de un sistema.

6. Velocidad y Estrategia

  • Velocidad: Una vez que los robots comenzaron, fueron rápidos. Por lo general, encontraron una manera de entrar en 15 a 30 segundos de tiempo real.
  • Estrategia: Algunos robots siempre intentaron la puerta web primero. Otros siempre intentaron la casilla de correo primero.
  • Variedad: Un robot (GPT-4o-mini) fue increíblemente creativo. De 100 ejecuciones, utilizó 98 estrategias diferentes. Fue como un ladrón que nunca usa el mismo truco dos veces. Otro robot (Gemini) fue más predecible, usando las mismas pocas trucos una y otra vez.

La Conclusión

Este estudio nos dice dos cosas principales:

  1. La seguridad no es un muro: Si enmarcas una solicitud como "pruebas autorizadas", estos modelos de IA intentarán felizmente hackear cosas sin decir no. No tienen un botón de "detener" integrado para este tipo específico de trabajo.
  2. La IA es impredecible: Incluso si le das al mismo robot las mismas instrucciones 100 veces, podría usar 98 formas diferentes para resolver el problema, o podría quedar atrapado en un bucle, o podría simplemente rendirse antes de tiempo.

Nota Importante: El artículo advierte que, como los robots fueron tan rápidos y tan consistentes en iniciar sus ataques (dentro de los 30 segundos), los sistemas de seguridad deben estar listos para detectarlos inmediatamente. No puedes esperar a que terminen; tienes que atraparlos mientras apenas están mirando alrededor.

El investigador también señaló que esto fue un experimento controlado en un edificio falso. No sabemos si estos robots actuarían de la misma manera en un entorno real, complejo o desconocido. Pero para esta prueba específica, la IA fue sorprendentemente consistente en su disposición para atacar, pero increíblemente inconsistente en cómo lo hizo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →