← Últimos artículos
🤖 AI

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

Este documento de posición sostiene que para contrarrestar los inevitables ataques cibernéticos impulsados por la IA, los defensores deben cambiar fundamentalmente su estrategia mediante el desarrollo y despliegue responsable de sus propias capacidades de IA ofensiva dentro de entornos controlados y gobernados para dominar las amenazas antes que sus adversarios.

Autores originales: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

Publicado 2026-02-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran idea: Las reglas antiguas ya no funcionan

Durante la última década, la ciberseguridad ha funcionado como un juego de "Whac-A-Mole" (golpear al topo).

  • La forma antigua: Los hackers tenían que ser humanos altamente capacitados. Construir un ataque complejo era como construir una casa personalizada; requería meses de arduo trabajo y una profunda experiencia. Debido a que era tan costoso y lento, los hackers solo atacaban las "casas grandes" (empresas importantes) o usaban herramientas simples y genéricas para tocar miles de puertas esperando que alguna estuviera abierta. Los defensores asumían que los hackers no podían permitirse el lujo de tocar cada puerta.
  • La nueva amenaza: Los Agentes de IA están cambiando el juego. Imagina a un hacker que no es una persona, sino un enjambre de miles de diminutos y agotables robots. Estos robots no necesitan ser expertos. Pueden tocar millones de puertas en un segundo. Incluso si fallan el 99% de las veces, solo necesitan tener éxito el 1% de las veces para obtener beneficios. Pueden atacar las "casas pequeñas" (sistemas de nicho) que antes los humanos ignoraban porque no valía la pena el esfuerzo.

El artículo argumenta que los defensores están intentando detener a estos robots poniendo carteles de "Prohibido el paso" en los propios robots. Pero el artículo dice que esto no funcionará porque los actores malintencionados pueden simplemente construir sus propios robots sin esos carteles.

Por qué las defensas actuales están fallando

Los autores dicen que estamos intentando detener a los hackers de IA utilizando tres métodos principales, pero todos son como intentar detener una inundación con un colador:

  1. Filtrar los datos de entrenamiento (El enfoque de la "Biblioteca Limpia"):

    • La idea: Eliminamos todas las instrucciones malas (como "cómo construir una bomba") de los libros de entrenamiento de la IA para que nunca aprenda a ser mala.
    • Por qué falla: Los malos hackers no necesitan leer los "libros malos". Pueden enseñar a la IA a descubrir cómo hackear usando lógica básica y sentido común, tal como un humano puede descubrir cómo abrir una cerradura sin un manual. Además, los malos hackers pueden simplemente descargar la IA y enseñárselo ellos mismos.
  2. Alineación de seguridad (El enfoque del "Buen Comportamiento"):

    • La idea: Entrenamos a la IA para que diga "No" cuando se le pide que haga algo malo.
    • Por qué falla: Los malos hackers son astutos. Pueden engañar a la IA para que piense que una petición mala es en realidad una buena (como pedirle a un guardia que "pruebe la seguridad" en lugar de "entrar a la fuerza"). Además, si la IA se está ejecutando en la propia computadora de un hacker, este puede simplemente reentrenarla para que ignore el botón de "No".
  3. Guardrails de salida (El enfoque del "Portero"):

    • La idea: Ponemos un portero en la puerta para revisar cada mensaje que la IA envía y bloquear cualquier cosa que parezca peligrosa.
    • Por qué falla: Un hacker puede dividir un gran ataque en mil pasos diminutos y de apariencia inofensiva. El portero ve cada paso como seguro, pero cuando los unes todos, construyen una bomba.

La solución propuesta: Construir tus propios robots de "Red Team"

El artículo sugiere un cambio radical: Debemos enseñar a nuestros propios agentes de IA cómo hackear, para poder usarlos para defendernos.

Piénsalo como un departamento de bomberos.

  • Defensa actual: Esperamos a que comience un incendio y luego intentamos apagarlo.
  • La idea del artículo: Contratamos a un equipo de profesionales de los incendios provocados (nuestra "IA Ofensiva") para que trabajen dentro de una instalación de entrenamiento segura y vallada (un "Cyber Range").
    • Estos "Buenos Incendiarios" intentan quemar el edificio usando todos los trucos posibles.
    • Debido a que son IA, pueden intentar millones de formas de iniciar un fuego en segundos.
    • Observamos dónde tienen éxito, encontramos los puntos débiles de nuestro edificio y los arreglamos antes de que aparezca un verdadero mal actor.

Los tres pasos para que esto sea seguro

Los autores saben que esto suena peligroso, por lo que proponen tres reglas estrictas para evitar que los "Buenos Incendiarios" causen daños reales:

  1. Construir mejores pistas de prueba: Necesitamos mejores "cursos de conducción" (benchmarks) para medir exactamente qué tan buenos son estos robots de hackeo. Necesitamos probarlos en escenarios del mundo real, no solo en acertijos simples.
  2. Entrenar, no solo programar: En lugar de darles a los robots una lista fija de pasos a seguir, necesitamos entrenarlos para que aprendan y se adapten, tal como lo haría un hacker humano. Esto los hace mejores para encontrar debilidades nuevas y desconocidas.
  3. La regla del "Sandbox" (Caja de arena): Esta es la parte más importante. Los "Buenos Incendiarios" nunca deben salir de la instalación de entrenamiento segura.
    • Se quedan dentro de una jaula digital donde no pueden tocar el internet real.
    • Encuentran los agujeros y escriben un informe.
    • Luego, tomamos ese informe y se lo entregamos a una "IA Segura" diferente que solo sabe cómo reparar agujeros, no crearlos. Esta "IA Segura" es la que lanzamos al público para proteger nuestros sistemas.

La conclusión

El artículo concluye que no podemos esperar a que los malos hackers descubran cómo usar la IA para atacarnos. Para cuando lo hagan, será demasiado tarde.

En su lugar, debemos dominar el arma primero. Necesitamos construir nuestra propia IA ofensiva, mantenerla encerrada en una jaula segura y usarla para encontrar cada posible manera en que nuestros sistemas puedan ser vulnerados. Solo comprendiendo cómo piensa y actúa el enemigo a una escala masiva podremos esperar defendernos.

En resumen: Para detener a los malos robots, tenemos que construir nuestros propios robots buenos que sean incluso mejores rompiendo cosas, pero debemos mantenerlos en una jaula para que solo nos ayuden a arreglar nuestra casa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →