← Últimos artículos
💻 computer science

A Comprehensive Study of Supervised Machine Learning Models for Zero-Day Attack Detection: Analyzing Performance on Imbalanced Data

Este estudio evalúa cinco modelos de aprendizaje automático supervisado para la detección de ataques de día cero en datos desbalanceados, seleccionando finalmente a XGBoost como la solución óptima debido a su equilibrio superior entre alta precisión y tiempo de procesamiento rápido en comparación con el más preciso pero más lento Random Forest.

Autores originales: Zahra Lotfi, Mostafa Lotfi

Publicado 2026-08-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zahra Lotfi, Mostafa Lotfi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el internet es una ciudad enorme y bulliciosa donde los datos fluyen como el tráfico en autopistas interminables. En esta ciudad, los guardias de seguridad (firewalls y software antivirus) se encuentran en cada punto de control, revisando identificaciones para asegurarse de que nadie se cuele. Normalmente, estos guardias tienen un libro de "Carteles de Se Busca" lleno de fotos de criminales conocidos. Si un extraño se parece a alguien de la lista, es detenido. Pero, ¿qué pasa cuando aparece un criminal totalmente nuevo, uno que nunca antes había sido visto, con un rostro que no coincide con ninguna foto del libro? Esta es la pesadilla de un ataque de "día cero" (zero-day): un intruso digital utilizando un truco nuevo que los sistemas de seguridad nunca han encontrado.

Para atrapar a estos ladrones invisibles, los científicos están recurriendo a un tipo especial de detective llamado Aprendizaje Automático (Machine Learning). Piensa en estos detectives como estudiantes que estudian miles de ejemplos de "tráfico bueno" y "tráfico malo" para aprender los patrones. Sin embargo, hay un problema complicado en su aula: el profesor (los datos) les da demasiados ejemplos de tráfico bueno y muy pocos ejemplos de tráfico malo. Es como intentar aprender a reconocer a un animal raro y tímido en un bosque donde el 99% de las criaturas son solo ardillas. El estudiante podría volverse muy bueno detectando ardillas, pero podría pasar por alto por completo al animal raro porque apenas lo vio durante su entrenamiento. Este artículo profundiza en cómo enseñar a estos detectives digitales a detectar esas amenazas nuevas y raras sin confundirse con la abrumadora cantidad de ardillas normales.


La Gran Carrera de los Detectives Digitales

En este estudio, los investigadores Zahra Lotfi y Mostafa Lotfi establecieron un campo de entrenamiento masivo para ver qué modelo de aprendizaje automático podría convertirse en el detector definitivo de ataques de día cero. No solo querían saber qué modelo era el más inteligente; también querían saber cuál era el más rápido. Después de todo, en el mundo real, un guardia de seguridad que tarda una hora en revisar la identificación de una sola persona es inútil, incluso si nunca falla un criminal.

Los investigadores utilizaron un conjunto de datos gigante llamado UNSW-NB15, que contiene más de 1.4 millones de registros de tráfico de red. Para que la prueba fuera realista, crearon un escenario donde los modelos eran entrenados con una mezcla de tráfico normal y ataques conocidos, pero luego eran probados con un ataque de "día cero" que nunca habían visto antes. Para complicar las cosas aún más, utilizaron un conjunto de datos fuertemente sesgado, con el tráfico normal superando ampliamente a los ataques, tal como sucede en la vida real.

Probaron cinco "detectives" diferentes (modelos de aprendizaje automático):

  1. Árbol de Decisión (DT): Un modelo que hace una serie de preguntas de sí o no para tomar una decisión.
  2. Regresión Logística (LR): Un modelo estadístico que calcula la probabilidad de que algo sea un ataque.
  3. Bosque Aleatorio (RF): Un equipo de muchos Árboles de Decisión que votan sobre la respuesta.
  4. XG Boost (XGB): Un equipo poderoso que construye sobre sus errores para volverse más inteligente, conocido por ser muy rápido.
  5. MLP (Perceptrón Multicapa): Un modelo de aprendizaje profundo que imita las capas de neuronas de un cerebro humano.

La Magia de Equilibrar la Balanza

Uno de los mayores obstáculos que los investigadores abordaron fue el "problema del desequilibrio de clases". Dado que había muy pocos ejemplos de ataques en comparación con los normales, los modelos tenían dificultades para aprender cómo se veía realmente un ataque. Para solucionar esto, el equipo utilizó una técnica llamada SMOTE (Técnica de Sobremuestreo Sintético de la Minoría).

Imagina que estás intentando enseñarle a un niño a reconocer un pájaro azul poco común, pero solo tienes una foto de él. Es probable que el niño olvide cómo es. SMOTE es como una fotocopiadora mágica que crea fotos nuevas y ligeramente diferentes de ese pájaro azul, mezclando la foto original con sus vecinas. Esto le da al niño suficientes ejemplos para entender realmente cómo es el pájaro sin necesidad de encontrar más pájaros reales en la naturaleza. Los investigadores aplicaron esto a sus datos, creando ejemplos de ataques sintéticos para equilibrar el conjunto de entrenamiento.

Los Resultados: ¿Quién Ganó la Carrera?

Los resultados fueron una mezcla de "el más inteligente" y "el más rápido", y el ganador dependía de lo que tú valoraras más.

Cuando los modelos fueron probados sin el truco de equilibrio (SMOTE), tuvieron dificultades para detectar los ataques raros. Por ejemplo, el modelo de Bosque Aleatorio solo detectó aproximadamente el 83.11% de los ataques, mientras que el modelo MLP fue aún peor, detectando solo el 25.35%.

Sin embargo, cuando usaron SMOTE para equilibrar los datos, el rendimiento se disparó.

  • El Detective más Inteligente: El modelo de Bosque Aleatorio (RF) fue el claro campeón en términos de precisión. Con los datos equilibrados, logró capturar un masivo 94.38% de los ataques de día cero (Recall) con una precisión del 98.91%. Fue el más fiable para no dejar pasar a los malos.
  • El Velocista: Pero aquí está el truco. El Bosque Aleatorio era increíblemente lento. Tardó 1,379.10 segundos (más de 22 minutos) en procesar los datos de prueba. En un ciberataque real, esperar 22 minutos para detener a un hacker es como esperar a que un incendio consuma todo el edificio antes de llamar al departamento de bomberos.
  • El Mejor Todo Terreno: Entra el XG Boost (XGB). Aunque no detectó tantos ataques como el Bosque Aleatorio (detectó el 81.40%), era increíblemente rápido. Completó la misma tarea en solo 5.08 segundos. También mantuvo una alta precisión del 98.21%.

El Veredicto

Los investigadores concluyeron que, si bien el Bosque Aleatorio es técnicamente el modelo más preciso para encontrar estos ataques de día cero invisibles, es demasiado lento para ser práctico en sistemas de seguridad en tiempo real. Si necesitas un guardia que nunca duerme y nunca pierde el ritmo, pero que tarda una eternidad en pensar, podrías tener un problema.

En su lugar, coronaron al XG Boost como la mejor opción para el uso en el mundo real. Ofreció el mejor equilibrio, siendo "extremadamente rápido y preciso". Demostró que no siempre necesitas el detector absolutamente perfecto; necesitas uno que sea lo suficientemente rápido como para detener el ataque antes de que cause daños.

El estudio también confirmó que la "fotocopiadora mágica" (SMOTE) era esencial. Sin ella, los modelos eran ciegos ante los ataques raros. Con ella, incluso los modelos más lentos mejoraron significativamente, aunque la velocidad del modelo siguió siendo el factor decisivo para determinar cuál debería usarse en el mundo real.

Al final, esta investigación muestra que en la carrera por atrapar a los criminales digitales, ser el más inteligente no es suficiente; también tienes que ser rápido. Y a veces, el segundo detective más inteligente que puede correr una milla en segundos es el que realmente salva el día.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →