← Últimos artículos
🤖 machine learning

Constructing Multi-label Hierarchical Classification Models for MITRE ATT&CK Text Tagging

Este artículo presenta un marco de clasificación jerárquica multietiqueta para la automatización del etiquetado de texto de MITRE ATT&CK que logra una alta precisión (94% a nivel de táctica y 82% a nivel de técnica) utilizando métodos de aprendizaje automático clásicos, superando significativamente a GPT-4o al tiempo que elimina la necesidad de arquitecturas complejas basadas en LLM.

Autores originales: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Publicado 2026-01-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un bibliotecario intentando organizar una biblioteca masiva y caótica de historias sobre ciberataques. Cada vez que llega una nueva historia (un "informe de amenaza"), necesitas clasificarla en categorías específicas para que otros bibliotecarios puedan encontrarla más tarde.

En el mundo de la ciberseguridad, este sistema de archivo se llama MITRE ATT&CK. Es como un enorme archivador de dos niveles:

  1. El cajón superior (Tácticas): Responde a la pregunta, "¿Por qué hizo esto el malvado?" (por ejemplo, "Quería robar contraseñas" o "Quería ocultar sus huellas").
  2. El cajón inferior (Técnicas): Responde a la pregunta, "¿Cómo lo hizo?" (por ejemplo, "Usó un tipo específico de correo electrónico de phishing" o "Usó un fallo de software específico").

Durante años, los expertos en seguridad han tenido que leer estos informes y archivarlos manualmente en los cajones correctos. Es lento, aburrido y propenso al error humano. Este artículo trata sobre la construcción de un asistente robotizado para hacer este archivo por ellos.

La construcción "de abajo hacia arriba"

En lugar de intentar construir un robot gigante y complejo desde cero (un enfoque "top-down"), los autores construyeron su sistema paso a paso, como si apilaran bloques. Empezaron con algo pequeño y añadieron complejidad solo cuando supieron que el bloque anterior era sólido.

  1. Paso 1: El Clasificador Simple (El robot de "una etiqueta")
    Primero, enseñaron a un modelo de aprendizaje automático simple a mirar una frase y adivinar un solo "Por qué" (Táctica). Lo probaron contra GPT-4o, el famoso chatbot de IA.

    • El Resultado: El robot simple ganó. Acertó aproximadamente el 82% de las respuestas, mientras que GPT-4o solo acertó el 59%. Los autores descubrieron que, para esta tarea específica y estructurada, una herramienta clásica y sencilla era en realidad mejor que la IA elegante y compleja.
  2. Paso 2: El Clasificador Multietiqueta (El robot de "múltiples etiquetas")
    La vida real no es simple; una sola frase a menudo tiene múltiples razones para un ataque. Así que actualizaron el robot para que adivinara los 3 "Por qués" principales en lugar de solo uno.

    • El Resultado: Esto aumentó su precisión al 94%.
  3. Paso 3: El Clasificador Jerárquico (El robot de "archivo completo")
    Finalmente, enseñaron al robot a adivinar el "Por qué" y el "Cómo" al mismo tiempo. Si el robot adivina que el "Por qué" es "Robar Contraseñas", luego busca el "Cómo" específico (por ejemplo, "Keylogging").

    • El Resultado: Este sistema logró un 82% de precisión para la combinación completa de "Por qué + Cómo".

La "Receta Secreta" (Por qué funciona)

Los autores no utilizaron la IA "Generativa" más reciente y costosa ni redes neuronales complejas. En su lugar, utilizaron aprendizaje automático clásico (específicamente algo llamado "Descenso de Gradiente Estocástico" con "TF-IDF").

Piénsalo de esta manera: en lugar de construir un Ferrari supercomplejo y caro para ir al supermercado, construyeron una bicicleta muy fiable y eficiente. Cumple su función más rápido, cuesta menos y es más fácil de reparar.

También añadieron un bloqueo de privacidad (hashing). Imagina que quisieran compartir su robot con el mundo, pero les preocupaba compartir las recetas secretas (los datos) utilizadas para entrenarlo. Idearon una forma de codificar los datos para que el robot pudiera aprender de ellos sin que nadie pudiera ver los ingredientes originales. Esto permitió que lanzaran el robot al público de forma segura.

La "Prueba de la Nueva Biblioteca"

Para ver si su robot era realmente inteligente, no solo lo probaron con las historias de las que aprendió. Le dieron un nuevo conjunto de historias sobre amenazas financieras (específicas de la banca) que nunca había visto antes.

  • El Resultado: Al principio, el robot estaba confundido (porque las nuevas historias eran diferentes). Pero, cuando le dieron un entrenamiento mínimo con estas nuevas historias, aprendió rápidamente a archivarlas correctamente. Esto demuestra que el robot es flexible y puede adaptarse a nuevas situaciones sin necesidad de una cantidad masiva de datos nuevos.

La Gran Conclusión

El artículo concluye que no siempre se necesita la IA más cara y compleja para resolver un problema. Al dividir la tarea en pasos pequeños y manejables, y al utilizar herramientas clásicas y fiables, construyeron un sistema que:

  • Es más preciso que un chatbot de IA de alto nivel (GPT-4o) para este trabajo específico.
  • Es más rápido y barato de ejecutar.
  • Es seguro de compartir con el público.
  • Puede adaptarse a nuevos tipos de datos con muy poco entrenamiento adicional.

Han puesto este "robot bibliotecario" a disposición de forma gratuita en GitHub para que otros equipos de seguridad puedan usarlo para organizar sus propios informes de ciberamenazas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →