← Últimos artículos
💻 computer science

From Telemetry to Techniques: Behavior-Centric MITRE ATT&CK Technique Classification Through Sysmon Event Correlation

Este artículo propone un marco centrado en el comportamiento que reconstruye los eventos de Sysmon en secuencias correlacionadas por GUID para mejorar la clasificación de las técnicas de MITRE ATT&CK, demostrando que la preservación del contexto a nivel de proceso supera al agrupamiento temporal y que un modelo base SecureBERT logra resultados superiores sin mitigación explícita del desequilibrio de clases.

Autores originales: Amir Hossein Hemmati, Babak Sadeghiyan, Mahsa Saeidi

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Amir Hossein Hemmati, Babak Sadeghiyan, Mahsa Saeidi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio en una ciudad enorme y caótica. La ciudad es tu computadora, y los "sospechosos" son cibercriminales tratando de entrar por la fuerza. Durante mucho tiempo, los detectives (los sistemas de seguridad) intentaron atrapar a estos criminales buscando carteles de "Se Busca" específicos y preescritos. Revisaban si un criminal tenía una cara específica (un hash) o si llevaba un sombrero específico (una dirección IP). Pero los criminales modernos son astutos; cambian sus caras y sus sombreros constantemente, por lo que los viejos carteles ya no funcionan.

Este artículo sugiere una nueva forma de atraparlos: en lugar de mirar una instantánea aislada, necesitamos observar toda la historia de lo que hacen.

El Libro de Pistas: Sysmon

Los investigadores utilizaron un cuaderno especial llamado Sysmon. Piensa en Sysmon como un guardia de seguridad hiperobservador que anota todo lo que sucede en la ciudad de la computadora. Registra cuándo se inicia un programa, cuándo se crea un archivo, cuándo se establece una conexión a internet e incluso cuando alguien intenta cambiar sigilosamente la marca de tiempo de un archivo (como un ladrón que borra sus huellas dactilares de una puerta).

¿El problema? El guardia anota demasiado. Es como tener un diario con 427,774 entradas, pero la mayoría son solo ruido. Para darle sentido, los investigadores tuvieron que limpiar el diario y agrupar las entradas en historias significativas.

Las Dos Formas de Agrupar las Pistas

Los investigadores probaron dos formas diferentes de unir estas entradas dispersas de un diario para formar una historia coherente, con el fin de ver cuál ayudaba a identificar el "movimiento" del criminal (llamado una técnica MITRE ATT&CK).

1. El Método del "Árbol Genealógico" (Correlación basada en GUID)
Imagina que cada programa que se ejecuta en la computadora recibe una tarjeta de identidad permanente e inalterable llamada GUID. Incluso si el programa se cierra y uno nuevo comienza con el mismo nombre, recibe una nueva tarjeta de identidad. La tarjeta de identidad antigua permanece con el "árbol genealógico" de su programa.

  • Cómo funciona: Los investigadores vincularon todas las pistas que pertenecían a la misma tarjeta de identidad. Si un programa padre (como explorer.exe) iniciaba un programa hijo, y ese programa hijo abría un archivo y luego hacía una llamada telefónica, el sistema los vinculaba a todos porque compartían el mismo ID de familia.
  • El Resultado: Este método fue como tener un árbol genealógico completo de las acciones del criminal. Mostró exactamente quién hizo qué y en qué orden, preservando las relaciones entre los eventos.

2. El Método de la "Marca de Tiempo" (Correlación basada en el Tiempo)
Este método ignoraba los árboles genealógicos y simplemente miraba el reloj.

  • Cómo funciona: Los investigadores dijeron: "Si dos cosas sucedieron dentro de un segundo la una de la otra, deben estar relacionadas". Agruparon los eventos que ocurrieron cerca en el tiempo.
  • El Resultado: Esto fue como mirar a una multitud de personas y asumir que cualquiera que esté parado junto a otro es parte de un equipo. Aunque a veces es cierto, se perdía la conexión más profunda. Dos eventos no relacionados podrían ocurrir al mismo tiempo por coincidencia, o la acción de un criminal podría extenderse durante varios segundos, rompiendo la regla del "un segundo".

El Veredicto: Los Árboles Genealógicos Ganan

El artículo realizó un experimento masivo, simulando ataques cibernéticos en un laboratorio controlado utilizando una herramienta llamada Atomic Red Team. Alimentaron estas "historias" en diferentes tipos de detectives (modelos de aprendizaje automático) para ver quién podía adivinar mejor la técnica del criminal.

El Gran Hallazgo:
El método del "Árbol Genealógico" (basado en GUID) superó consistentemente al método de la "Marca de Tiempo" (basado en el Tiempo) en todos los ámbitos.

  • El mejor detective fue una IA superinteligente llamada SecureBERT (un modelo de lenguaje especializado para la ciberseguridad).
  • Cuando SecureBERT leía las historias del "Árbol Genealógico", lograba una precisión de 0.586 (lo que significa que acertaba la respuesta aproximadamente el 58.6% de las veces).
  • Cuando leía las historias de la "Marca de Tiempo", su precisión caía a 0.504.

El artículo argumenta explícicamente en contra de la idea de que agrupar eventos por tiempo sea suficiente. Sugiere que, sin el árbol genealógico (el linaje del proceso), se pierde el contexto crucial de cómo una acción llevó a la otra. El artículo también encontró que para los modelos de IA más avanzados (los Transformers), intentar "arreglar" los datos creando ejemplos falsos adicionales (una técnica llamada SMOTE) en realidad empeoraba las cosas o no ayudaba. La mejor estrategia era dejar que la IA aprendiera de las historias reales y sin alteraciones del "Árbol Genealógico".

El "Quién" y el "Qué"

Los investigadores probaron muchas técnicas criminales diferentes (como "T1059: Command and Scripting Interpreter" o "T1218: System Binary Proxy Execution").

  • Las Victorias Fáciles: Algunas técnicas eran súper fáciles de detectar. Por ejemplo, T1588 (Obtain Capabilities) fue identificada con una puntuación perfecta de 1.00 (precisión del 100%). Es como un criminal que lleva un letrero de neón que dice "Soy un criminal".
  • Los Casos Difíciles: Algunas técnicas eran casi imposibles de distinguir. T1553 (Subvert Trust Controls) obtuvo una puntuación de 0.00, lo que significa que la IA no pudo encontrar ni una sola instancia correcta. El artículo señala que muchas técnicas, especialmente las que involucran la "Evasión de Defensa" (ocultarse), se ven tan similares en los registros que incluso la mejor IA se confunde. Es como intentar distinguir entre dos gemelos que usan máscaras idénticas.

La Conclusión Final

Este artículo no pretende haber resuelto el cibercrimen para siempre. Es un estudio de simulación, no un reporte de una zona de guerra real. Sin embargo, sugiere fuertemente que si quieres entender qué está haciendo un hacker, no debes limitarte a mirar una lista de eventos que ocurrieron cerca en el tiempo. Necesitas reconstruir el linaje del proceso —el árbol genealógico del software.

Al usar el método basado en GUID para vincular los eventos y alimentar a un modelo SecureBERT sin intentar equilibrar artificialmente los datos, obtienes la imagen más clara del ataque. Es un recordatorio de que en el mundo digital, el contexto es el rey, y saber quién está relacionado con quién importa más que simplemente saber cuándo aparecieron.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →