← Últimos artículos
💻 computer science

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

El artículo presenta IOCRegex-gen, un sistema automatizado basado en modelos de lenguaje grande que transforma indicadores de compromiso de informes de inteligencia de amenazas en expresiones regulares mediante mecanismos de agrupación y validación iterativa, logrando una alta precisión y bajo índice de falsos positivos para optimizar las operaciones de los centros de seguridad.

Autores originales: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

Publicado 2026-04-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que el ciberespacio es una ciudad gigante y llena de ruido, donde los ladrones (los hackers) dejan pistas por todas partes. Los expertos en seguridad (los analistas del SOC) son como detectives que deben encontrar esas pistas para atrapar a los criminales antes de que hagan daño.

Aquí te explico de qué trata este paper usando una analogía sencilla: La diferencia entre una "foto borrosa" y un "detector de metales".

1. El Problema: La "Lista de Deseos" vs. La Realidad

Imagina que un detective lee un informe de inteligencia y descubre que el ladrón usó una llave específica para abrir una puerta. El informe dice: "El ladrón usó la llave 'Llave-Maestra-2024' en la casa del Sr. Pérez".

  • La forma manual (como se hacía antes): El detective toma esa frase y tiene que escribir a mano una regla para un robot de seguridad que diga: "Si ves 'Llave-Maestra-2024' en la casa del Sr. Pérez, ¡ALERTA!".
  • El problema: Los hackers son listos. Si el detective pone la regla exacta, el ladrón cambia la llave a "Llave-Maestra-2025" o la usa en la casa del Sr. García. ¡El robot no detecta nada! Además, hay miles de informes cada día. Hacer esto a mano es lento, aburrido y propenso a errores.

Antes, las Inteligencias Artificiales (LLMs) podían leer el informe y decirte: "Oye, la llave es 'Llave-Maestra-2024'". Pero se quedaban ahí. No podían crear la regla para el robot. El detective aún tenía que hacer el trabajo sucio de convertir esa palabra en una regla flexible.

2. La Solución: "IOCRegex-gen" (El Traductor Automágico)

Los autores de este paper crearon un sistema llamado IOCRegex-gen. Piensa en él como un traductor mágico y un arquitecto en uno.

Su trabajo no es solo leer el informe y sacar la palabra clave. Su trabajo es crear el "Detector de Metales" perfecto automáticamente.

¿Cómo lo hace? Con dos trucos geniales:

Truco A: El "Mapa de la Ciudad" (Identificación de Grupos)

Imagina que la pista del ladrón es una dirección: C:\Usuarios\Publico\ArchivoMalicioso.exe.

  • Lo que cambia: El nombre del archivo (ArchivoMalicioso.exe) puede cambiar cada vez que el ladrón ataca.
  • Lo que no cambia: La estructura de la ciudad (C:\Usuarios\Publico\) siempre es la misma en Windows.

El sistema tiene un mapa mental (una base de datos de conocimiento) que sabe qué partes de una dirección son "fijas" (como las calles principales) y cuáles son "variables" (como los números de casa).

  • Sin el sistema: El robot buscaría exactamente ArchivoMalicioso.exe.
  • Con el sistema: El robot entiende: "Busca cualquier cosa que esté en la carpeta 'Publico', sin importar cómo se llame el archivo". Esto se llama Grupo de Captura. El sistema decide automáticamente qué partes son fijas y cuáles son variables.

Truco B: El "Entrenador Estricto" (Validación Iterativa)

A veces, la Inteligencia Artificial se pone creativa y crea reglas demasiado vagas. Por ejemplo, podría decir: "Busca cualquier archivo que termine en .exe".

  • El problema: ¡Eso detecta a todos los programas legítimos de la ciudad! Es como poner un detector de metales que suena si alguien lleva un tenedor. Es demasiado general (falsos positivos).

El sistema tiene un entrenador que revisa la regla creada por la IA:

  1. Prueba: ¿Funciona con la pista original?
  2. Prueba de estrés: ¿Funciona con 10 pistas aleatorias? Si la regla detecta demasiadas cosas (como el tenedor), el entrenador le dice: "¡Eh, eso es demasiado amplio! Refínalo".
  3. Repetición: La IA vuelve a intentar hasta que la regla es perfecta: ni muy estricta (que pierda al ladrón) ni muy vaga (que moleste a los ciudadanos).

3. Los Resultados: ¡Funciona de verdad!

Los autores probaron su sistema con más de 3,000 informes reales de ciberataques y lo compararon con datos reales de ejercicios de seguridad (como los de MITRE ATT&CK).

  • Precisión: El sistema encontró el 99.1% de las pistas reales.
  • Errores: Solo se equivocó el 0.8% de las veces (detectando cosas que no eran peligrosas).
  • Comparación: Si le hubieran pedido a una IA normal que hiciera esto sin ayuda, habría fallado mucho más. El sistema de los autores es un 30% mejor.

En Resumen

Este paper presenta un sistema que automatiza la parte más difícil y aburrida de la ciberseguridad: convertir las pistas de los hackers en reglas de búsqueda inteligentes.

En lugar de que un detective humano pase horas escribiendo reglas a mano, el sistema lee el informe, entiende el contexto de la ciudad (Windows), decide qué partes son fijas y cuáles cambian, y crea una regla de búsqueda perfecta que puede usarse inmediatamente para proteger a miles de computadoras.

Es como pasar de tener un detective que dibuja a mano un mapa del tesoro, a tener un GPS automático que te lleva directamente al tesoro, sin importar cómo cambie el terreno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →