Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports
Este artículo establece una nueva línea base empírica para la clasificación multi-etiqueta de ATT&CK en informes complejos de inteligencia de amenazas cibernéticas no estructurados mediante la introducción de un conjunto de datos anotado por humanos de 2.076 oraciones y la evaluación de siete modelos de lenguaje de gran tamaño (LLM) de código abierto, los cuales alcanzaron colectivamente una baja puntuación F1 promediada por micro de 0,22, lo que indica que los modelos actuales siguen siendo insuficientes para un despliegue de grado de producción a pesar de la correlación positiva entre el tamaño de los parámetros y el rendimiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un guardia de seguridad intentando leer un diario de mil páginas, desordenado, escrito por un criminal caótico. Este diario (llamado un Informe CTI) no solo dice "Robé el coche". Dice: "Forcé la cerradura, puenteé el motor, conduje hasta el banco y luego borré las cámaras de seguridad".
Tu trabajo es leer cada frase y etiquetarla con el "código de crimen" correcto de un libro de reglas masivo llamado MITRE ATT&CK. Este libro de reglas tiene 211 códigos diferentes para cada posible forma en que un criminal puede atacar. El problema es que una sola frase a menudo contiene múltiples crímenes a la vez, y el lenguaje es truculento.
Durante mucho tiempo, las computadoras fueron terribles en esto. Eran como un robot que solo podía leer notas simples de una sola oración. Si la nota era compleja, el robot se confundía.
Entonces llegaron los Modelos de Lenguaje Extensos (LLM). Piensa en ellos como pasantes súper inteligentes y muy cultos que pueden entender el contexto y los matices. La gente esperaba que estos pasantes de IA pudieran finalmente leer los diarios desordenados y etiquetar los crímenes perfectamente.
Este documento es la boleta de calificaciones de siete de estos pasantes de código abierto. Los investigadores querían ver si estos pasantes de IA están realmente listos para hacer el trabajo, o si todavía son demasiado inexpertos.
Esto es lo que hicieron y lo que encontraron, explicado de forma sencilla:
1. La Prueba: Un examen del "Mundo Real"
Las pruebas anteriores para estos pasantes de IA eran como darles un cuestionario con preguntas fáciles de una sola respuesta (por ejemplo, "El criminal usó una llave" -> Etiqueta: Forzar cerraduras).
Los investigadores de este documento dijeron: "Así no es como funciona la vida real". Crearon un examen más difícil y realista:
- Tomaron 83 informes de seguridad reales y desordenados escritos por expertos humanos.
- Los desglosaron en 2,076 oraciones individuales.
- Hicieron que expertos humanos etiquetaran manualmente cada oración con los códigos de crimen correctos. Algunas oraciones no tenían códigos; algunas tenían uno; ¡algunas tenían hasta nueve códigos a la vez!
- Esto se convirtió en la "Clave de Respuestas" (Verdad de Terreno) para calificar a la IA.
2. Los Concursantes
Eligieron 7 modelos de IA de código abierto diferentes.
- Piensa en estos modelos como estudiantes de diferentes tamaños. Algunos son pequeños (8 mil millones de "células cerebrales" o parámetros), y otros son gigantes (236 mil millones).
- Los probaron en diferentes "modos":
- Zero-Shot (Cero disparos): Solo dar las instrucciones.
- Few-Shot (Pocos disparos): Darle a la IA algunos ejemplos para que estudie primero.
- Chain-of-Thought (Cadena de pensamiento): Pedirle a la IA que "piense en voz alta" paso a paso antes de responder.
- Temperature (Temperatura): Girar la perilla de "creatividad" de la IA hacia arriba o hacia abajo (0 = robot estricto, 0.5 = ligeramente más creativo).
3. Los Resultados: Los Pasantes aún están Aprendiendo
Los resultados fueron un golpe de realidad.
- La Puntuación: Incluso el mejor modelo de IA solo obtuvo una puntuación del 22% (en una escala donde el 100% es perfecto).
- Analogía: Imagina a un estudiante tomando un examen final difícil y obteniendo una D-. Está aprobando, pero le faltan la mayoría de las respuestas.
- El Tamaño Importa (Mayormente): Los modelos más grandes y complejos (los "Gigantes") generalmente lo hicieron mejor que los pequeños. Hubo un vínculo claro: cerebro más grande = puntuación ligeramente mejor.
- Las Configuraciones "Mágicas" No Funcionaron:
- Darle ejemplos a la IA (Few-Shot) no ayudó mucho.
- Pedirle a la IA que "piense paso a paso" (Chain-of-Thought) no ayudó mucho.
- Girar la perilla de "creatividad" (Temperature) casi no hizo diferencia.
- Analogía: Es como darle a un estudiante un lápiz de diferente color o decirle que "se esfuerce más", pero si no conoce el material, la puntuación no cambia.
4. La Única Cosa que Ayudó: La "Hoja de Trucos"
Los investigadores intentaron una cosa más. Les dieron una configuración de Generación Aumentada por Recuperación (RAG).
- Analogía: En lugar de que la IA solo dependiera de lo que memorizó, le dieron un libro abierto (el libro de reglas oficial) para consultar mientras hacía el examen.
- El Resultado: La puntuación saltó del 22% al 32%.
- Esta fue la mayor mejora de todas. Demostró que la IA no está fallando porque sea "tonta"; está fallando porque no tiene las reglas actuales frente a ella.
5. ¿Qué salió mal?
Los investigadores analizaron los errores que cometió la IA:
- Falsos Positivos: La IA vio una palabra como "evadir" y supuso "Secuestro", aunque la oración trataba sobre otra cosa. Estaba adivinando basándose en palabras clave en lugar de entender la historia.
- Falsos Negativos: La IA omitió un crimen porque no entendió que "preparar un binario de ransomware" era en realidad un tipo específico de transferencia. Le faltaba el contexto profundo.
La Conclusión
El documento concluye que los modelos de IA de código abierto actuales aún no están listos para ser los únicos guardias de seguridad para clasificar amenazas cibernéticas complejas. Son demasiado inexactos (obteniendo solo un 22-32%) para ser confiables en un centro de seguridad del mundo real sin ayuda humana.
Lo único que mejoró significamente su rendimiento fue darle acceso al libro de reglas oficial (RAG) durante la prueba. Simplemente cambiar cómo haces las preguntas (prompts) o hacer el modelo más grande no resolvió el problema central.
En resumen: Los pasantes de IA son inteligentes, pero actualmente son demasiado propensos a cometer errores para trabajar solos. Necesitan un supervisor humano y un manual de referencia para hacer el trabajo correctamente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.