Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations
Este artículo presenta AuditBench, un conjunto de datos de referencia integral que abarca más de 50 escenarios de seguridad en sistemas Linux y Windows, para evaluar y analizar el rendimiento, los perfiles de error y las capacidades explicativas de cinco modelos de lenguaje de gran tamaño (LLM) de vanguardia a través de cuatro tareas críticas de respuesta a incidentes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres el jefe de seguridad de una ciudad gigante y bulliciosa. Cada día, miles de cámaras y sensores (llamados registros de auditoría o audit logs) registran cada paso, cada apertura de puerta y cada arranque de motor. La mayor parte del tiempo, la gente solo va al trabajo o a comprar comida (actividad benigna). Pero, a veces, un ladrón se cuela, fuerza una cerradura o roba una caja fuerte (un ataque).
El problema es que la ciudad genera tantos datos que los guardias de seguridad humanos no pueden vigilarlo todo. Se ven abrumados por las falsas alarmas y pierden de vista crímenes reales entre tanto ruido.
Aquí entran los Modelos de Lenguaje de Gran Tamaño (LLM). Piensa en ellos como aprendices de detective súper inteligentes e incansables que pueden leer millones de páginas de registros en segundos. Pero antes de contratarlos, necesitamos saber: ¿Son realmente buenos resolviendo crímenes, o simplemente entran en pánico y acusan a personas inocentes?
Este artículo presenta AuditBench, un "examen final" diseñado específicamente para poner a prueba la capacidad de estos detectives de IA para investigar registros de seguridad.
El Examen: AuditBench
Los investigadores construyeron una batería de pruebas con 51 escenarios diferentes.
- El "Aula" (Datos de Laboratorio): Crearon 25 escenarios ficticios en computadoras virtuales, simulando desde un hacker robando archivos hasta un usuario normal instalando un software.
- El "Mundo Real" (Datos OpTC): Tomaron 26 escenarios complejos de un conjunto de datos masivo del mundo real (DARPA OpTC) que ya contaba con una "verdad fundamental" (ground truth) conocida (la clave de respuestas).
El examen tenía cuatro tareas principales, como la lista de verificación de un detective:
- El Triaje (Clasificación): "¿Es esta alerta un crimen real o una falsa alarma?"
- El Escondite (Persistencia): "¿El criminal instaló una puerta trasera secreta para quedarse en el sistema para siempre?"
- La Ruta de Escape (Movimiento Lateral): "¿Saltó el criminal de una computadora a otra para propagar la infección?"
- El Atraco (Exfiltración de Datos): "¿Robó el criminal archivos sensibles y los envió fuera?"
Los Resultados: Lo que la IA Acertó (y lo que Erró)
Los investigadores probaron cinco de los mejores modelos de IA (incluyendo gigantes como GPT-5 y Gemini 2.5 Pro) contra este examen. Esto es lo que encontraron, traducido a términos cotidianos:
1. El Problema del "Detective Paranoico"
La mayoría de los detectives de IA eran excesivamente suspicaces. Eran como un guardia de seguridad que ve a una persona con una bolsa e inmediatamente asume que es una bomba.
- El Resultado: Las IA fueron excelentes detectando el "Atraco" (robo de datos), pero terribles para ignorar a las personas inocentes. Señalaron una enorme cantidad de actividad normal como "ataques", creando una inundación de falsas alarmas.
2. Más Grande no Siempre es Mejor
Uno podría pensar que los modelos de IA más grandes y costosos serían los mejores detectives. Sorprendentemente, eso no siempre fue cierto.
- El Resultado: A veces, los modelos más pequeños y económicos funcionaban igual de bien, o incluso mejor, que los masivos. Resulta que, para este trabajo específico, no siempre necesitas una supercomputadora; un modelo compacto y listo puede hacer el trabajo.
3. El Lenguaje de los Registros Importa
Los investigadores alimentaron a la IA de dos maneras:
- Registros Brutos (Raw Logs): La transcripción desordenada y sin editar de todo lo que sucedió (como una grabación de audio cruda de una habitación caótica).
- Representación de Aristas (Edge Representation): Una versión depurada y resumida que resalta las conexiones entre eventos (como la pizarra de un detective con hilos conectando a los sospechosos).
- El Resultado: Para algunos modelos, la versión "depurada" los hizo mucho más inteligentes y rápidos. Para otros, los datos brutos estaban bien. Depende del "estilo de aprendizaje" del modelo.
4. El "Prompt" es el Manual de Instrucciones
La forma en que le haces una pregunta a la IA cambia la respuesta. Los investigadores probaron dos formas distintas de escribir las instrucciones (prompts).
- El Resultado: Un prompt que hacía a un detective de IA brillante podía hacer que otro fuera torpe. No existe un "manual de instrucciones único" que sirva para todos. Tienes que ajustar las instrucciones para el modelo de IA específico que estés usando.
5. El "Razonamiento" de la IA Solía Ser Bueno
Cuando la IA sí detectaba correctamente un ataque real, su explicación era usualmente excelente. Podía señalar el archivo o comando exacto que probaba el crimen.
- La Trampa: Cuando se equivocaba (las falsas alarmas), su razonamiento solía basarse en nombres extraños o en un alto volumen.
- Ejemplo: Si un archivo se llamaba
delete_logs.bat, la IA asumía que era un criminal tratando de ocultar evidencia, aunque fuera solo un script normal de limpieza del sistema. - Ejemplo: Si un programa se ejecutó 1,000 veces en un segundo, la IA pensaba: "¡Eso es sospechoso!", aunque fuera solo una actualización de software normal.
- Ejemplo: Si un archivo se llamaba
La Gran Conclusión
Este artículo no dice "la IA puede reemplazar a los equipos de seguridad todavía". En cambio, dice: "Aquí hay una regla para medir qué tan buena es la IA en este trabajo, y aquí están las trampas que se deben evitar".
- Para los Equipos de Seguridad: No compren solo la IA más cara. Prueben modelos más pequeños. Tengan cuidado con la tendencia "paranoica" que crea falsas alarmas.
- Para los Desarrolladores de IA: No asuman que los modelos más grandes son siempre mejores. Es posible que necesiten cambiar la forma en que les suministran los datos (la representación de "Aristas") o ajustar sus instrucciones (prompts) para obtener los mejores resultados.
- Para Todos: La IA es una herramienta poderosa, pero necesita a un humano que verifique su trabajo, especialmente cuando se vuelve demasiado suspicaz con las personas inocentes.
Los investigadores están liberando todos sus datos, código y preguntas de examen al público para que otros puedan seguir probando y mejorando a estos detectives digitales.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.