← Últimos artículos
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

Este artículo propone una metodología novedosa que combina Modelos de Lenguaje Grandes con ontologías de dominio y restricciones SHACL para crear un agente de IA que mejora significativamente la precisión y la explicabilidad de la extracción de información estructurada y semánticamente válida de registros de ciberseguridad, particularmente para datos de honeypot.

Autores originales: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Publicado 2026-04-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un crimen, pero en lugar de informes policiales claros, te entregan miles de páginas de notas desordenadas escritas a mano, garabatos y frases a medio terminar. Esto es lo que enfrentan los expertos en ciberseguridad cuando intentan leer registros del sistema. Estos registros son los "diarios" de las computadoras, que registran cada acción realizada, pero a menudo son desestructurados, confusos y llenos de jerga.

Este artículo presenta una nueva herramienta llamada OntoLogX para ayudar a los detectives (analistas de ciberseguridad) a dar sentido a este caos. Así es como funciona, desglosado en conceptos simples:

1. El Problema: La "Habitación Desordenada"

Los métodos tradicionales para leer estos registros son como intentar encontrar un juguete específico en una habitación desordenada usando solo una linterna y una lista fija de reglas. Si el juguete está oculto bajo una pila de ropa o etiquetado con un nombre extraño, la linterna no lo encuentra.

  • El Problema: Las computadoras generan registros que son desestructurados y ambiguos. Los métodos antiguos luchan por encontrar a los "malos" (eventos maliciosos) de manera confiable.
  • La Nueva Herramienta: Los autores utilizan Modelos de Lenguaje Grande (LLM). Piensa en un LLM como un becario superinteligente que ha leído casi todo en internet y puede entender el lenguaje natural. Sin embargo, este becario puede ser un poco "soñador": a veces inventa cosas o se equivoca ligeramente con los hechos porque no está estrictamente atado a reglas.

2. La Solución: El "Arquitecto" y el "Inspector"

Para corregir la tendencia del becario a soñar, los autores construyeron un sistema llamado OntoLogX que añade dos capas cruciales de control:

  • El Arquitecto (La Ontología): Antes de que el becario empiece a escribir, el sistema le entrega un plano estricto llamado Ontología. Esto es como un conjunto específico de bloques de construcción y un reglamento. Dice: "Solo puedes construir una casa usando estos ladrillos específicos (clases) y debes conectarlos de esta manera específica (relaciones)". Obliga a la IA a organizar los datos desordenados del registro en un formato ordenado y estructurado llamado Grafo de Conocimiento.
  • El Inspector (Validación SHACL): Una vez que el becario construye la estructura, un inspector estricto (usando una herramienta llamada SHACL) revisa el trabajo. El inspector pregunta: "¿Usaste los ladrillos correctos? ¿Conectaste el techo a las paredes correctamente? ¿Falta alguna puerta?".
    • Si el edificio está mal, el inspector lo devuelve al becario con una nota: "Arregla esto".
    • El becario lo intenta de nuevo. Este bucle continúa hasta que el edificio es perfecto.

3. El Proceso: Aprendiendo de Ejemplos

El sistema no solo pide al becario que adivine. Utiliza un truco inteligente llamado Generación Aumentada por Recuperación.

  • Imagina que el becario tiene una biblioteca de casos exitosos pasados. Cuando llega un nuevo registro desordenado, el sistema encuentra los casos pasados más similares (ejemplos) y se los muestra al becario.
  • Dice: "Mira cómo resolvimos este rompecabezas similar antes. Usa ese mismo estilo para resolver este nuevo".
  • Esto ayuda al becario a entender exactamente lo que el "Arquitecto" (la Ontología) quiere, lo que lleva a resultados mucho mejores.

4. Los Resultados: Mejor Precisión, No Velocidad

Los autores probaron este sistema contra la "vieja forma" (solo pedirle al becario que escriba sin el Arquitecto ni el Inspector).

  • El Resultado: El nuevo método fue significativamente más preciso. Encontró más "malos" (mayor Recall) y cometió menos errores (mayor Precisión).
  • La Compensación: El artículo afirma explícitamente que priorizaron la calidad sobre la velocidad. El nuevo método toma un poco más de tiempo porque tiene que revisar el trabajo, obtener retroalimentación y volver a intentarlo. Pero el resultado final es un mapa mucho más confiable y digno de confianza de las amenazas cibernéticas.
  • El Ganador: Entre los diferentes modelos de IA probados, Claude 3.5 Sonnet tuvo el mejor desempeño, aunque los modelos de código abierto como Llama 3.3 también lo hicieron muy bien.

Analogía de Resumen

Si leer registros de ciberseguridad es como intentar traducir un diario manuscrito caótico a un documento legal formal:

  • Método Antiguo: Le pides a un traductor inteligente que simplemente "haga su mejor esfuerzo". Podría captar el significado, pero el formato será desordenado e inconsistente.
  • OntoLogX: Le das al traductor una plantilla legal estricta (Ontología), le muestras ejemplos de documentos legales perfectos (ejemplos de pocos disparos) y haces que un abogado estricto (SHACL) revise cada borrador. Si el borrador no es perfecto, el abogado lo devuelve para correcciones. El resultado es un documento legal impecable cada vez, incluso si toma un poco más de tiempo producirlo.

Conclusión Clave: Este artículo demuestra que combinar una "IA inteligente" con "reglas estrictas" y "verificaciones de calidad" crea un sistema mucho más confiable para transformar registros de computadoras desordenados en inteligencia clara y accionable sobre amenazas cibernéticas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →