← Últimos artigos
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

Este artigo propõe uma metodologia inovadora que combina Modelos de Linguagem de Grande Escala com ontologias de domínio e restrições SHACL para criar um agente de IA que melhora significativamente a precisão e a explicabilidade da extração de informações estruturadas e semanticamente válidas de registros de cibersegurança, particularmente para dados de honeypot.

Autores originais: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Publicado 2026-04-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um crime, mas, em vez de relatórios policiais claros, você recebe milhares de páginas de anotações manuscritas bagunçadas, rabiscos e frases incompletas. É isso que especialistas em cibersegurança enfrentam ao tentar ler logs de sistema. Esses logs são os "diários" dos computadores, registrando cada ação realizada, mas frequentemente são desestruturados, confusos e cheios de jargão.

Este artigo apresenta uma nova ferramenta chamada OntoLogX para ajudar detetives (analistas de cibersegurança) a dar sentido a esse caos. Veja como funciona, dividido em conceitos simples:

1. O Problema: A "Sala Bagunçada"

Os métodos tradicionais para ler esses logs são como tentar encontrar um brinquedo específico em uma sala bagunçada usando apenas uma lanterna e uma lista fixa de regras. Se o brinquedo estiver escondido sob uma pilha de roupas ou rotulado com um nome estranho, a lanterna não o encontra.

  • O Problema: Computadores geram logs que são desestruturados e ambíguos. Métodos antigos têm dificuldade em encontrar os "vilões" (eventos maliciosos) de forma confiável.
  • A Nova Ferramenta: Os autores utilizam Modelos de Linguagem de Grande Escala (LLMs). Pense em um LLM como um estagiário superinteligente que leu quase tudo na internet e consegue entender a linguagem natural. No entanto, esse estagiário pode ser um pouco "sonhador" — às vezes, ele inventa coisas ou erra ligeiramente os fatos porque não está estritamente limitado por regras.

2. A Solução: O "Arquiteto" e o "Inspetor"

Para corrigir a tendência do estagiário de sonhar, os autores criaram um sistema chamado OntoLogX que adiciona duas camadas cruciais de controle:

  • O Arquiteto (A Ontologia): Antes do estagiário começar a escrever, o sistema fornece a ele um projeto rigoroso chamado Ontologia. Isso é como um conjunto específico de blocos de construção e um manual de regras. Diz: "Você só pode construir uma casa usando estes tijolos específicos (classes) e deve conectá-los desta maneira específica (relações)". Isso força a IA a organizar os dados desordenados do log em um formato estruturado e organizado chamado Grafo de Conhecimento.
  • O Inspetor (Validação SHACL): Uma vez que o estagiário constrói a estrutura, um inspetor rigoroso (usando uma ferramenta chamada SHACL) verifica o trabalho. O inspetor pergunta: "Você usou os tijolos certos? Conectou o telhado às paredes corretamente? Há uma porta faltando?"
    • Se a construção estiver errada, o inspetor a devolve ao estagiário com uma nota: "Corrija isso".
    • O estagiário tenta novamente. Esse ciclo continua até que a construção esteja perfeita.

3. O Processo: Aprendendo com Exemplos

O sistema não pede apenas ao estagiário para adivinhar. Ele usa um truque inteligente chamado Geração Aumentada por Recuperação.

  • Imagine que o estagiário tenha uma biblioteca de casos anteriores bem-sucedidos. Quando um novo log bagunçado chega, o sistema encontra os casos passados mais semelhantes (exemplos) e os mostra ao estagiário.
  • Diz: "Veja como resolvemos este quebra-cabeça semelhante antes. Use o mesmo estilo para resolver este novo."
  • Isso ajuda o estagiário a entender exatamente o que o "Arquiteto" (a Ontologia) deseja, levando a resultados muito melhores.

4. Os Resultados: Melhor Precisão, Não Velocidade

Os autores testaram esse sistema contra o "velho jeito" (apenas pedir ao estagiário para escrever sem o Arquiteto ou o Inspetor).

  • O Resultado: O novo método foi significativamente mais preciso. Encontrou mais "vilões" (Recall mais alto) e cometeu menos erros (Precisão mais alta).
  • A Troca: O artigo afirma explicitamente que priorizaram qualidade em vez de velocidade. O novo método leva um pouco mais de tempo porque precisa verificar o trabalho, receber feedback e tentar novamente. Mas o resultado final é um mapa muito mais confiável e digno de confiança das ameaças cibernéticas.
  • O Vencedor: Entre os diferentes modelos de IA testados, o Claude 3.5 Sonnet teve o melhor desempenho, embora modelos de código aberto como o Llama 3.3 também tenham se saído muito bem.

Analogia de Resumo

Se ler logs de cibersegurança é como tentar traduzir um diário manuscrito caótico em um documento legal formal:

  • Método Antigo: Você pede a um tradutor inteligente apenas para "fazer o seu melhor". Eles podem captar o significado, mas o formato será bagunçado e inconsistente.
  • OntoLogX: Você dá ao tradutor um modelo legal rigoroso (Ontologia), mostra exemplos de documentos legais perfeitos (exemplos de poucos disparos) e faz com que um advogado rigoroso (SHACL) revise cada rascunho. Se o rascunho não estiver perfeito, o advogado o devolve para correções. O resultado é um documento legal impecável a cada vez, mesmo que leve um pouco mais de tempo para produzir.

Conclusão Chave: Este artigo prova que combinar uma "IA inteligente" com "regras rigorosas" e "verificações de qualidade" cria um sistema muito mais confiável para transformar logs de computador desordenados em inteligência clara e acionável sobre ameaças cibernéticas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →