← Últimos artigos
🤖 machine learning

Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs

Este artigo apresenta o framework Context-aware Threat Intelligence Knowledge Graph (CTiKG), que aproveita modelos híbridos de PLN combinando embeddings SecureBERT+ e ontologia de domínio para superar as limitações das abordagens de pipeline existentes na extração de triplas precisas de entidade-relação a partir de relatórios de cibersegurança não estruturados, alcançando ganhos significativos de desempenho em benchmarks alinhados ao STIX 2.1.

Autores originais: Inoussa Mouiche, sherif Saad

Publicado 2026-05-18
📖 4 min de leitura☕ Leitura rápida

Autores originais: Inoussa Mouiche, sherif Saad

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive de cibersegurança tentando resolver um mistério massivo. Você tem milhares de relatórios manuscritos e bagunçados (texto não estruturado) descrevendo hackers, suas ferramentas e seus ataques. Seu objetivo é transformar essas anotações confusas em um painel limpo e organizado de "Cartazes de Procurados" (um Grafo de Conhecimento), onde você possa ver instantaneamente quem está conectado a quem, quais ferramentas eles usam e onde eles atacam.

Este artigo apresenta uma nova e mais inteligente maneira de construir esse painel, chamada CTiKG. Eis como funciona, decomposto em conceitos simples:

O Problema: A "Linha de Montagem Quebrada"

Anteriormente, tentar construir esses painéis era como operar uma linha de montagem defeituosa.

  1. Etapa 1: Um robô tentava encontrar os nomes de pessoas e lugares (Entidades).
  2. Etapa 2: Um segundo robô tentava descobrir como eles estavam conectados (Relações).

O problema era que, se o primeiro robô cometesse um erro (como identificar erroneamente o nome de um hacker), o segundo robô ficaria confuso e também cometeria um erro. Isso é chamado de "propagação de erro". Além disso, os robôs eram treinados em inglês geral (como ler a Wikipédia), então não entendiam gírias ou jargões específicos de hackers. Eles leriam "Mimikatz" e pensariam que era apenas uma palavra aleatória, não uma ferramenta de hacking específica.

A Solução: O "Detetive Consciente do Contexto" (CTiKG)

Os autores construíram um novo sistema que atua como uma equipe de detetives especializada que fala fluentemente a linguagem das ameaças cibernéticas. Eles melhoraram o processo de três maneiras principais:

1. O "Super-Leitor" (Melhor Reconhecimento de Entidades)

Em vez de um robô básico, eles usaram um cérebro especializado chamado SecureBERT+. Pense nisso como um detetive que leu todos os relatórios de crimes cibernéticos já escritos.

  • A Atualização: Eles adicionaram uma "rede de segurança" (uma camada CRF) a esse cérebro. No sistema antigo, o robô poderia rotular uma palavra como "Início de um Nome" mas esquecer de rotular o "Fim de um Nome", criando uma frase quebrada. A rede de segurança garante que os rótulos sempre façam sentido juntos, como uma peça de quebra-cabeça que só se encaixa se as peças ao redor estiverem corretas.
  • O Resultado: Este sistema é muito melhor em identificar os 21 tipos diferentes de "suspeitos" (como hackers, malware ou endereços IP) no texto, reduzindo erros em cerca de 3–4%.

2. O "Livro de Regras" (Melhor Extração de Relações)

Uma vez que os suspeitos são encontrados, o sistema precisa conectar os pontos.

  • A Atualização: Eles criaram uma Ontologia de Domínio específica. Imagine isso como um livro de regras estrito ou um fluxograma que diz: "Um hacker usa uma ferramenta", ou "Uma ferramenta alvo um computador".
  • Como ajuda: Mesmo que a IA fique um pouco confusa, o livro de regras atua como um árbitro. Se a IA tentar dizer que um "Computador" está "associado a" uma "Data" de uma maneira que não faz sentido, o livro de regras corrige isso. Isso garante que as conexões (relacionamentos) sejam lógicas e precisas.
  • O Resultado: Isso melhorou a precisão na conexão dos pontos em até 8%.

3. O "Campo de Treinamento" (Novos Dados)

Para ensinar seus novos detetives, os autores não usaram apenas dados antigos e bagunçados. Eles criaram um novo conjunto de treinamento superlimpo chamado DNRTI-AUG-STIX2.

  • Eles pegaram relatórios existentes e adicionaram mais exemplos de tipos raros de hackers e ferramentas (Aumento de Dados) para que a IA não ficasse confusa com coisas que nunca tinha visto antes.
  • Eles também fundiram categorias semelhantes (como diferentes tipos de códigos hash) para tornar o processo de aprendizado mais suave.

Os Resultados: Uma Imagem Mais Nítida

Os autores testaram seu novo sistema contra os antigos usando esses novos conjuntos de dados.

  • A Pontuação: Seu novo sistema pontuou significativamente mais alto em uma escala de 0 a 1 (especificamente, melhorando as pontuações F1 em 3–4% para encontrar nomes e até 8% para encontrar conexões).
  • A Prova: Eles não testaram apenas em um tipo de relatório; testaram em três conjuntos de dados diferentes (DNRTI-AUG-STIX2, DNRTI e STUCCO) para provar que funciona independentemente do tipo de relatório cibernético que lê.

A Conclusão

Este artigo não afirma deter hackers ou prever o futuro. Em vez disso, afirma ter construído uma ferramenta melhor para especialistas em segurança. Ao corrigir os erros da "linha de montagem" e ensinar a IA a falar "hacker", eles criaram um sistema que transforma texto bagunçado em um mapa claro e confiável de ameaças cibernéticas. Este mapa ajuda as equipes de segurança a tomar decisões mais rápidas e informadas porque as informações são precisas e fáceis de consultar.

Os autores também compartilharam seus novos "dados de treinamento" e "livros de regras" no GitHub para que outros pesquisadores possam usá-los para construir sistemas ainda melhores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →