← Últimos artigos
🤖 machine learning

Constructing Multi-label Hierarchical Classification Models for MITRE ATT&CK Text Tagging

Este artigo introduz um framework de classificação hierárquica multilabel para automatizar a etiquetagem de textos do MITRE ATT&CK que alcança alta precisão (94% no nível de tática e 82% no nível de técnica) utilizando métodos clássicos de aprendizado de máquina, superando significativamente o GPT-4o ao mesmo tempo em que elimina a necessidade de arquiteturas complexas baseadas em LLM.

Autores originais: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Publicado 2026-01-22
📖 4 min de leitura☕ Leitura rápida

Autores originais: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um bibliotecário tentando organizar uma biblioteca massiva e caótica de histórias sobre ataques cibernéticos. Cada vez que uma nova história (um "relatório de ameaça") chega, você precisa arquivá-la sob categorias específicas para que outros bibliotecários possam encontrá-la mais tarde.

No mundo da cibersegurança, esse sistema de arquivamento é chamado de MITRE ATT&CK. É como um arquivo gigante de dois níveis:

  1. A Gaveta Superior (Táticas): Responde à pergunta: "Por que o vilão fez isso?" (ex: "Eles queriam roubar senhas" ou "Eles queriam esconder seus rastros").
  2. A Gaveta Inferior (Técnicas): Responde à pergunta: "Como eles fizeram isso?" (ex: "Eles usaram um tipo específico de e-mail de phishing" ou "Eles usaram uma falha específica de software").

Por anos, especialistas em segurança tiveram que ler esses relatórios e arquivá-los manualmente nas gavetas corretas. Isso é lento, entediante e propenso ao erro humano. Este artigo é sobre a construção de um assistente robô para fazer esse arquivamento por eles.

A Construção "De Baixo para Cima" (Bottom-Up)

Em vez de tentar construir um robô gigante e complexo do zero (uma abordagem "top-down"), os autores construíram seu sistema passo a passo, como se estivessem empilhando blocos. Eles começaram pequeno e adicionaram complexidade apenas quando sabiam que o bloco anterior era sólido.

  1. Passo 1: O Classificador Simples (O Robô de "Um Rótulo")
    Primeiro, eles ensinaram um modelo simples de aprendizado de máquina a olhar para uma frase e adivinhar um único "Porquê" (Tática). Eles testaram isso contra o GPT-4o, o famoso chatbot de IA.

    • O Resultado: O robô simples venceu. Ele acertou cerca de 82% das respostas, enquanto o GPT-4o acertou apenas 59%. Os autores descobriram que, para essa tarefa específica e estruturada, uma ferramenta clássica e simples era, na verdade, melhor que a IA sofisticada e complexa.
  2. Passo 2: O Classificador de Múltiplos Rótulos (O Robô de "Múltiplos Rótulos")
    A vida real não é simples; uma única frase frequentemente possui múltiplos motivos para um ataque. Assim, eles atualizaram o robô para adivinhar os 3 principais "Porquês" em vez de apenas um.

    • O Resultado: Isso elevou a precisão para 94%.
  3. Passo 3: O Classificador Hierárquico (O Robô de "Arquivamento Completo")
    Finalmente, eles ensinaram o robô a adivinhar o "Porquê" e o "Como" juntos. Se o robô adivinha que o "Porquê" é "Roubo de Senhas", ele então procura pelo "Como" específico (ex: "Keylogging").

    • O Resultado: Este sistema alcançou 82% de precisão para a combinação completa de "Porquê + Como".

O "Ingrediente Secreto" (Por que funciona)

Os autores não usaram a IA Generativa mais recente e cara ou redes neurais complexas. Em vez disso, eles usaram aprendizado de máquina clássico (especificamente algo chamado "Gradiente Descendente Estocástico" com "TF-IDF").

Pense nisso desta forma: Em vez de construir um Ferrari supercomplexo e caro para ir ao supermercado, eles construíram uma bicicleta muito confiável e eficiente. Ela faz o trabalho mais rápido, custa menos e é mais fácil de consertar.

Eles também adicionaram um bloqueio de privacidade (hashing). Imagine que eles quisessem compartilhar seu robô com o mundo, mas estivessem preocupados em compartilhar as receitas secretas (os dados) usadas para treiná-lo. Eles descobriram uma maneira de embaralhar os dados para que o robô pudesse aprender com eles sem que ninguém pudesse ver os ingredientes originais. Isso permitiu que eles lançassem o robô ao público com segurança.

O "Teste da Nova Biblioteca"

Para ver se o seu robô era realmente inteligente, eles não testaram apenas nas histórias das quais ele aprendeu. Eles deram a ele um novo conjunto de histórias sobre ameaças financeiras (específicas para o setor bancário) que ele nunca tinha visto antes.

  • O Resultado: No início, o robô ficou confuso (porque as novas histórias eram diferentes). Mas, quando deram a ele apenas um pouco de treinamento nessas novas histórias, ele aprendeu rapidamente a arquivá-las corretamente. Isso prova que o robô é flexível e pode se adaptar a novas situações sem a necessidade de uma quantidade massiva de novos dados.

A Grande Conclusão

O artigo conclui que você nem sempre precisa da IA mais cara e complexa para resolver um problema. Ao decompor a tarefa em etapas pequenas e gerenciáveis e usar ferramentas clássicas e confiáveis, eles construíram um sistema que:

  • É mais preciso do que um chatbot de IA de alto nível (GPT-4o) para este trabalho específico.
  • É mais rápido e barato de operar.
  • É seguro para compartilhar com o público.
  • Pode se adaptar a novos tipos de dados com muito pouco treinamento adicional.

Eles disponibilizaram este "robô bibliotecário" gratuitamente no GitHub para que outras equipes de segurança possam usá-lo para organizar seus próprios relatórios de ameaças cibernéticas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →