← Últimos artigos
💻 computer science

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

Este artigo apresenta o TorchSight, um sistema local de código aberto que utiliza um modelo Qwen 3.5 27B ajustado finamente e treinado em mais de 78.000 amostras, o qual alcança uma precisão significativamente maior (95,0%) na classificação de documentos de segurança em comparação com alternativas comerciais baseadas em nuvem, ao mesmo tempo em que garante que os dados permaneçam sob controle local.

Autores originais: Ivan Dobrovolskyi

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ivan Dobrovolskyi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A "Nuvem" vs. A "Sala Segura"

Imagine que você trabalha para um banco ou um hospital. Você tem milhares de documentos e precisa encontrar aqueles que contêm senhas secretas, números de cartão de crédito ou planos militares classificados.

Atualmente, as empresas têm duas maneiras principais de fazer isso:

  1. O Método do "Livro de Regras": Eles usam um programa de computador que procura por padrões específicos, como uma sequência de números que se parece com um cartão de crédito. É rápido, mas é burro. Se você escrever uma história sobre um número de cartão de crédito falso em um tutorial, o programa grita "ALERTA!" mesmo sendo seguro. Ele perde coisas que não parecem padrões, mas ainda são perigosas.
  2. O Método da "Nuvem": Eles enviam todos os seus documentos para uma IA gigante e inteligente na nuvem (como um assistente superinteligente em uma grande empresa de tecnologia) para lê-los. Essa IA é muito inteligente e entende o contexto. Mas, para usá-la, você tem que enviar seus documentos secretos para fora do seu prédio para o prédio de outra pessoa. Para um banco ou para o exército, isso é um risco enorme. Eles não podem deixar seus segredos saírem do prédio.

A Solução do Artigo: O autor construiu um sistema chamado TorchSight. É como contratar um guarda de segurança superinteligente que vive dentro do seu prédio. Este guarda é inteligente o suficiente para entender o contexto (diferente do livro de regras), mas nunca sai do prédio (diferente do serviço em nuvem).

O "Guarda" (O Modelo de IA)

O autor pegou um cérebro de IA muito grande e pré-treinado (chamado Qwen 3.5) e deu a ele um "campo de treinamento" especial.

  • O Treinamento: Eles não apenas mostraram documentos aleatórios. Eles alimentaram o sistema com 78.358 exemplos de documentos. Alguns eram vazamentos reais, alguns eram exemplos falsos criados por outra IA, e alguns eram "armadilhas" complicadas (documentos que parecem perigosos, mas são seguros, ou vice-versa).
  • O Resultado: Isso criou uma versão especializada da IA chamada Beam. Ela aprendeu a distinguir entre um segredo real e um exemplo inofensivo, algo com que os "Livros de Regras" e até as IAs da "Nuvem" lutavam.

O Grande Teste: Quem é o Melhor Guarda?

O autor colocou o novo guarda Beam contra os melhores guardas da "Nuvem" (como GPT-5, Claude e Gemini) e os antigos guardas do "Livro de Regras". Eles deram a todos os mesmos 1.000 documentos para classificar.

Os Resultados:

  • Os Guardas da Nuvem: Eles acertaram cerca de 75% a 80%. Eles estavam ok, mas cometeram muitos erros.
  • O Livro de Regras: Ele acertou apenas cerca de 53%. Era muito facilmente confundido.
  • O Guarda Beam (Local): Ele acertou 95%.

O Problema do "Falso Alarme":
A parte mais importante de um sistema de segurança não é apenas pegar os bandidos, mas não gritar "Incêndio!" quando alguém está apenas segurando uma vela.

  • Quando os guardas da Nuvem olhavam para documentos seguros (como uma receita de culinária ou um artigo de notícias público), eles frequentemente entravam em pânico. Eles achavam que 22% a 63% dos documentos seguros eram perigosos. Isso deixaria uma equipe de segurança louca, pois teriam que verificar cada arquivo seguro.
  • O Beam entrou em pânico em apenas 2% dos documentos seguros. Ele conhecia a diferença entre uma ameaça real e um arquivo inofensivo muito melhor do que os outros.

Por que o Beam foi tão bom?

O artigo explica que o segredo não foi apenas o tamanho da IA, mas como ela foi ensinada.

  • O autor criou um conjunto específico de "regras" (uma taxonomia) com 51 tipos diferentes de segredos (como "Registros Médicos", "Planos Militares", "Senhas").
  • As IAs da Nuvem foram instruídas a "encontrar segredos", mas elas criavam suas próprias categorias ou ficavam confusas.
  • O Beam foi ajustado para seguir estritamente as 51 categorias. Ele aprendeu a falar a mesma língua que a equipe de segurança. Foi como ensinar um cachorro a sentar, ficar e buscar itens específicos, em vez de apenas dizer "seja bom".

O Teste do "Mundo Exterior"

Para garantir que o Beam não estava apenas memorizando o teste de prática, o autor o testou em um conjunto completamente diferente de 500 documentos que ele nunca tinha visto antes (como e-mails de phishing reais e registros médicos de bancos de dados públicos).

  • O Beam ainda marcou 93,8%.
  • As IAs da Nuvem caíram significativamente, com algumas marcando tão baixo quanto 65%.
  • Isso prova que o Beam realmente aprendeu o conceito de segurança, e não apenas as respostas específicas do teste de prática.

A Conclusão

O artigo mostra que você não precisa enviar seus segredos para a nuvem para obter uma IA inteligente que os proteja. Ao treinar uma IA local em um conjunto de dados massivo e cuidadosamente curado, você pode obter um sistema que é:

  1. Mais Preciso: Ele encontra mais ameaças reais.
  2. Menos Chato: Ele faz muito menos falsos alarmes em arquivos seguros.
  3. Privado: Os documentos nunca saem do seu computador.

O autor liberou todo o sistema (o código, os dados de treinamento e o modelo de IA) gratuitamente para que qualquer pessoa possa usá-lo para construir seu próprio guarda de segurança de "Sala Segura".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →