User-Centric Phishing Detection: A RAG and LLM-Based Approach
Este artigo propõe um framework de detecção de phishing centrado no usuário que integra a geração aumentada por recuperação (RAG) com grandes modelos de linguagem para aproveitar contextos históricos de e-mails personalizados e inteligência de ameaças em tempo real, reduzindo efetivamente falsos positivos e alcançando alta precisão em múltiplos modelos de código aberto.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um segurança muito inteligente, altamente instruído, de um grande edifício de escritórios. Este segurança leu milhões de livros sobre crimes e sabe exatamente como um "vilão" se parece em um livro didático. Porém, este segurança tem um problema: ele é rigoroso demais. Ele frequentemente confunde um funcionário comum carregando um pacote de aparência estranha com um criminoso, causando muitos alarmes desnecessários e frustração.
Este artigo apresenta uma nova maneira de treinar esse segurança para que ele cometa menos erros. Aqui está a divisão simples de como isso funciona:
O Problema: O Segurança "Tamanho Único"
Os filtros de e-mail tradicionais são como esse segurança rigoroso. Eles olham para um e-mail e perguntam: "Isso parece um golpe?". Se a resposta for mesmo que apenas um "talvez", eles bloqueiam.
- O Problema: Às vezes, um e-mail legítimo do seu chefe pode parecer um pouco estranho (talvez ele esteja usando uma gíria nova ou um link esquisito). O antigo segurança bloqueia isso porque não corresponde ao padrão de um e-mail normal. Isso é chamado de Falso Positivo. É como o segurança parando um funcionário real porque ele estava usando um chapéu que parecia suspeito.
A Solução: O "Detetive Personalizado"
Os autores criaram um sistema que dá ao segurança um livro de memórias pessoal e um feed de notícias ao vivo antes de ele tomar uma decisão. Eles chamam isso de um sistema RAG (Geração Aumentada de Recuperação).
Aqui está como o novo sistema funciona em três etapas:
1. O Livro de Memórias (Contexto do Usuário)
Antes de o segurança olhar para um novo e-mail, o sistema folheia rapidamente os e-mails legítimos passados do usuário.
- A Analogia: Imagine que o segurança pergunta: "Ei, essa pessoa costuma enviar e-mails como este?". Se o e-mail parecer estranho, mas corresponder ao estilo dos e-mails que o usuário realmente recebe de seu chefe, o segurança diz: "Ah, isso é normal para esta pessoa", e o deixa passar.
- Como funciona: O sistema usa IA para encontrar os 5 e-mails mais semelhantes do histórico do usuário para mostrar ao segurança como referência.
2. O Feed de Notícias ao Vivo (Inteligência de Ameaças)
O sistema também verifica um banco de dados ao vivo (como um boletim de ocorrência digital) para ver se os links ou sites no e-mail são conhecidos por serem perigosos.
- A Analogia: Mesmo que o e-mail pareça ser de um amigo, se o link dentro dele levar a um "bairro perigoso" conhecido (um site malicioso), o segurança recebe um alerta do feed ao vivo.
3. A Decisão Inteligente (O LLM)
O segurança é, na verdade, um Modelo de Linguagem Grande (LLM) — uma IA superinteligente que entende a linguagem muito bem. Em vez de apenas olhar para o e-mail isoladamente, a IA olha para:
- O novo e-mail.
- O "Livro de Memórias" (e-mails passados semelhantes).
- O "Feed de Notícias ao Vivo" (dados de ameaças).
Ela então toma uma decisão final: "Isso é um golpe ou é apenas um e-mail estranho, mas real?"
Os Resultados: Menos Erros
Os pesquisadores testaram este novo sistema usando quatro tipos diferentes de "seguranças" de IA (chamados de Llama4, DeepSeek, Mistral e Gemma). Eles compararam o quão bem os seguranças funcionavam sem o livro de memórias versus com ele.
- A Grande Vitória: Quando os seguranças usaram o livro de memórias (RAG), eles cometeram significativamente menos erros.
- O Destaque: O modelo Llama4-Scout foi o melhor.
- Sem o livro de memórias, ele bloqueou 12% dos bons e-mails por engano (Falsos Positivos).
- Com o livro de memórias, ele bloqueou apenas 4% dos bons e-mails.
- Ele também ficou melhor em capturar os próprios golpistas (uma pontuação de 0,97 de 1,0).
O Ponto Principal
Este artigo prova que você não precisa apenas de uma IA inteligente para deter o phishing; você precisa de uma IA que conheça o usuário. Ao dar à IA uma rápida olhada no que o usuário costuma receber, o sistema evita sinalizar e-mails normais e de aparência estranha como golpes. Isso torna o sistema de segurança muito mais preciso e menos irritante para as pessoas que o utilizam.
Em resumo: Transforma um segurança genérico e excessivamente zeloso em um detetive personalizado que conhece seus hábitos, resultando em menos alarmes falsos e melhor proteção.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.