Related Families, Not Label Errors: A Case Study of a Failure Mode in Open-World Malware Evaluation on BODMAS
Este artigo demonstra que o baixo desempenho da detecção de malware em mundo aberto no benchmark BODMAS é causado não por erros de rotulagem ou falhas no detector, mas pela presença de famílias intimamente relacionadas no conjunto de treinamento que tornam as amostras "novas" retidas, na verdade, familiares para métodos de pontuação de novidade não supervisionados.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo digital, pesquisadores de segurança constroem programas projetados para agir como sentinelas, constantemente escaneando em busca de software malicioso que ameaça computadores. Esses programas são treinados para reconhecer ameaças conhecidas, mas o verdadeiro desafio reside no "mundo aberto", onde tipos inteiramente novos de malware aparecem todos os dias. Para testar se essas sentinelas estão realmente prontas para o desconhecido, os pesquisadores usam um método específico: eles escondem um grupo inteiro de software malicioso conhecido do programa de treinamento e então perguntam: "Seu sistema consegue identificar este novo grupo como algo que ele nunca viu antes?" Se o sistema sinalizar o grupo escondido como um estranho, ele passa no teste. Esse processo assume que o grupo escondido é genuinamente único e não possui parentes próximos nos dados de treinamento. Se o grupo escondido for, na verdade, um primo de um grupo que o sistema já conhece, o teste falha, não porque o sistema seja fraco, mas porque a pergunta sendo feita é falha.
Uma equipe de pesquisadores investigou recentemente uma falha intrigante em um dos testes mais respeitados para detecção de malware, conhecido como BODMAS. Eles descobriram que, quando removiam uma família específica de malware chamada berbew dos dados de treinamento, o sistema de detecção falhava espetacularmente. Em vez de sinalizar as amostras escondidas como novas ameaças, o sistema as rotulava confiantemente como software conhecido e seguro. Os resultados foram tão ruins que o sistema teve um desempenho inferior ao de um palpite aleatório. À primeira vista, isso parecia uma falha catastrófica da tecnologia de detecção. No entanto, os pesquisadores descobriram que a culpa não estava na inteligência do software, mas na estrutura do próprio teste. A família berbew escondida tinha um parente muito próximo, chamado qukart, que permanecia nos dados de treinamento. Como os dois grupos eram tão semelhantes em suas impressões digitais digitais, o sistema reconheceu corretamente que as amostras escondidas pertenciam a uma família que ele já conhecia, mesmo que não soubesse o nome específico do grupo escondido. O teste estava penalizando o sistema por ser preciso sobre o relacionamento entre os dois grupos.
Para provar isso, os pesquisadores conduziram um experimento controlado. Eles removeram tanto a família berbew quanto a qukart dos dados de treinamento ao mesmo tempo, garantindo que nenhum parente próximo fosse deixado para trás. Quando executaram o teste novamente, o desempenho do sistema nas amostras de berbew disparou de uma pontuação de falha para uma detecção quase perfeita. Essa mudança dramática confirmou que a falha original foi causada pela presença de uma família relacionada no conjunto de treinamento, não por uma falha no algoritmo de detecção. Os pesquisadores foram cuidadosos para descartar outras explicações comuns. Eles auditararam todo o conjunto de dados, verificando milhares de pares de famílias de malware para ver se algum era na verdade um duplicata com nomes diferentes, o que poderia ter causado a confusão. Eles não encontraram duplicatas entre os pares mais suspeitos. Eles também examinaram as convenções de nomenclatura usadas pelos fornecedores de antivírus, que frequentemente agrupam malware relacionado sob um único nome de linhagem. Eles descobriram que esses nomes não previam o problema; em um caso documentado, três famílias eram consideradas parte da mesma linhagem, mas apenas duas delas eram de fato próximas o suficiente para confundir o sistema. A terceira era distinta, mostrando que confiar apenas nos nomes teria mesclado os grupos errados e ignorado o problema real.
O estudo revelou ainda que essa confusão era específica da maneira como o sistema media a "novidade". Os pesquisadores testaram várias abordagens matemáticas diferentes para detectar o desconhecido. Eles descobriram que qualquer método que comparasse uma amostra a um resumo global e amplo de todo o software conhecido falharia quando um parente próximo estivesse presente. Esses métodos veriam a amostra escondida como normal porque ela era próxima do parente conhecido. No entanto, uma abordagem diferente, que comparava uma amostra apenas aos seus vizinhos mais próximos, teve um desempenho melhor. Não obteve a resposta completamente correta, mas não inverteu totalmente o resultado, sugerindo que olhar para detalhes locais em vez de uma média global é uma estratégia mais segura quando parentes próximos existem. Os pesquisadores também observaram que um sistema supervisionado, que tinha permissão para usar os nomes das famílias durante o treinamento, poderia separar os dois grupos efetivamente, provando que os rótulos estavam corretos e as famílias eram distintas, apenas muito semelhantes.
A lição central deste trabalho é que a maneira como testamos o software de segurança precisa mudar. Simplesmente relatar uma pontuação média única de quão bem um sistema detecta novas ameaças esconde essas falhas críticas. Os pesquisadores argumentam que, antes de declarar um teste bem-sucedido, devemos primeiro medir o quão intimamente relacionados são os grupos escondidos aos grupos usados para treinamento. Se um grupo escondido tem um primo próximo no conjunto de treinamento, o teste não está medindo a capacidade de encontrar o verdadeiramente desconhecido; está medindo a capacidade de distinguir entre conhecidos muito semelhantes. A solução não é remover essas famílias relacionadas do teste, pois elas representam ameaças realistas que as equipes de segurança devem lidar. Em vez disso, os pesquisadores devem relatar os resultados separadamente para famílias que possuem parentes próximos e aquelas que não possuem. Essa transparência garante que um sistema não seja injustamente punido por identificar corretamente uma linhagem conhecida e fornece uma imagem mais clara de onde a tecnologia realmente se encontra. Ao documentar esse modo de falha específico e as etapas tomadas para entendê-lo, os pesquisadores esperam evitar que outros repitam os mesmos erros e encorajar uma avaliação mais honesta de quão bem nossas sentinelas digitais podem realmente enxergar o desconhecido.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.