Resumo Técnico: Um Benchmark Controlado de Modelos Híbridos e Estatísticos de Representação de Imagem Sequencial Bruta para Detecção de Anomalias Consciente de Representação em Séries Temporais de Consumo de Eletricidade Doméstica
Definição do Problema
A detecção de anomalias de eventos raros em séries temporais multivariadas de consumo de eletricidade é influenciada não apenas pela arquitetura do modelo, mas significamente pela representação de dados utilizada antes do aprendizado. Embora o aprendizado profundo tenha avançado na detecção de anomalias, há uma comparação controlada insuficiente entre a modelagem sequencial bruta, transformações temporais baseadas em imagem (especificamente Gramian Angular Field ou GAF), estratégias de fusão híbrida e baselines estatísticos tabulares.
A literatura existente frequentemente avalia representações baseadas em imagens sem comparações suficientemente robustas contra baselines sequenciais brutos ou falha em esclarecer se os ganhos de desempenho advêm da representação em si, da capacidade do modelo ou de protocolos específicos de construção de anomalias. Além disso, muitos estudos assumem que transformar dados de séries temporais em imagens (por exemplo, GAF) melhora universalmente a extração de características, uma afirmação que requer validação rigorosa sob condições de desequilíbrio e eventos raros, onde desvios temporais locais refinados são críticos.
Metodologia
O estudo estabelece um benchmark controlado e consciente de vazamento (leakage-aware) utilizando o conjunto de dados UCI Individual Household Electric Power Consumption. O design experimental prioriza a reprodutibilidade e a separação estrita de dados para evitar o vazamento de informações.
1. Dados e Pré-processamento:
- Conjunto de Dados: Um subconjunto de 300.000 amostras ordenadas cronologicamente (210 dias) de uma única residência, cobrindo sete características numéricas (Potência ativa/reativa global, Voltagem, Intensidade e três cargas de submedição).
- Divisão (Splitting): A divisão cronológica de treino-validação-teste foi realizada antes de qualquer injeção de anomalia para garantir a integridade temporal.
- Normalização: Os parâmetros de normalização min-max foram ajustados exclusivamente no conjunto de treinamento e aplicados aos conjuntos de validação e teste.
2. Construção de Anomalias Sintéticas:
Como o conjunto de dados carece de rótulos de falhas naturais, perturbações sintéticas controladas foram injetadas após a divisão:
- Anomalias de Ponto: Picos/quedas aleatórios em uma única característica (razão: 0,008).
- Anomalias de Contexto: Deslocamentos aditivos locais dentro de segmentos curtos (razão: 0,008).
- Anomalias Coletivas: Subsequências sustentadas com distorções de bloco de pico, linha constante ou inversas (razão: 0,015).
3. Janelamento e Rotulagem:
- Janelas Deslizantes: Janelas de comprimento 60 com um stride de 20 foram geradas.
- Rotulagem Baseada em Densidade: Para evitar a inflação excessiva da classe anômala, uma janela foi rotulada como anômala apenas se a densidade de anomalia (razão de pontos anômalos dentro da janela) excedesse um limiar de τ=0,15. Isso resultou em um conjunto de dados moderadamente desequilibrado (~11% de razão de anomalia).
4. Estratégias de Representação:
Quatro estratégias distintas de representação foram derivadas dos mesmos dados em janelas:
- Sequencial Bruta (Raw Sequential): Matriz 60×7 preservando a ordem temporal original.
- Imagem GAF: Cada característica transformada em uma imagem Gramian Angular Field de 60×60, empilhada em um tensor de 60×60×7.
- Descritores Estatísticos: Um vetor de 98 dimensões por janela contendo média, desvio padrão, percentis, diferenças e correlações entre características.
5. Pipelines de Modelos:
Quatro pipelines foram avaliados sob um protocolo unificado (mesmas divisões, limiares e métricas):
- 1D-CNN Bruta: Convolução direta sobre as janelas sequenciais brutas.
- GAF-CNN: Rede convolucional 2D com blocos residuais e atenção sobre as imagens GAF.
- Fusão Híbrida: Concatenação das características da GAF-CNN e de um ramo de descritores estatísticos.
- XGBoost: Gradient boosting sobre descritores estatísticos.
6. Protocolo de Avaliação:
- Tratamento de Desequilíbrio: O oversampling da classe minoritária foi aplicado apenas ao conjunto de treinamento para modelos profundos; o XGBoost utilizou verificações de ponderação de classe.
- Ajuste de Limiar: Os limiares específicos de cada modelo foram ajustados no conjunto de validação para maximizar o F1-score.
- Métricas: Ênfase em F1-score, PR-AUC, Precisão e Recall, além de Acurácia e ROC-AUC.
- Verificações de Robustez: O estudo incluiu auditorias de cobertura do dataset, efeitos de borda de rotulagem de janela (verificando a ausência de falsos negativos estruturais para anomalias coletivas de comprimento-10 em τ=0,15), ponderação de desequilíbrio do XGBoost e intervalos de confiança de bootstrap.
Principais Contribuições
- Benchmark Controlado: Desenvolveu um benchmark reprodutível de comparação de representação para séries temporais de consumo de eletricidade doméstica, isolando os efeitos de aprendizado sequencial bruto, baseado em GAF, híbrido e estatístico sob um protocolo compartilhado de anomalia sintética.
- Design Consciente de Vazamento: Estabeleceu um fluxo de trabalho experimental onde a divisão cronológica precede a construção de anomalias e o janelamento, prevenindo estritamente o vazamento de dados.
- Evidência Empírica sobre Representação: Forneceu evidências de que, sob design específico de perturbação sintética e rotulagem de janela, a transformação de séries temporais em imagens (como GAF) não supera necessariamente a modelagem temporal direta.
- Interpretação Limitada: Enquadrou deliberadamente os resultados como uma comparação de pipelines de representação-modelo em um benchmark sintético controlado, evitando explicitamente afirmações de superioridade para detecção de falhas em escala de rede real.
Resultados
Sob o limiar otimizado de F1 na validação, a 1D-CNN Bruta alcançou o melhor desempenho geral:
- Acurácia: 0,9528
- Precisão: 0,9116
- Recall: 0,6471
- F1-score: 0,7569
- PR-AUC: 0,7500
Ranking de Modelos:
- 1D-CNN Bruta: Melhor equilíbrio geral de sensibilidade e controle de falsos alarmes.
- Fusão Híbrida: Ficou em segundo lugar (F1: 0,6908), superando significativamente a GAF e o XGBoost isolados, sugerindo que a fusão de características de imagem e estatísticas mitiga algumas limitações do aprendizado apenas por imagem.
- XGBoost: Competitivo (F1: 0,6445), confirmando que descritores estatísticos permanecem como baselines fortes.
- GAF-CNN: Desempenho mais fraco (F1: 0,5410), indicando que a transformação baseada em imagem isolada foi menos eficaz para as perturbações específicas, esparsas e localizadas deste benchmark.
Observações Chave:
- A 1D-CNN Bruta preservou as flutuações locais e dependências de curto alcance de forma mais eficaz do que a transformação GAF, que pode ter suavizado ou redistribuído pistas temporais refinadas.
- Todos os modelos exibiram recall moderado (~60-65%), indicando que aproximadamente 35% das janelas anômalas permaneceram não detectadas, uma limitação crítica para implantação operacional.
- O modelo de Fusão Híbrida melhorou em relação à GAF-CNN, mas não superou a 1D-CNN Bruta, sugerindo que o aumento da complexidade representacional não garante desempenho superior.
Significância e Alegações
O artigo afirma que a escolha da representação é um fator crítico e frequentemente subexplorado no desempenho da detecção de anomalias. O estudo desafia a suposição de que transformações de série temporal para imagem (como GAF) melhoram universalmente a capacidade discriminativa. Em vez disso, demonstra que, para anomalias raras e localmente distribuídas em dados de eletricidade doméstica, a modelagem temporal direta (1D-CNN Bruta) pode ser mais eficaz do que o aprendizado baseado em imagens transformadas.
Modéstia das Alegações:
Os autores declaram explicitamente que estes achados não são prova de superioridade para detecção de anomalias em redes reais. O estudo é limitado por:
- O uso de rótulos de anomalias sintéticas em vez de falhas naturalmente ocorrentes.
- Dados de uma única residência, carecendo de topologia de rede ou dinâmica multi-residencial.
- A geometria específica de rotulagem de janela e perturbação utilizada.
Portanto, a significância do trabalho reside em fornecer uma comparação empírica cautelosa de estratégias de representação. Argumenta-se que, antes de reivindicar superioridade arquitetônica, os pesquisadores devem avaliar sistematicamente os pipelines de representação-modelo sob condições explícitas, reprodutíveis e conscientes de desequilíbrio. Os resultados sugerem que aumentar a complexidade representacional não leva automaticamente a uma melhor detecção de anomalias e que a estratégia mais adequada deve ser determinada empiricamente para o contexto operacional específico.