Resumen Técnico: Un Benchmarking Controlado de Modelos Híbridos y Estadísticos de Representación de Secuencias de Imágenes en Bruto para la Detección de Anomalías Sensibles a la Representación en Series Temporales de Consumo Eléctrico Doméstico
Planteamiento del Problema
La detección de anomalías de eventos raros en series temporales multivariantes de consumo eléctrico está influenciada no solo por la arquitectura del modelo, sino significativamente por la representación de los datos utilizada antes del aprendizaje. Aunque el aprendizaje profundo ha avanzado en la detección de anomalías, existe una comparación controlada insuficiente entre el modelado secuencial en bruto, las transformaciones temporales basadas en imágenes (específicamente el Campo Angular de Gramian o GAF), las estrategias de fusión híbrida y los baselines estadísticos tabulares.
La literatura existente suele evaluar las representaciones basadas en imágenes sin realizar comparaciones suficientemente sólidas contra los baselines de secuencias en bruto, o bien no logra aclarar si las mejoras en el rendimiento provienen de la representación en sí, de la capacidad del modelo o de protocolos específicos de construcción de anomalías. Además, muchos estudios asumen que transformar datos de series temporales en imágenes (por ejemplo, GAF) mejora universalmente la extracción de características, una afirmación que requiere una validación rigurosa bajo condiciones de desequilibrio y de eventos raros donde las desviaciones temporales locales finas son críticas.
Metodología
El estudio establece un benchmark controlado y consciente de la fuga de datos (leakage-aware) utilizando el conjunto de datos UCI Individual Household Electric Power Consumption. El diseño experimental prioriza la reproducibilidad y una separación estricta de los datos para evitar la fuga de información.
1. Datos y Preprocesamiento:
- Conjunto de datos: Un subconjunto de 300,000 muestras ordenadas cronológicamente (210 días) de un solo hogar, que cubre siete características numéricas (potencia activa/reactiva global, voltaje, intensidad y tres cargas de sub-medición).
- División (Splitting): Se realizó una división cronológica de entrenamiento-validación-prueba antes de cualquier inyección de anomalías para asegurar la integridad temporal.
- Normalización: Los parámetros de normalización min-max se ajustaron únicamente en el conjunto de entrenamiento y se aplicaron a los conjuntos de validación y prueba.
2. Construcción de Anomalías Sintéticas:
Dado que el conjunto de datos carece de etiquetas de fallos naturales, se inyectaron perturbaciones sintéticas controladas post-división:
- Anomalías de Punto: Picos/caídas aleatorios en una sola característica (ratio: 0.008).
- Anomalías Contextuales: Desplazamientos aditivos locales dentro de segmentos cortos (ratio: 0.008).
- Anomalías Colectivas: Subsecuencias sostenidas con distorsiones de tipo bloque de picos, línea plana o inversas (ratio: 0.015).
3. Ventaneo y Etiquetado:
- Ventanas Deslizantes: Ventanas de longitud 60 con un paso (stride) de 20.
- Etiquetado Basado en Densidad: Para evitar la sobreinflación de la clase de anomalía, una ventana se etiquetó como anómala solo si la densidad de anomalía (ratio de puntos anómalos dentro de la ventana) excedía un umbral de τ=0.15. Esto resultó en un conjunto de datos moderadamente desequilibrado (~11% de ratio de anomalía).
4. Estrategias de Representación:
Se derivaron cuatro estrategias de representación distintas a partir de los mismos datos ventaneados:
- Secuencia en Bruto (Raw Sequential): Matriz de 60×7 que preserva el orden temporal original.
- Imagen GAF: Cada característica transformada en una imagen de Campo Angular de Gramian de 60×60, apilada en un tensor de 60×60×7.
- Descriptores Estadísticos: Un vector de 98 dimensiones por ventana que contiene media, desviación estándar, percentiles, diferencias e inter-correlaciones entre características.
5. Pipelines de Modelos:
Se evaluaron cuatro pipelines bajo un protocolo unificado (mismos cortes, umbrales y métricas):
- 1D-CNN en Bruto: Convolución directa sobre ventanas secuenciales originales.
- GAF-CNN: Red convolucional 2D con bloques residuales y atención sobre imágenes GAF.
- Fusión Híbrida: Concatenación de características de GAF-CNN y una rama de descriptores estadísticos.
- XGBoost: Boosting de gradiente sobre descriptores estadísticos.
6. Protocolo de Evaluación:
- Manejo de Desequilibrio: Se aplicó sobremuestreo de la clase minoritaria solo al conjunto de entrenamiento para los modelos profundos; XGBoost utilizó verificaciones de ponderación de clase.
- Ajuste de Umbral: Los umbrales específicos del modelo se ajustaron en el conjunto de validación para maximizar el F1-score.
- Métricas: Énfasis en F1-score, PR-AUC, Precisión y Recall, junto con Accuracy y ROC-AUC.
- Verificaciones de Robustez: El estudio incluyó auditorías de cobertura del dataset, efectos de frontera en el etiquetado de ventanas (verificando la ausencia de falsos negativos estructurales para anomalías colectivas de longitud-10 con τ=0.15), ponderación de desequilibrio de XGBoost e intervalos de confianza de bootstrap.
Contribuciones Clave
- Benchmark Controlado: Desarrollo de un benchmark reproducible de comparación de representaciones para series temporales de consumo eléctrico doméstico, aislando los efectos del aprendizaje secuencial en bruto, basado en GAF, híbrido y estadístico bajo un protocolo de anomalía sintética compartido.
- Diseño Consciente de Fuga (Leakage-Aware): Establecimiento de un flujo de trabajo experimental donde la división cronológica precede a la construcción de anomalías y al ventaneo, previniendo estrictamente la fuga de datos.
- Evidencia Empírica sobre la Representación: Provisión de evidencia de que, bajo un diseño específico de perturbación sintética y etiquetado de ventanas, el modelado de series temporales mediante imágenes GAF no necesariamente supera al modelado temporal directo.
- Interpretación Acotada: Encuadre deliberado de los resultados como una comparación de pipelines de representación-modelo en un benchmark sintético controlado, evitando explícitamente afirmaciones de superioridad para la detección de fallos a escala de red real.
Resultados
Bajo el umbral optimizado de F1 en la validación, la 1D-CNN en Bruto logró el mejor rendimiento general:
- Accuracy: 0.9528
- Precisión: 0.9116
- Recall: 0.6471
- F1-score: 0.7569
- PR-AUC: 0.7500
Ranking de Modelos:
- 1D-CNN en Bruto: Mejor equilibrio general de sensibilidad y control de falsas alarmas.
- Fusión Híbrida: Clasificada en segundo lugar (F1: 0.6908), superando significativamente al GAF y a XGBoost de forma independiente, lo que sugiere que la fusión de características de imagen y estadísticas mitiga algunas limitaciones del aprendizaje basado solo en imágenes.
- XGBoost: Competitivo (F1: 0.6445), confirmando que los descriptores estadísticos siguen siendo baselines sólidos.
- GAF-CNN: El de menor rendimiento (F1: 0.5410), indicando que la transformación de imagen independiente fue menos efectiva para las perturbaciones específicas, dispersas y localizadas de este benchmark.
Observaciones Clave:
- La 1D-CNN en Bruto preservó las fluctuaciones locales y las dependencias de corto alcance de manera más efectiva que la transformación GAF, la cual pudo haber suavizado o redistribuido las señales temporales finas.
- Todos los modelos exhibieron un recall moderado (~60-65%), lo que indica que aproximadamente el 35% de las ventanas anómalas permanecieron sin detectar, una limitación crítica para el despliegue operativo.
- El modelo de Fusión Híbrida mejoró respecto al GAF-CNN pero no superó a la 1D-CNN en Bruto, sugiriendo que el aumento de la complejidad representacional no garantiza un rendimiento superior.
Significación y Reivindicaciones
El artículo sostiene que la elección de la representación es un factor crítico y a menudo subexplorado en el rendimiento de la detección de anomalías. El estudio desafía la suposición de que las transformaciones de serie temporal a imagen (como GAF) mejoran universalmente la capacidad discriminativa. En cambio, demuestra que para anomalías domésticas de electricidad raras y localmente distribuidas, el modelado temporal directo (1D-CNN en Bruto) puede ser más efectivo que el aprendizaje basado en imágenes transformadas.
Modestia de las Reivindicaciones:
Los autores declaran explícitamente que estos hallazgos no son una prueba de superioridad para la detección de anomalías en redes eléctricas reales. El estudio está limitado por:
- El uso de etiquetas de anomalías sintéticas en lugar de fallos naturales.
- Datos de un único hogar, que carece de la topología de red a gran escala o de la dinámica multi-hogar.
- La geometría específica de etiquetado de ventanas y perturbación.
Por lo tanto, la significación del trabajo reside en proporcionar una comparación empírica cautelosa de las estrategias de representación. Argumenta que, antes de reclamar la superioridad arquitectónica, los investigadores deben evaluar sistemáticamente los pipelines de representación-modelo bajo condiciones explícitas, reproducibles y conscientes del desequilibrio. Los resultados sugieren que aumentar la complejidad representacional no conduce automáticamente a un mejor detector de anomalías y que la estrategia más adecuada debe determinarse empíricamente para el contexto operativo específico.