← Últimos artículos
🤖 AI

Weakly-Supervised Spatiotemporal Anomaly Detection

Este artículo propone un método de detección de anomalías espaciotemporales débilmente supervisado que utiliza etiquetas a nivel de video y una pérdida de clasificación de múltiples instancias para identificar anomalías localizadas dentro de fragmentos de video, demostrando su efectividad en el conjunto de datos UCF Crime2Local.

Autores originales: Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un guardia de seguridad vigilando cientos de cámaras de vigilancia al mismo tiempo. Tu trabajo es detectar algo extraño ocurriendo, como una pelea o un robo. El problema es que no puedes mirar cada pantalla las 24 horas del día, los 7 días de la semana, y las cosas extrañas ocurren muy raramente. Necesitas una computadora para ayudarte, pero enseñarle a una computadora es complicado porque etiquetar cada segundo individual de un video con "pelea aquí" o "robo allá" toma una eternidad.

Este artículo propone una forma inteligente de enseñarle a una computadora a detectar estos eventos extraños sin necesitar tanta etiquetación detallada. Así es como lo hicieron, explicado de forma sencilla:

La analogía de la "Caja de Misterio" (Supervisión Débil)

Por lo general, para enseñarle a una computadora, le muestras un video y dices: "¿Ves este clip específico de 5 segundos? Eso es una pelea". Pero en este artículo, los investigadores solo le dan a la computadora el video completo y dicen: "Este video contiene una pelea en algún lugar", o "Este video es totalmente normal".

Ellos llaman a esto Supervisión Débil. Es como darle a un estudiante una caja completa de bloques de LEGO mezclados y decirle: "Esta caja tiene un bloque rojo dentro", sin decirle exactamente cuál bloque es rojo. El estudiante tiene que averiguar cuál es.

El "Cubo Espaciotemporal" (Descomponerlo)

Para resolver el misterio, los investigadores no miraron el video como un solo bloque grande. Cortaron el video en pequeños bloques tridimensionales. Imagina cortar una barra de pan (tiempo) y luego cortar cada rebanada en una cuadrícula (espacio).

  • Tiempo: Cortaron el video en clips cortos.
  • Espacio: Cortaron cada clip en una cuadrícula de pequeños cuadrados.

Ahora, en lugar de mirar el video completo, la computadora mira estos pequeños "cubos" del video. Cada cubo es un pequeño fragmento de espacio y tiempo.

El "Bolsa de Trucos" (Aprendizaje de Múltiples Instancias)

Los investigadores utilizaron una estrategia llamada Aprendizaje de Múltiples Instancias (MIL). Imagínalo así:

  • La Bolsa: Un clip de video completo es una "bolsa".
  • Las Instancias: Los pequeños cubos dentro del video son los "objetos" en la bolsa.

Aquí está la regla que enseñaron a la computadora:

  • Si una bolsa está etiquetada como "Normal", entonces cada objeto individual dentro de esa bolsa debe ser normal.
  • Si una bolsa está etiquetada como "Anomalía" (Extraña), entonces al menos un objeto dentro de esa bolsa debe ser extraño.

El trabajo de la computadora es mirar todos los objetos en la bolsa "Extraña", encontrar el que parece más sospechoso y darle una puntuación alta. Luego intenta asegurarse de que la puntuación más alta en una bolsa "Extraña" sea mayor que la puntuación más alta en una bolsa "Normal".

El "Ojo de Detective" (Cómo funciona)

La computadora utiliza un cerebro preentrenado (llamado I3D) que ya es bueno reconociendo movimientos humanos.

  1. Toma un clip de video.
  2. Lo descompone en esos pequeños cubos 3D.
  3. Le pide al "cerebro" que describa lo que ve en cada cubo.
  4. Realiza una prueba para ver si alguno de esos cubos parece sospechoso.

Si la computadora ve una pelea, no solo dice "¡Pelea!". Señala el cuadrado pequeño específico en la pantalla donde está ocurriendo la pelea y dice: "La extrañeza está justo aquí".

Los Resultados: ¿Qué tan bien lo hizo?

Los investigadores probaron esto en un conjunto de datos llamado UCF Crime2Local, que tiene videos de crímenes del mundo real.

  • La Competencia: Compararon su método con otros métodos. Otro método era "supervisado", lo que significa que se le dieron las coordenadas exactas del crimen durante el entrenamiento (como mostrarle al estudiante el bloque rojo). Ese método obtuvo una puntuación de aproximadamente 75%.
  • Su Resultado: Su método, que no conocía la ubicación exacta durante el entrenamiento (al igual que un estudiante adivinando el bloque rojo), obtuvo una puntuación de 68%.

Aunque no superaron al método que tenía todas las respuestas, lo hicieron mucho mejor que otros métodos que también intentaron adivinar sin las respuestas.

¿Qué sigue? (La Conclusión)

El artículo concluye que observar tanto dónde (espacio) como cuándo (tiempo) ocurre un evento es una buena idea. Sin embargo, admiten que su computadora a veces se excita demasiado y marca múltiples lugares como "extraños" cuando solo hay uno.

Para mejorar aún más, sugieren dos cosas:

  1. Ajustar las reglas: Hacer que la computadora elija solo un lugar "más extraño" por video, en lugar de adivinar en todas partes.
  2. Observar el movimiento: Actualmente, la computadora mira principalmente cómo se ven las cosas. Sugieren añadir un segundo "ojo" que observe cómo se mueven las cosas (como el flujo óptico), porque el movimiento a menudo es una pista enorme para detectar crímenes.

En resumen, construyeron un sistema que puede adivinar dónde está ocurriendo un crimen en un video solo sabiendo que el video contiene un crimen, sin necesidad de que un humano dibuje un cuadro alrededor primero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →