← Últimos artículos
💻 computer science

Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining

Este artículo propone un novedoso marco de localización de acciones espacio-temporales de cero disparos basado en esqueletos que aprovecha el preentrenamiento de visión y lenguaje débilmente supervisado y el aprendizaje contrastivo discriminativo de escena mixta para identificar eficazmente acciones no vistas al tiempo que supera los altos costos de anotación.

Autores originales: Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

Publicado 2026-08-27
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la visión artificial, enseñar a las máquinas a comprender el movimiento humano es un desafío fundamental con profundas implicaciones para la robótica, la seguridad y la vigilancia automatizada. Durante décadas, los investigadores han recurrido a dos estrategias principales para resolver este enigma. La primera estrategia observa la escena completa, analizando colores, iluminación y el fondo para adivinar qué está sucediendo. La segunda estrategia ignora el escenario por completo, centrándose únicamente en el esqueleto móvil de una persona: la disposición específica de articulaciones y extremidades. Aunque el primer enfoque es intuitivo, a menudo falla cuando el fondo cambia o cuando la iluminación es deficiente. El segundo enfoque, que rastrea el esqueleto, es mucho más robusto frente a estos cambios ambientales, pero históricamente ha sufrido un problema diferente: requiere una enorme cantidad de mano de obra humana para ser enseñado. Para entrenar a una computadora para reconocer una acción específica, como una persona cayendo o peleando, los investigadores tradicionalmente tenían que dibujar minuciosamente cuadros alrededor de cada persona en cada uno de los fotogramas de miles de videos y etiquetar exactamente lo que estaban haciendo. Este proceso es tan costoso y lento que limita la capacidad de enseñar nuevas acciones a las computadoras rápidamente.

Un equipo de investigadores ha desarrollado ahora un nuevo método que evita esta pesada carga de etiquetado manual, permitiendo que las computadoras aprendan a detectar nuevas acciones sin haber visto un solo ejemplo de ellas de antemano. Su enfoque, detallado en un estudio reciente, introduce un sistema que aprende de descripciones de video generales y amplias en lugar de anotaciones fotograma a fotograma. En lugar de que se le diga "esta persona está dando un puñetazo en este segundo exacto", el sistema es entrenado con videos completos con etiquetas de texto simples que describen la actividad general, como "jugar al golf" o "conducir". Al utilizar una técnica que alinea los datos visuales de los esqueletos humanos con las descripciones de texto de las acciones, el sistema aprende un lenguaje universal del movimiento. Una vez entrenado, puede observar un video que contiene personas realizando una acción que nunca ha visto e identificar con precisión tanto quién la está realizando como qué están haciendo. Los investigadores demostraron que este método no solo iguala la precisión de los sistemas entrenados con cantidades masivas de etiquetas detalladas, sino que también resulta significativamente más resistente cuando la calidad del video es deficiente o el fondo está desordenado.

El núcleo de esta innovación reside en un ingenioso cambio en la forma en que la computadora procesa la información, un mecanismo que los autores llaman Skeleton-Language feature Pooling Switching (Conmutación de Agrupación de Características de Esqueleto y Lenguaje). Imagine un sistema que primero aprende a entender el estado de ánimo general de una habitación escuchando un resumen de la conversación y luego, cuando se le pide identificar a un hablante específico, cambia su enfoque para escuchar voces individuales. En la fase de entrenamiento, la computadora observa un video y reúne todos los datos del esqueleto de todas las personas en el clip en un único resumen. Luego, compara este resumen con la etiqueta de texto proporcionada para todo el video. Esto permite que el sistema aprenda la conexión entre un tipo de movimiento y una palabra sin necesidad de saber exactamente quién se mueve o cuándo. Sin embargo, cuando el sistema pasa a la fase de prueba, cambia de marcha. Deja de mirar el video como un todo y, en su lugar, aísla el esqueleto de cada persona individualmente. Debido a que ya ha aprendido la conexión entre los patrones de movimiento y las palabras durante la fase de entrenamiento, ahora puede observar el esqueleto de una sola persona y preguntarse: "¿Se parece esto a la descripción de texto de 'dar un puñetazo'?". Este cambio permite al sistema señalar acciones específicas para personas específicas sin haber sido mostrado nunca un video donde esas personas específicas estuvieran etiquetadas.

Para que esto funcione en escenas complejas donde múltiples personas se mueven al mismo tiempo, los investigadores tuvieron que resolver un problema complicado: cómo enseñar a la computadora a distinguir entre diferentes personas cuando solo se le da una etiqueta para todo el video. Si un video muestra a una persona corriendo y a otra caminando, y la etiqueta es simplemente "ejercicio", la computadora podría confundirse sobre qué movimiento pertenece a qué etiqueta. Para solucionar esto, el equipo introdujo una técnica llamada Scene-Mixed Discriminative Contrastive Learning (Aprendizaje Contrastivo Discriminativo Mezclado de Escenas). Este método toma fragmentos de diferentes videos y los mezcla artificialmente durante el proceso de entrenamiento. Al crear un entorno caótico donde múltiples acciones ocurren una al lado de la otra, el sistema se ve obligado a aprender las sutiles diferencias entre ellas. Aprende a distinguir que el movimiento de una persona corriendo es distinto al de una persona saltando, incluso cuando aparecen en el mismo contexto mezclado. Esto asegura que, cuando el sistema encuentre un video real con múltiples personas, pueda asignar con confianza la acción correcta a la persona correcta.

Los resultados de este enfoque fueron probados contra varios conjuntos de datos estándar utilizados para evaluar qué tan bien las computadoras pueden encontrar y etiquetar acciones en videos. En un conjunto de datos que contiene veinticuatro acciones diferentes, el nuevo método alcanzó una precisión del 34.1 por ciento, superando a los métodos previamente débilmente supervisados que dependían de entrenamientos menos sofisticados. Más impresionante aún, cuando fue probado en un conjunto de datos diseñado específicamente para rastrear personas que caen, el nuevo sistema alcanzó una precisión del 73.3 por ciento, superando significativamente a los métodos existentes que dependen del seguimiento de las posiciones de las personas a lo largo del tiempo. Los investigadores también descubrieron que su sistema era mucho más robusto ante la mala calidad del video. Cuando los videos de entrada estaban borrosos o tenían fotogramas faltantes, el rendimiento de los sistemas que dependen de la apariencia visual cayó drásticamente, mientras que el sistema basado en el esqueleto mantuvo su alta precisión. Esto sugiere que, al centrarse en la estructura del cuerpo en lugar del aspecto de la escena, el sistema puede funcionar de manera confiable en condiciones del mundo real donde las cámaras podrían estar temblorosas o la iluminación podría ser tenue.

Otro hallazgo crítico fue la eficiencia del sistema. Mientras que muchos modelos de inteligencia artificial modernos que pueden entender video y texto requieren miles de millones de parámetros y una potencia de cómputo masiva para ejecutarse, este nuevo método opera con un modelo que contiene solo unos 70 millones de parámetros. A pesar de ser mucho más pequeño, alcanzó una precisión del 84.0 por ciento en un conjunto de datos de acciones violentas, superando a modelos mucho más grandes y complejos. Además, el sistema es increíblemente rápido, procesando video a una tasa de aproximadamente 1900 fotogramas por segundo, lo que es aproximadamente 240 veces más rápido que algunos de los grandes modelos de lenguaje utilizados para tareas similares. Esta combinación de alta precisión, bajo costo computacional y la capacidad de aprender nuevas acciones sin un reentrenamiento costoso sugiere un camino práctico para el despliegue de sistemas de vigilancia inteligente y robóticos que puedan adaptarse a nuevas situaciones sin requerir un equipo de humanos que pase semanas etiquetando datos.

El estudio concluye que, al cambiar el enfoque de un etiquetado costoso fotograma a fotograma hacia un proceso de aprendizaje guiado por texto más flexible, es posible construir sistemas que comprendan la acción humana con un nivel de sofisticación anteriormente reservado para modelos fuertemente supervisados. Los investigadores han demostrado que es factible entrenar a una computadora para reconocer acciones no vistas enseñándole la relación entre los movimientos corporales y el lenguaje, en lugar de obligarla a memorizar cada variación posible de un evento específico. Este enfoque no solo reduce el costo y el tiempo requeridos para desarrollar nuevos sistemas de reconocimiento de acciones, sino que también crea modelos que son más robustos y adaptables a la naturaleza desordenada e impredecible del mundo real. A medida que la tecnología madure, podría permitir una nueva generación de aplicaciones que monitoreen la seguridad, asistan en el análisis deportivo o guíen a robots, todo ello sin el costo prohibitivo de la anotación manual de datos que ha sido durante mucho tiempo un cuello de botella en el campo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →