← Últimos artículos
🤖 AI

Integrating Skeleton Based Representations for Robust Yoga Pose Classification Using Deep Learning Models

Este estudio introduce el conjunto de datos 'Yoga-16' y demuestra que las representaciones basadas en esqueletos, particularmente cuando son procesadas por VGG16 con entradas de MediaPipe Pose, superan a las entradas de imágenes puras para lograr una robusta precisión del 96.09% en la clasificación automatizada de posturas de yoga.

Autores originales: Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain

Publicado 2026-07-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo hacer yoga. Podrías mostrarle miles de fotos de personas en posturas de yoga, pero el robot podría distraerse con el fondo: la alfombra con patrones, la luz del sol en la pared o la colorida camisa de la persona. ¡Podría pensar que la camisa es parte de la postura! Este es el desafío de la Visión Artificial, una rama de la inteligencia artificial donde las computadoras aprenden a "ver" y comprender imágenes. Para resolver esto, los científicos suelen utilizar un truco llamado Estimación de Pose. Piensa en esto como un esqueleto digital: en lugar de mirar a toda la persona, la computadora elimina la piel y la ropa para ver solo las articulaciones y los huesos de un dibujo de palitos. Esto ayuda a la computadora a concentrarse en la forma de la postura en sí, ignorando el fondo desordenado. Pero aquí está la gran pregunta: ¿Es mejor mirar la foto original o es mejor mirar el esqueleto limpio? Y qué "cerebro" (o modelo de aprendizaje profundo) es el mejor para leer estos esqueletos. Esto es exactamente lo que los investigadores de este artículo querían averiguar para ayudar a las personas a practicar yoga de forma segura sin necesidad de tener a un profesor humano al lado.

Este artículo, titulado "Integrating Skeleton Based Representations for Robust Yoga Pose Classification Using Deep Learning Models", es esencialmente una gran prueba de sabor para ver qué combinación de "ojos" y "cerebro" funciona mejor para reconocer posturas de yoga. Los autores, un equipo de la Universidad Premier de Bangladesh, crearon su propia colección especial de imágenes de yoga llamada "Yoga-16". Seleccionaron 16 posturas populares, que van desde las sencillas como la "Postura de la Silla" hasta las complicadas como la "Señora de la Danza", y limpiaron las imágenes para asegurarse de que fueran de alta calidad y equilibradas.

Para probar sus ideas, probaron tres formas diferentes de alimentar los cerebros de computadora con imágenes:

  1. Imágenes Directas: Mostrar a la computadora la foto completa y original.
  2. Esqueletos de MediaPipe: Mostrar a la computadora una imagen donde la persona se ha convertido en un limpio esqueleto de palitos utilizando una herramienta llamada MediaPipe.
  3. Esqueletos de YOLOv8: Mostrar a la computadora un esqueleto de palitos hecho por una herramienta diferente llamada YOLOv8.

Luego pasaron estas imágenes a través de tres cerebros de computadora famosos (modelos de aprendizaje profundo): VGG16, ResNet50 y Xception. Estos son como diferentes tipos de estudiantes superobsesivos, cada uno con una forma única de estudiar patrones.

Los resultados fueron bastante claros y sorprendentes para algunos. El artículo encontró que las representaciones basadas en esqueletos son las ganadoras. Cuando la computadora miraba los esqueletos limpios de palitos en lugar de las fotos desordenadas, era mucho mejor adivinando la postura. Específicamente, el modelo VGG16, cuando se le alimentó con esqueletos de MediaPipe, alcanzó la precisión más alta de 96.09%. Esto significa que acertó la postura casi todas las veces. En comparación, cuando el mismo modelo miraba las fotos originales, su precisión bajaba al 86.33%. Los otros modelos, ResNet50 y Xception, también funcionaron mejor con esqueletos que con fotos originales, pero VGG16 fue el campeón.

Los investigadores no se limitaron a los números; utilizaron una herramienta llamada Grad-CAM para echar un vistazo dentro del cerebro de la computadora y ver qué estaba mirando. Resulta que, al usar los esqueletos de MediaPipe, la computadora se enfocaba perfectamente en las partes importantes, como el ángulo de un brazo o la flexión de una rodilla, ignorando todo lo demás. Sin embargo, descubrieron que la computadora a veces se confundía con posturas que se ven muy similares, como el "Plancha de Delfín" y la "Postura del Pez", porque sus formas de palitos son casi idénticas.

El artículo argumenta explícitamente en contra de la idea de que las imágenes originales son siempre la mejor manera de enseñar yoga a una computadora. Sus experimentos sugieren que eliminar el ruido del fondo y centrarse en la estructura del esqueleto hace que el sistema sea mucho más confiable. También descartaron la idea de que todas las herramientas de esqueletos son iguales; encontraron que la herramienta MediaPipe producía esqueletos más estables y precisos que la herramienta YOLOv8 para esta tarea específica.

Aunque los resultados son impresionantes, los autores tienen cuidado de no afirmar que han "resuelto" el yoga para siempre. Señalan que su conjunto de datos, Yoga-16, es relativamente pequeño (con unas 80 imágenes por postura), y utilizaron validación cruzada para asegurar que sus resultados fueran sólidos, obteniendo una puntuación constante de alrededor de 93.55% incluso cuando probaban con diferentes segmentos de datos. También probaron el modelo con un nuevo conjunto de imágenes personalizadas tomadas de YouTube para ver si podía manejar el desorden del mundo real, y aun así funcionó bien, aunque con una ligera caída en la precisión al 93.75%.

En resumen, este artículo sugiere que si quieres construir una aplicación que ayude a las personas a hacer yoga correctamente, probablemente deberías reducir a la persona a un esqueleto digital primero y usar un modelo VGG16 para leerlo. Es un paso hacia hacer el yoga más accesible, asegurando que, incluso si no tienes un gurú en la habitación, tu asistente digital sepa exactamente cómo debe doblarse tu columna vertebral.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →