A Residual Transformer Framework for Biomechanics-Aware Yoga Posture Recognition and Feedback
Este artículo propone la Red de Transformador Biomecánico Residual (RBTNet), un marco de aprendizaje profundo que combina la detección de puntos clave YOLOv8m-Pose con un análisis temporal basado en Transformers para lograr una precisión del 98% en la clasificación de ocho posturas de yoga y la generación de retroalimentación correctiva basada en desviaciones de los ángulos articulares biomecánicos sin requerir datos específicos del usuario.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Durante siglos, la práctica del yoga ha sido un puente entre la disciplina física y la claridad mental, basándose en la alineación precisa del cuerpo para desbloquear sus beneficios. Sin embargo, para millones de practicantes que aprenden de forma aislada o a través de pantallas digitales, el camino hacia la forma correcta suele estar pavimentado con incertidumbre. Sin un instructor experto que detecte una rodilla mal alineada o una columna inclinada, los mismos movimientos destinados a sanar pueden provocar tensión o lesiones. El desafío radica en traducir el lenguaje sutil y fluido del cuerpo humano en algo que una máquina pueda entender. Este es el dominio de la visión artificial, un campo donde las cámaras y los algoritmos trabajan juntos para ver e interpretar el movimiento. Si bien los sistemas modernos ya pueden identificar dónde se encuentran las articulaciones de una persona en un video, históricamente han tenido dificultades para comprender la historia del movimiento a lo largo del tiempo o para ofrecer consejos específicos y seguros sobre cómo corregir un error. A menudo ven una instantánea única de una postura en lugar del flujo continuo de una práctica, y carecen de la capacidad de distinguir entre un estiramiento deliberado y un error peligroso.
Un equipo de investigadores en Techno Main Salt Lake, en la India, ha desarrollado un nuevo sistema diseñado para resolver estos problemas específicos, creando un asistente digital que no solo reconoce las posturas de yoga, sino que comprende la biomecánica que hay detrás de ellas. Su trabajo, titulado Residual Biomechanical Transformer Network, va más allá del simple reconocimiento de imágenes para construir un modelo que observa cómo se mueve una persona, analiza los ángulos de sus articulaciones y proporciona instrucciones inmediatas y claras sobre cómo corregir su forma. El sistema fue probado en ocho posturas de yoga comunes, incluyendo el Guerrero, el Árbol y la Cobra, y logró un nivel de precisión notable, identificando correctamente la postura en el 9 de cada 10 casos (98 por ciento). Más importante aún, lo hace sin necesidad de una base de datos de los detalles físicos personales del usuario, como su edad o flexibilidad, lo que lo convierte en una herramienta universal para cualquiera que busque practicar de forma segura.
El viaje comienza con la cámara, que actúa como los ojos del sistema. En lugar de intentar analizar los detalles complejos de la ropa de una persona o el fondo de la habitación, el software primero localiza diecisiete puntos específicos en el esqueleto humano, como los hombros, los codos, las caderas y las rodillas. Este proceso, conocido como estimación de la pose, elimina todo lo innecesario para centrarse puramente en la estructura del cuerpo. Sin embargo, los investigadores se dieron cuenta de que saber simplemente dónde están estos puntos en un solo fotograma no es suficiente. El yoga es una actividad dinámica; una postura es a menudo el resultado de un movimiento, y la transición hacia una posición puede parecer engañosamente similar a otros movimientos. Para capturar esto, el sistema no observa una imagen a la vez. En su lugar, observa una secuencia de treinta fotogramas, creando una breve ventana de tiempo que le permite comprender el flujo del movimiento. Esta conciencia temporal ayuda al sistema a distinguir entre una postura que se mantiene de forma estable y una que simplemente está pasando por una forma similar durante una transición.
Una vez que el sistema ha capturado esta secuencia de movimientos esqueléticos, traduce las posiciones brutas de las articulaciones a un lenguaje de geometría que es independiente del tamaño de la persona o de su distancia respecto a la cámara. Calcula los ángulos entre las articulaciones, las longitudes relativas de las extremidades y las proporciones del cuerpo, normalizando estas mediciones para que una persona alta y una persona baja realizando la misma postura parezcan idénticas para el algoritmo. Esto crea una descripción compacta de 74 dimensiones de la configuración del cuerpo que se centra enteramente en la biomecánica de la postura. El sistema alimenta entonces esta descripción a una red neuronal especializada, un tipo de inteligencia artificial diseñada para encontrar patrones en secuencias. Esta red presta especial atención a los momentos más críticos dentro de la secuencia, aprendiendo a reconocer las características estables y definitorias de cada postura de yoga mientras ignora los momentos fugaces de transición.
La verdadera innovación de este marco reside en cómo gestiona los errores. Muchos sistemas existentes podrían simplemente adivinar la postura correcta y detenerse ahí, o podrían depender de reglas rígidas y preprogramadas que fallan cuando el cuerpo del usuario es ligeramente diferente. Este nuevo enfoque combina el poder de aprendizaje de la red neuronal con un conjunto de reglas anatómicas claras. Una vez que el sistema identifica una postura, comprueba inmediatamente los ángulos de las articulaciones del usuario frente a los rangos ideales para esa postura específica. Si una rodilla está demasiado flexionada o un hombro está demasiado elevado, el sistema no solo señala un error; genera una instrucción específica y legible para el ser humano. Por ejemplo, si un usuario está intentando la postura del Guerrero pero su rodilla delantera está recta en lugar de flexionada, el sistema indicará explícitamente que la rodilla debería estar flexionada aproximadamente a noventa grados. Este comentario se genera basándose en la desviación medida del ángulo ideal, asegurando que el consejo sea siempre relevante para el error específico cometido.
Los investigadores probaron su sistema con un conjunto de datos que contenía miles de imágenes de personas realizando ocho posturas de yoga diferentes. Los resultados fueron impactantes. El sistema identificó correctamente la postura en el 98 por ciento de los casos de prueba, un nivel de precisión que sugiere que ha dominado los matices visuales y temporales de estos movimientos. Funcionó particularmente bien en posturas distintas como la Silla y el Árbol, donde el cuerpo forma una forma clara y única. Incluso en escenarios más desafiantes donde las posturas comparten posiciones iniciales o finales similares, como la transición entre la postura del Guerrero y la del Perro, el sistema logró diferenciarlas con alta precisión. Cuando el sistema cometía un error, era casi siempre una confusión entre dos posturas que se ven muy similares durante una fase específica del movimiento, más que un fallo total en el reconocimiento de la estructura corporal.
Más allá de los números, el sistema demostró su capacidad para trabajar en tiempo real, procesando video en vivo desde una cámara web con una velocidad que permite una retroalimentación inmediata. En pruebas en vivo, el sistema identificó con éxito las posturas y resaltó las articulaciones específicas que estaban fuera de alineación, ofreciendo correcciones que coincidían con los rangos biomecánicos ideales. Por ejemplo, cuando un usuario mantenía una postura con un ángulo de rodilla demasiado ancho, el sistema proporcionaba una instrucción directa para ajustar la extremidad, imitando la guía que daría un instructor humano. Esta capacidad de proporcionar comentarios accionables y específicos de la postura sin requerir que el usuario introduzca sus estadísticas físicas personales hace que el sistema sea altamente adaptable. No necesita saber si el usuario es joven o viejo, flexible o rígido; simplemente mide la geometría del movimiento frente a los estándares universales de la postura.
El éxito de este marco sugiere una nueva dirección para la forma en que la tecnología puede apoyar el bienestar físico. Al alejarse de las comprobaciones estáticas basadas en reglas y avanzar hacia un sistema que entiende el movimiento como un evento temporal continuo, los investigadores han creado una herramienta que es tanto inteligente como interpretable. El sistema no opera como una caja negra; su retroalimentación es directamente rastreable a los ángulos de las articulaciones, lo que hace que el consejo sea transparente y confiable. Aunque el estudio actual se centró en ocho posturas específicas, el método subyacente está diseñado para ser escalable, capaz de aprender nuevos movimientos a medida que haya más datos disponibles. El trabajo demuestra que, con la combinación adecuada de visión artificial, ingeniería biomecánica y aprendizaje profundo, las máquinas pueden aprender a ver el cuerpo humano no solo como una colección de píxeles, sino como una estructura dinámica que puede ser guiada hacia un movimiento más seguro y efectivo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.