← Últimos artigos
💻 computer science

A Residual Transformer Framework for Biomechanics-Aware Yoga Posture Recognition and Feedback

Este artigo propõe a Residual Biomechanical Transformer Network (RBTNet), uma estrutura de aprendizado profundo que combina a detecção de pontos-chave YOLOv8m-Pose com uma análise temporal baseada em Transformer para alcançar 98% de precisão na classificação de oito posturas de yoga e na geração de feedback corretivo baseado em desvios angulares biomecânicos das articulações sem a necessidade de dados específicos do usuário.

Autores originais: Mrinal Kanti Nath, Tapan Chowdhury, Nilay Dhar, Hiranmoy Sarkar, Debanjan Bunia, Arman Munshi

Publicado 2026-09-09
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Mrinal Kanti Nath, Tapan Chowdhury, Nilay Dhar, Hiranmoy Sarkar, Debanjan Bunia, Arman Munshi

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Durante séculos, a prática do ioga tem sido uma ponte entre a disciplina física e a clareza mental, baseando-se no alinhamento preciso do corpo para desbloquear seus benefícios. No entanto, para milhões de praticantes que aprendem isoladamente ou através de telas digitais, o caminho para a forma correta é frequentemente pavimentado pela incerteza. Sem um instrutor experiente para detectar um joelho desalinhado ou uma coluna inclinada, os próprios movimentos destinados a curar podem levar ao esforço ou à lesão. O desafio reside em traduzir a linguagem sutil e fluida do corpo humano em algo que uma máquina possa compreender. Este é o domínio da visão computacional, um campo onde câmeras e algoritmos trabalham juntos para ver e interpretar o movimento. Embora os sistemas modernos já consigam identificar onde os pontos articulares de uma pessoa estão localizados em um vídeo, eles historicamente têm tido dificuldade em compreender a história do movimento ao longo do tempo ou em oferecer conselhos específicos e seguros sobre como corrigir um erro. Eles frequentemente veem um único instantâneo de uma pose, em vez do fluxo contínuo de uma prática, e carecem da capacidade de distinguir entre um alongamento deliberado e um erro perigoso.

Uma equipe de pesquisadores no Techno Main Salt Lake, na Índia, desenvolveu um novo sistema projetado para resolver esses problemas específicos, criando um assistente digital que não apenas reconhece posturas de ioga, mas compreende a biomecânica por trás delas. O trabalho deles, intitulado Residual Biomechanical Transformer Network, vai além do simples reconhecimento de imagem para construir um modelo que observa uma pessoa se mover, analisa os ângulos de suas articulações e fornece instruções imediatas e claras sobre como corrigir sua forma. O sistema foi testado em oito posturas comuns de ioga, incluindo o Guerreiro, a Árvore e a Cobra, e alcançou um nível notável de precisão, identificando corretamente a postura em 98 por cento dos casos. Mais importante ainda, ele faz isso sem precisar de um banco de dados dos detalhes físicos pessoais do usuário, como idade ou flexibilidade, tornando-o uma ferramenta universal para qualquer pessoa que busque praticar com segurança.

A jornada começa com a câmera, que atua como os olhos do sistema. Em vez de tentar analisar os detalhes complexos das roupas de uma pessoa ou o plano de fundo da sala, o software primeiro localiza dezessete pontos específicos no esqueleto humano, como ombros, cotovelos, quadris e joelhos. Este processo, conhecido como estimativa de pose, remove tudo o que é desnecessário para focar puramente na estrutura do corpo. No entanto, os pesquisadores perceberam que saber apenas onde esses pontos estão em um único quadro não é suficiente. O ioga é uma atividade dinâmica; uma pose é frequentemente o resultado de um movimento, e a transição para uma posição pode parecer enganosamente semelhante a outros movimentos. Para capturar isso, o sistema não olha para uma imagem de cada vez. Em vez disso, ele observa uma sequência de trinta quadros, criando uma curta janela de tempo que permite compreender o fluxo do movimento. Essa consciência temporal ajuda o sistema a distinguir entre uma pose que está sendo mantida de forma estável e uma que está apenas passando por uma forma semelhante durante uma transição.

Uma vez que o sistema capturou essa sequência de movimentos esqueléticos, ele traduz as posições brutas das articulações em uma linguagem de geometria que é independente do tamanho da pessoa ou da distância da câmera. Ele calcula os ângulos entre as articulações, os comprimentos relativos dos membros e as proporções do corpo, normalizando essas medições para que uma pessoa alta e uma pessoa baixa realizando a mesma pose pareçam idênticas ao algoritmo. Isso cria uma descrição compacta de 74 dimensões da configuração do corpo que foca inteiramente na biomecânica da pose. O sistema então alimenta essa descrição em uma rede neural especializada, um tipo de inteligência artificial projetada para encontrar padrões em sequências. Esta rede presta atenção especial aos momentos mais críticos dentro da sequência, aprendendo a reconhecer as características estáveis e definidoras de cada postura de ioga, enquanto ignora os momentos fugazes de transição.

A verdadeira inovação deste arcabouço reside em como ele lida com erros. Muitos sistemas existentes podem simplesmente adivinhar a pose correta e parar por aí, ou podem depender de regras rígidas e pré-programadas que falham quando o corpo do usuário é ligeiramente diferente. Esta nova abordagem combina o poder de aprendizado da rede neural com um conjunto de regras anatômicas claras. Assim que o sistema identifica uma pose, ele imediatamente verifica os ângulos das articulações do usuário em relação às faixas ideais para aquela postura específica. Se um joelho estiver dobrado demais ou um ombro estiver levantado demais, o sistema não apenas sinaliza um erro; ele gera uma instrução específica e legível por humanos. Por exemplo, se um usuário estiver tentando a pose do Guerreiro, mas seu joelho frontal estiver reto em vez de dobrado, o sistema declarará explicitamente que o joelho deve estar dobrado em aproximadamente noventa graus. Esse feedback é gerado com base no desvio medido do ângulo ideal, garantindo que o conselho seja sempre relevante para o erro específico que está sendo cometido.

Os pesquisadores testaram seu sistema em um conjunto de dados contendo milhares de imagens de pessoas realizando oito posturas diferentes de ioga. Os resultados foram impressionantes. O sistema identificou corretamente a postura em 98 por cento dos casos de teste, um nível de precisão que sugere que ele dominou as nuances visuais e temporais desses movimentos. Teve um desempenho particularmente bom em poses distintas como a Cadeira e a Árvore, onde o corpo forma uma forma clara e única. Mesmo em cenários mais desafiadores onde as poses compartilham posições iniciais ou finais semelhantes, como a transição entre a pose do Guerreiro e a do Cachorro, o sistema conseguiu diferenciá-las com alta precisão. Quando o sistema cometia um erro, era quase sempre uma confusão entre duas poses que parecem muito semelhantes durante uma fase específica do movimento, e não uma falha total de reconhecimento da estrutura do corpo.

Além dos números, o sistema demonstrou sua capacidade de trabalhar em tempo real, processando vídeo ao vivo de uma webcam com uma velocidade que permite o feedback imediato. Em testes ao vivo, o sistema identificou com sucesso as poses e destacou articulações específicas que estavam fora de alinhamento, oferecendo correções que correspondiam às faixas biomecânicas ideais. Por exemplo, quando um usuário mantinha uma pose com um ângulo de joelho muito amplo, o sistema fornecia uma instrução direta para ajustar o membro, espelhando a orientação que um instrutor humano daria. Essa capacidade de fornecer feedback acionável e específico para a pose, sem exigir que o usuário insira seus dados físicos pessoais, torna o sistema altamente adaptável. Ele não precisa saber se o usuário é jovem ou velho, flexível ou rígido; ele simplesmente mede a geometria do movimento contra os padrões universais da pose.

O sucesso deste arcabouço sugere um novo direcionamento para como a tecnologia pode apoiar o bem-estar físico. Ao se afastar de verificações estáticas baseadas em regras e avançar para um sistema que compreende o movimento como um evento temporal contínuo, os pesquisadores criaram uma ferramenta que é tanto inteligente quanto interpretável. O sistema não opera como uma caixa preta; seu feedback é diretamente rastreável aos ângulos das articulações, tornando o conselho transparente e confiável. Embora o estudo atual tenha focado em oito poses específicas, o método subjacente é projetado para ser escalável, capaz de aprender novos movimentos conforme mais dados tornam-se disponíveis. O trabalho prova que, com a combinação certa de visão computacional, engenharia biomecânica e aprendizado profundo, as máquinas podem aprender a ver o corpo humano não apenas como uma coleção de pixels, mas como uma estrutura dinâmica que pode ser guiada em direção a um movimento mais seguro e eficaz.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →