← Últimos artigos
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

O artigo apresenta o SocioGesture, um sistema de percepção de gestos sociais em tempo real e adaptável para interação humano-robô que utiliza um modelo de fluxo duplo leve treinado com corrupção consciente de oclusão para alcançar reconhecimento robusto e de baixa latência em dispositivos de borda, enquanto expande continuamente seu vocabulário por meio de adaptação offline.

Autores originais: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Publicado 2026-09-07
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs estão aprendendo a se mover em nosso mundo, mas para que possam interagir conosco de forma natural, eles precisam fazer mais do que apenas seguir comandos falados. Eles precisam entender a linguagem silenciosa do movimento humano: um aceno para dizer olá, uma palma levantada para dizer pare, ou um telefone segurado ao ouvido para sinalizar "estou ocupado". Este é o desafio da interação humano-robô, um campo dedicado a ensinar as máquinas a ler essas pistas sociais. A dificuldade reside na realidade desordenada do mundo real. Ao contrário de um vídeo assistido em um escritório silencioso, um robô vê pessoas de ângulos em movimento, muitas vezes com as mãos escondidas atrás dos corpos ou perdidas nas sombras. Além disso, um robô não pode se dar ao luxo de pausar e pensar por muito tempo; se ele hesitar demais para interpretar um gesto, a interação parecerá quebrada e artificial. O objetivo é construir um sistema que seja rápido o suficiente para acompanhar uma conversa, inteligente o suficiente para lidar com partes faltantes de informação e capaz de aprender com seus erros sem precisar que um humano o reprograme toda vez.

Pesquisadores da OpenMind desenvolveram um novo sistema chamado SocioGesture para resolver este problema. É uma ferramenta de percepção em tempo real projetada especificamente para robôs que precisam reconhecer gestos sociais enquanto se movem e trabalham. O sistema funciona observando o esqueleto de uma pessoa — o mapa de suas articulações e ossos — em vez de tentar analisar suas roupas ou o cenário. Esta abordagem foi escolhida porque um esqueleto permanece reconhecível mesmo quando a iluminação muda ou a pessoa está usando roupas diferentes. No entanto, os pesquisadores sabiam que o rastreamento de esqueleto padrão costuma falhar quando uma mão está ocluída ou o ângulo da câmera muda. Para corrigir isso, eles construíram um modelo que presta atenção à confiança de cada articulação individual. Se a câmera do robô não tiver certeza de onde está uma mão, o sistema registra essa incerteza em vez de adivinhar cegamente. Ele combina o movimento amplo do corpo com os detalhes finos da mão, fundindo-os em um único cálculo ultrarrápido que roda diretamente no computador embarcado do robô.

A inovação central do SocioGesture é como ele lida com as inevitáveis lacunas nos dados. Em muitos sistemas anteriores, se uma articulação chave, como o pulso, estivesse faltando, toda a tentativa de reconhecimento falharia. Este novo sistema é treinado para esperar por essas lacunas. Os pesquisadores deliberadamente "corromperam" seus dados de treinamento escondendo mãos e braços em simulações de computador, forçando o modelo a aprender como reconhecer um gesto mesmo quando partes do esqueleto estão invisíveis. Esse treinamento acontece antes de o robô sequer sair do laboratório, de modo que o robô não precise de poder computacional extra para ser robusto. Quando o robô está em campo, ele toma decisões baseadas no que vê. Se estiver muito confiante sobre um gesto, ele age imediatamente. Se estiver incerto, ele não adivinha; em vez disso, salva esse momento de interação para revisão posterior. Isso cria um ciclo de segurança onde o robô evita cometer erros perigosos, como se aproximar de alguém que está tentando pará-lo, enquanto continua coletando dados para se tornar mais inteligente.

O sistema foi testado em uma variedade de ambientes internos e externos com pessoas reais. Os pesquisadores coletaram um conjunto de dados de sete gestos sociais comuns, incluindo acenar para convidar um robô para perto, levantar a mão para pará-lo ou fingir estar ao telefone para sinalizar indisponibilidade. Eles também incluíram um gesto "distrator", como coçar a cabeça, para garantir que o robô não o confundisse com uma chamada telefônica. Quando testado em pessoas que o robô nunca tinha visto antes, o sistema identificou corretamente os gestos em quase todos os casos, mesmo quando as mãos estavam parcialmente escondidas. Em um teste específico onde as mãos foram completamente mascaradas dos dados, a precisão do sistema saltou de um baixo 31 por cento para impressionantes 85 por cento, provando que o método de treinamento funcionou. O sistema também rodou rápido o suficiente para acompanhar uma câmera de vídeo padrão, processando um quadro completo em apenas 25 milissegundos em um computador montado no robô, o que é rápido o suficiente para parecer instantâneo para um observador humano.

Talvez a descoberta mais significativa seja a capacidade do sistema de aprender após a implantação. Os pesquisadores estabeleceram um processo onde o robô sinalizaria momentos sobre os quais estava incerto e enviaria esses clipes de vídeo para um computador mais potente na nuvem. Esse computador mais potente rotularia o gesto, e o robô usaria essa nova informação para atualizar seu próprio cérebro. Em um teste onde o robô aprendeu três novos gestos — dar um polegar para cima, um aperto de mão e uma saudação — ele aprendeu com sucesso sem esquecer os sete originais. O sistema manteve sua alta precisão nos gestos antigos enquanto identificava corretamente os novos cerca de dois terços das vezes. Isso demonstra um caminho a seguir onde os robôs podem expandir seu vocabulário de pistas sociais ao longo do tempo, adaptando-se a novas situações sem precisar ser desligados e treinados do zero.

Os pesquisadores também testaram o sistema em um robô vivo, uma máquina humanoide chamada Unitree G1, interagindo com cinco novas pessoas que nunca haviam participado dos dados de treinamento. Em 150 tentativas, o robô reconheceu corretamente o gesto em 97 por cento das vezes. Quando o robô decidiu agir, ele escolheu o comportamento correto — como aproximar-se ou parar — 98 por cento das vezes. As poucas vezes em que ele não agiu não foram porque cometeu um erro, mas porque estava sendo cauteloso; ele escolheu esperar em vez de arriscar um movimento errado. Essa abordagem conservadora é exatamente o que os designers pretendiam para um robô em um espaço público. O estudo sugere que, ao combinar um modelo leve e rápido com uma estratégia de prioridade à segurança e um ciclo de aprendizado offline, podemos construir robôs que não são apenas eficientes, mas também socialmente conscientes e adaptáveis à natureza imprevisível da interação humana.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →