← Últimos artículos
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

El artículo presenta SocioGesture, un sistema de percepción de gestos sociales en tiempo real y adaptativo para la interacción humano-robot que utiliza un modelo ligero de doble flujo entrenado con corrupción consciente de la oclusión para lograr un reconocimiento robusto y de baja latencia en dispositivos periféricos mientras expande continuamente su vocabulario mediante adaptación fuera de línea.

Autores originales: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Publicado 2026-09-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots están aprendiendo a moverse por nuestro mundo, pero para que puedan interactuar con nosotros de forma natural, deben hacer algo más que seguir órdenes habladas. Necesitan comprender el lenguaje silencioso del movimiento humano: un saludo con la mano para decir hola, una palma levantada para decir alto, o un teléfono sostenido junto al oído para señalar "estoy ocupado". Este es el desafío de la interacción humano-robot, un campo dedicado a enseñar a las máquinas cómo leer estas señales sociales. La dificultad radica en la realidad desordenada del mundo real. A diferencia de un video visto en una oficina tranquila, un robot ve a las personas desde ángulos en movimiento, a menudo con las manos ocultas detrás del cuerpo o perdidas en las sombras. Además, un robot no puede permitirse pausar y pensar durante mucho tiempo; si duda demasiado para interpretar un gesto, la interacción se siente rota y antinatural. El objetivo es construir un sistema que sea lo suficientemente rápido como para seguir el ritmo de una conversación, lo suficientemente inteligente para manejar piezas de información faltantes y capaz de aprender de sus errores sin necesidad de que un humano lo reprograme cada vez.

Los investigadores de OpenMind han desarrollado un nuevo sistema llamado SocioGesture para resolver este problema. Es una herramienta de percepción en tiempo real diseñada específicamente para robots que necesitan reconocer gestos sociales mientras se mueven y trabajan. El sistema funciona observando el esqueleto de una persona —el mapa de sus articulaciones y huesos— en lugar de intentar analizar su ropa o el fondo. Este enfoque se elige porque un esqueleto permanece reconocible incluso cuando la iluminación cambia o la persona viste ropa diferente. Sin embargo, los investigadores sabían que el seguimiento de esqueletos estándar suele fallar cuando una mano está ocluida o el ángulo de la cámara cambia. Para solucionar esto, construyeron un modelo que presta atención a la confianza de cada articulación individual. Si la cámara del robot no está segura de dónde está una mano, el sistema nota esa incertidumbre en lugar de adivinar a ciegas. Combina el movimiento amplio del cuerpo con los detalles finos de la mano, fusionándolos en un único cálculo ultrarrápido que se ejecuta directamente en la computadora integrada del robot.

La innovación central de SocioGesture es cómo maneja las inevitables brechas en los datos. En muchos sistemas anteriores, si una articulación clave como la muñeca faltaba, todo el intento de reconocimiento fallaba. Este nuevo sistema está entrenado para esperar esas brechas. Los investigadores "corrompieron" deliberadamente sus datos de entrenamiento ocultando manos y brazos en las simulaciones por computadora, obligando al modelo a aprender cómo reconocer un gesto incluso cuando partes del esqueleto son invisibles. Este entrenamiento ocurre antes de que el robot salga del laboratorio, por lo que el robot no necesita potencia de cómputo adicional para ser robusto. Cuando el robot está en el campo, toma decisiones basadas en lo que ve. Si tiene mucha confianza sobre un gesto, actúa de inmediato. Si no está seguro, no adivina; en su lugar, guarda ese momento de interacción para una revisión posterior. Esto crea un bucle de seguridad donde el robot evita cometer errores peligrosos, como acercarse a alguien que intenta detenerlo, mientras sigue recopilando datos para volverse más inteligente.

El sistema fue probado en una variedad de entornos interiores y exteriores con personas reales. Los investigadores recopilaron un conjunto de datos de siete gestos sociales comunes, incluyendo saludar con la mano para invitar al robot a acercarse, levantar una mano para detenerlo, o fingir que se está hablando por teléfono para señalar indisponibilidad. También incluyeron un gesto "distractor", como rascarse la cabeza, para asegurar que el robot no lo confundiera con una llamada telefónica. Al probarlo con personas que el robot nunca había visto antes, el sistema identificó correctamente los gestos en casi todos los casos, incluso cuando las manos estaban parcialmente ocultas. En una prueba específica donde las manos fueron completamente enmascaradas de los datos, la precisión del sistema saltó de un pobre 31 por ciento a un sólido 85 por ciento, demostrando que el método de entrenamiento funcionó. El sistema también corrió lo suficientemente rápido como para seguir el ritmo de una cámara de video estándar, procesando un cuadro completo en solo 25 milisegundos en una computadora montada en el robot, lo cual es lo suficientemente rápido para sentirse instantáneo para un observador humano.

Quizás el hallazgo más significativo es la capacidad del sistema para aprender después del despliegue. Los investigadores establecieron un proceso donde el robot marcaría los momentos en los que no estaba seguro y enviaría esos clips de video a una computadora más potente en la nube. Esa computadora potente etiquetaría el gesto, y el robot usaría esa nueva información para actualizar su propio cerebro. En una prueba donde el robot aprendió tres nuevos gestos —dar un pulgar arriba, un apretón de manos y un saludo militar—, aprendió con éxito sin olvidar los siete originales. El sistema mantuvo su alta precisión en los gestos antiguos mientras identificaba correctamente los nuevos aproximadamente dos tercios de las veces. Esto demuestra un camino a seguir donde los robots pueden expandir su vocabulario de señales sociales con el tiempo, adaptándose a nuevas situaciones sin necesidad de ser apagados y reentrenados desde cero.

Los investigadores también probaron el sistema en un robot real, una máquina humanoide llamada Unitree G1, interactuando con cinco personas nuevas que no formaban parte de los datos de entrenamiento. En 150 ensayos, el robot reconoció correctamente el gesto el 97 por ciento de las veces. Cuando el robot decidió actuar, eligió el comportamiento correcto —como acercarse o detenerse— el 98 por ciento de las veces. Las pocas veces que no actuó no fue porque cometiera un error, sino porque estaba siendo cauteloso; eligió esperar en lugar de arriesgarse a un movimiento erróneo. Este enfoque conservador es exactamente lo que los diseñadores pretendían para un robot en un espacio público. El estudio sugiere que, al combinar un modelo ligero y rápido con una estrategia de prioridad en la seguridad y un bucle de aprendizaje fuera de línea, podemos construir robots que no solo sean eficientes, sino también socialmente conscientes y adaptables a la naturaleza impredecible de la interacción humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →