← Últimos artículos
💻 computer science

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

Este artículo presenta un modelo de mundo centrado en el humano en tiempo real que sintetiza interacciones coherentes de la parte superior del cuerpo combinando una representación implícita multiescala unificada para el movimiento humano continuo con estados discretos codificados por lenguaje para un control preciso del contacto con objetos, logrando una inferencia de 25 FPS en GPUs H100.

Autores originales: Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

Publicado 2026-07-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película donde el personaje principal puede estirar la mano, agarrar una taza de café, dar un sorbo y dejarla en su lugar, todo esto mientras habla contigo. Durante mucho tiempo, los científicos de la computación han sido excelentes haciendo que el cuerpo del personaje se mueva de forma realista, pero a menudo han tenido dificultades con la parte de "agarrar". A veces, la mano atravesaba la taza como un fantasma, o la taza cambiaba mágicamente de forma al ser tocada. Este es el desafío de la "interacción humano-objeto": enseñar a una computadora no solo cómo se mueve una persona, sino cómo toca físicamente y cambia el mundo que la rodea.

Para lograr esto, los investigadores suelen confiar en dos herramientas principales. Primero, la generación de video, que es como un artista digital que puede pintar imágenes en movimiento basadas en una descripción. Segundo, el modelado del mundo, que es una forma elegante de decir que una computadora intenta predecir cómo cambia una escena a lo largo del tiempo. La gran pregunta ha sido: ¿Podemos combinar esto para crear un personaje que no solo baile en el lugar, sino que realmente interactúe con objetos en tiempo real, como un personaje de un videojuego que se siente lo suficientemente real como para ser tocado?

Esto es exactamente en lo que un equipo de investigadores de Tongyi Lab ha estado trabajando. Construyeron un nuevo sistema que actúa como un "modelo de mundo centrado en el humano en tiempo real". Piensa en esto como un titiritero digital que no solo controla las extremidades del títere, sino que también decide si el títere sostiene un martillo o si solo está agitando la mano en el aire. Su objetivo era crear un sistema que pudiera tomar un video en vivo de una persona, una imagen de un objeto (como una taza) y un comando simple (como "agarrar" o "sin contacto"), y generar instantáneamente un video donde la persona interactúa con ese objeto perfectamente.

El equipo descubrió que, al dividir el control en dos partes distintas, podían resolver este problema mucho mejor que los métodos anteriores. La primera parte es el estado humano continuo, que maneja los movimientos fluidos y suaves del cuerpo, las manos y el rostro. Imagina esto como la mano del titiritero guiando los músculos del títere. La segunda parte es el estado de interacción discreto, que es como un interruptor simple que le dice al sistema: "¿Está la mano tocando el objeto ahora mismo?" o "¿Lo está sosteniendo?". Al usar un comando específico y corto para este interruptor (como las palabras "agarrar" o "sin contacto") en lugar de una oración larga y complicada, la computadora puede cambiar entre estos estados de forma instantánea y precisa.

El resultado es un sistema capaz de generar estas interacciones a una velocidad de 25 fotogramas por segundo con un retraso de solo unos 1000 milisegundos. Esto significa que es lo suficientemente rápido como para sentirse como una conversación en vivo o un videojuego en tiempo real. Los investigadores demostraron que su método crea movimientos de manos más realistas y un mejor contacto con los objetos en comparación con los sistemas antiguos, que a menudo producían fallos extraños como objetos flotantes o manos que no llegaban a cerrarse alrededor de lo que debían sujetar. También crearon un conjunto de datos especial de más de 30,000 ejemplos para enseñar a su sistema cómo deberían verse estas interacciones. Aunque no han afirmado que esto resuelva todos los problemas del universo, sus experimentos sugieren que este enfoque "continuo-discreto" es un paso significativo hacia la creación de humanos digitales que realmente puedan interactuar con su mundo en tiempo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →