← Últimos artículos
🤖 AI

Robust Motion Generation using Part-level Reliable Data from Videos

Este artículo aborda el desafío de las oclusiones y las capturas fuera de pantalla en los datos de movimiento basados en video mediante la propuesta de un modelo de autorregresión con máscara consciente de las partes que sea robusto y que aproveche únicamente información creíble a nivel de parte para generar movimientos humanos de alta calidad, acompañado de la introducción de un nuevo benchmark a gran escala llamado K700-M.

Autores originales: Boyuan Li, Sipeng Zheng, Bin Cao, Ruihua Song, Zongqing Lu

Publicado 2026-08-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Boyuan Li, Sipeng Zheng, Bin Cao, Ruihua Song, Zongqing Lu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar enseñarle a una computadora a mover a un humano digital simplemente leyendo una oración. Podrías escribir: "La persona está bailando", y esperar que la pantalla muestre una actuación fluida y realista. Este campo, conocido como generación de movimiento a partir de texto, ha logrado avances notables, pero se ha topado con un muro. Los mejores resultados hasta ahora provienen de entrenar a las computadoras con grabaciones especiales y de alta calidad de personas reales moviéndose, capturadas con sensores costosos en estudios controlados. Aunque estas grabaciones son perfectas, son escasas, limitadas en variedad y a menudo no captan las formas desordenadas y complejas en que las personas se mueven en el mundo real. Para romper esta barrera, los investigadores han recurrido a internet, con la esperanza de aprender de los miles de millones de videos ordinarios disponibles en línea. La idea es simple: si una computadora puede aprender de la vasta biblioteca de la web, podría comprender una gama mucho más amplia de acciones. Pero hay un inconveniente. Cuando una computadora intenta descifrar cómo se mueve una persona en un video común, a menudo no puede ver todo el cuerpo. Una persona puede estar parcialmente oculta por un árbol, cortada por el borde del encuadre de la cámara o bloqueada por otra persona. En estos momentos, la computadora tiene que adivinar dónde están las extremidades faltantes.

Esta suposición crea un problema fundamental para el aprendizaje. Si se le muestra a una computadora un video donde solo es visible la parte superior del cuerpo, y se la obliga a aprender de una suposición de cuerpo completo que incluye piernas invisibles, podría aprender cosas erróneas. Podría empezar a creer que las piernas invisibles son evidencia real, en lugar de ser solo una suposición. Durante mucho tiempo, los investigadores enfrentaron una elección difícil: o descartar cada clip de video que no fuera perfectamente claro, perdiendo la mayor parte de los datos, o mantener todos los clips y esperar que la computadora pudiera ignorar las malas suposiciones. Ambos enfoques tenían fallas graves. Descartar los clips significaba perder información valiosa sobre movimientos específicos, como la forma en que una persona mueve sus brazos mientras está sentada. Mantener todo significaba enseñar a la computadora con información falsa. Un equipo de investigadores ha encontrado una forma de resolver esto cambiando la manera en que la computadora observa los datos. En lugar de tratar todo el clip de video como bueno o malo, le enseñaron a la computadora a observar el cuerpo parte por parte.

Los investigadores desarrollaron un nuevo sistema que actúa como un editor cuidadoso. Cuando el sistema analiza un video, primero verifica qué partes del cuerpo son realmente visibles y cuáles están ocultas. Si las piernas de una persona están bloqueadas por una mesa, el sistema sabe que debe confiar en el movimiento de los brazos y el torso, pero ignorar la suposición de la computadora sobre las piernas. Trata las partes visibles como hechos sólidos y las partes ocultas como espacios en blanco para ser llenos más tarde. Este enfoque permite que el sistema aprenda de miles de videos que antes se consideraban demasiado desordenados para ser utilizados. Al enfocarse solo en las partes del cuerpo que la cámara realmente ve, el sistema construye una comprensión confiable del movimiento sin confundirse por sus propias suposiciones. Es como aprender a reconocer un pájaro estudiando solo las alas cuando la cola está oculta, en lugar de intentar memorizar un dibujo de todo el pájaro que incluye una cola inventada.

Para probar esta idea, el equipo creó una nueva y masiva colección de datos de internet, que contiene casi doscientas mil parejas de clips de video y descripciones de texto. Analizaron estos clips y descubrieron que en más de tres cuartas partes de los fotogramas, al menos una parte del cuerpo no era completamente visible. Esto confirmó que el problema de la información faltante no es raro; es la norma en los videos de la web. Utilizando este conjunto de datos, entrenaron su nuevo sistema y lo compararon con métodos anteriores que o bien descartaban los clips desordenados o intentaban aprender de todos ellos sin filtrar. Los resultados fueron claros. El nuevo sistema, que presta atención a qué partes son visibles, produjo movimientos mucho más precisos y realistas que los métodos anteriores. Fue capaz de generar movimientos que no solo eran más fieles a la descripción de texto, sino también más fluidos y naturales.

El estudio demostró que mantener los clips desordenados y enseñar a la computadora a ignorar las partes invisibles era mucho mejor que descartar los clips. Cuando los investigadores probaron su sistema en un gran grupo de doscientas mil clips, superó significativamente a los mejores métodos existentes. Los métodos antiguos que mantenían todos los datos cometían muchos errores porque intentaban aprender de las partes invisibles, mientras que los métodos que descartaban los datos malos perdían demasiada variedad. El nuevo sistema logró mantener la variedad del gran conjunto de datos mientras evitaba los errores. Aprendió que una persona sentada y tocando la batería podría tener las piernas ocultas, pero sus movimientos de brazos siguen siendo reales y útiles para aprender. Al enfocarse en las partes confiables, el sistema podía armar una imagen completa del movimiento sin dejarse confundir por las piezas faltantes.

Este trabajo sugiere una nueva forma de enseñar a las computadoras sobre el mundo físico utilizando datos imperfectos. Muestra que no necesitamos grabaciones perfectas de calidad de estudio para enseñar a una máquina cómo moverse. En cambio, podemos usar la vasta y desordenada colección de videos de internet si enseñamos a la máquina a ser inteligente sobre aquello en lo que confía. El sistema no necesita ver todo el cuerpo para aprender cómo se mueve una persona; solo necesita ver suficiente parte del cuerpo para entender la acción. Este enfoque abre la puerta a entrenar sistemas mucho más grandes y capaces en el futuro, capaces de comprender una gama más amplia de comportamientos humanos que nunca antes. Los investigadores descubrieron que, al respetar los límites de lo que la cámara puede ver, la computadora puede aprender más, no menos. Este cambio de estrategia, de exigir datos perfectos a aprender de la evidencia parcial, marca un paso significativo hacia adelante en la enseñanza de la comprensión del movimiento humano por parte de las máquinas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →