← Últimos artículos
⚡ electrical engineering

Ground-JEPA: Learning Physically Grounded Latent World Models for Zero-Shot Dynamics Generalization of Legged Robots

Ground-JEPA introduce un modelo de mundo latente mínimo y fundamentado en la física que logra una generalización de la dinámica de cero disparos (zero-shot) y un rendimiento de control superior para robots con patas en entornos de altos grados de libertad sin depender de recompensas específicas de la tarea, desafiando así el supuesto de que el aprendizaje libre de recompensas es inherentemente inferior para sistemas robóticos complejos.

Autores originales: Yu-Xiang Wu, Yuyan Wu

Publicado 2026-07-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yu-Xiang Wu, Yuyan Wu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El compás interno del robot

Imagina intentar enseñarle a un robot a caminar a través de un campo rocoso. Podrías darle un conjunto estricto de reglas, como "levanta el pie exactamente 10 centímetros", pero el mundo real es caótico; las rocas se desplazan, el suelo es resbaladizo y las piernas del robot podrían ser ligeramente más pesadas de lo esperado. Este es el desafío del control de robots con patas: lograr que las máquinas se muevan de forma fluida y segura en entornos impredecibles. Durante mucho tiempo, los científicos han intentado resolver esto construyendo "modelos de dinámica", esencialmente un mapa mental dentro del robot que predice qué sucederá después si se mueve de cierta manera.

Tradicionalmente, estos mapas mentales se construían recompensando al robot por hacer cosas buenas (como mantenerse erguido) y castigándolo por las malas (como caerse). Esto se llama aprendizaje basado en recompensas. Sin embargo, hay un inconveniente: si el robot comete un error minúsculo en su predicción, ese error puede acumularse con el tiempo, como una bola de nieve rodando por una colina, hasta que el mapa mental del robot sea completamente erróneo y este se estrelle. Otro enfoque, llamado Arquitecturas de Predicción de Incrustación Conjunta (JEPAs), intenta saltarse los detalles complicados del mundo real. En lugar de predecir exactamente dónde estará cada píxel de la cámara del robot, predice una versión comprimida de "resumen" o "latente" del futuro. Piensa en ello como un músico que predice la siguiente nota de una canción sintiendo el ritmo, en lugar de calcular la vibración exacta del aire. La gran pregunta que los científicos se han estado haciendo es: ¿Puede un robot aprender a caminar perfectamente comprendiendo solo este ritmo interno, sin necesidad de un maestro que le diga constantemente "buen trabajo" o "inténtalo de nuevo"?


Ground-JEPA: El robot que aprendió a caminar sintiendo el ritmo

Un equipo de investigadores ha presentado un nuevo sistema llamado Ground-JEPA, que sugiere que los robots podrían no necesitar elogios o castigos constantes para aprender movimientos complejos. En su lugar, pueden aprender simplemente tratando de mantener su "sensación" interna del futuro consistente con la realidad.

Imagina a un robot aprendiendo a caminar no porque se le diga "no te caigas", sino tratando de asegurar que su sentido interno de "hacia dónde voy" coinca con su movimiento real. En este nuevo sistema, el robot no intenta reconstruir un video perfecto del futuro. En su lugar, comprime su experiencia en un "espacio latente" diminuto y eficiente: una especie de taquigrafía mental abstracta. El truco central aquí es una sonda inspirada en la física. Aunque el mapa interno del robot es abstracto, esta sonda actúa como un traductor, convirtiendo esos pensamientos abstractos de nuevo en la física del mundo real como posición, velocidad y orientación. Es como tener un robot que piensa en conceptos puros, pero tiene un traductor integrado que asegura que esos conceptos sigan obedeciendo las leyes de la gravedad y el momento.

Los investigadores descubrieron que el secreto para que esto funcionara no era solo la traducción, sino el horizonte de planificación. Los intentos anteriores fallaron porque el robot solo miraba unos pocos pasos adelante, como intentar caminar mirando únicamente tus propios dedos de los pies. El sistema Ground-JEPA obliga al robot a mirar mucho más allá, específicamente 12 pasos hacia el futuro. Esto es crucial porque un ciclo completo de caminata (una marcha) dura aproximadamente eso. Al observar el ciclo completo, el robot puede ver el "panorama general" de su movimiento, en lugar de solo optimizar el siguiente paso diminuto. Esto permite al sistema aprender patrones de marcha estables puramente mediante la auto-supervisión, lo que significa que aprende verificando si sus predicciones internas son consistentes, sin necesidad de recompensas externas.

Los resultados de sus simulaciones son bastante sorprendentes. En un robot cuadrúpedo simulado, este sistema libre de recompensas alcanzó una puntuación de desempeño de 510 ± 68, que fue de hecho mejor que el sistema tradicional basado en recompensas, que obtuvo 450 ± 234. Aún más impresionante, lograron aplicar esto con éxito a un robot humanoide simulado (un robot con un cuerpo similar al humano) por primera vez, logrando una puntuación de 350 ± 50 sin ninguna señal de recompensa. El método tradicional falló por completo en el humanoide en esta configuración.

Uno de los hallazgos más emocionantes es qué tan bien maneja este sistema los cambios "extremos". Los investigadores probaron al robot en escenarios donde la física se alteró drásticamente: la masa del robot cambió en un ±30%, la fricción del suelo se multiplicó por 2.5 o se redujo a 0.4, y hubo un retraso de 50 ms en los motores. En un escenario compuesto donde todos estos cambios ocurrieron a la vez, el modelo Ground-JEPA mantuvo el 78% de su desempeño original. En contraste, un modelo tradicional basado en recompensas, incluso cuando se entrenó con variaciones aleatorias, solo mantuvo el 21% de su desempeño. Esto sugiere que, al aprender el "manifold" o la forma fundamental del movimiento, el robot se vuelve mucho más robusto a los cambios en el mundo.

El equipo también descubrió que el tamaño del modelo no necesitaba ser masivo. Todo este sistema se ejecuta en una GPU de una computadora portátil y utiliza solo alrededor de 1.3 millones de parámetros, lo cual es diminuto comparado con otros modelos de IA masivos que requieren miles de millones de parámetros. Demostraron que el "colapso" (donde el robot deja de aprender) visto en estudios previos no se debía a que el método fuera defectuoso, sino a que el robot estaba usando el tipo de mapa interno incorrecto (específicamente, un mapa normalizado llamado SimNorm) y mirando demasiado lejos hacia adelante sin la estructura adecuada. Al usar representaciones latentes puras y el horizonte de planificación correcto, el sistema funciona maravillosamente.

Sin embargo, los autores advierten cuidadosamente que estos resultados se basan actualmente en simulaciones. Si bien el robot aprendió a caminar en un mundo virtual con cambios extremos, el sistema aún no ha sido probado en un robot físico en el mundo real. Además, aunque resolvieron el problema de un humanoide manteniéndose quieto, lograr que un humanoide camine dinámicamente sobre dos piernas sigue siendo un desafío debido a la compleja física de mantener el equilibrio sobre un pie.

En última instancia, Ground-JEPA sugiere un nuevo camino para la robótica: en lugar de pasar meses diseñando funciones de recompensa perfectas para enseñar a un robot a caminar, podríamos simplemente enseñarle a mantener su ritmo interno consistente con las leyes de la física. Esto podría democratizar el control robótico avanzado, permitiendo que laboratorios más pequeños con computadoras portátiles estándar construyan robots que puedan adaptarse al mundo real sin necesidad de supercomputadoras masivas o un sinfín de ensayos y errores de recompensa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →