← Últimos artículos
🤖 machine learning

RoboTTT: Context Scaling for Robot Policies

El artículo presenta RoboTTT, un marco de política robótica que integra el Entrenamiento en Tiempo de Prueba para escalar el contexto visuomotor a 8.000 pasos de tiempo, permitiendo la imitación de un solo disparo, la mejora sobre la marcha y un rendimiento significativamente superior en tareas de largo horizonte mediante la compresión del historial en pesos rápidos sin aumentar la latencia de inferencia.

Autores originales: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los robots son como chefs increíblemente talentosos pero con visión de corto alcance. Pueden picar una zanahoria o dar la vuelta a una hamburguesa perfectamente si les dices exactamente qué hacer ahora mismo, pero si les pides que horneen un pastel complejo desde cero, a menudo olvidan el primer paso para cuando llegan al segundo. Este es el estado actual de los "modelos fundacionales de robots": los cerebros inteligentes detrás de los robots modernos. Por lo general, solo miran lo último que vieron antes de realizar un movimiento, como intentar navegar por un laberinto mirando solo el suelo directamente debajo de tus pies. Si bien esto funciona para tareas sencillas, falla estrepitosamente cuando un robot necesita recordar una secuencia larga de eventos, como ensamblar un coche de juguete o reparar una placa de circuito, especialmente si algo inesperado ocurre en el camino. Los científicos se han preguntado durante mucho tiempo: ¿qué pasaría si un robot pudiera recordar todo lo que acaba de hacer, no solo el último segundo, y usar esa memoria larga para aprender y adaptarse sobre la marcha?

Presentamos RoboTTT, un nuevo tipo de cerebro robótico desarrollado por investigadores de NVIDIA, Stanford y la Universidad de Texas en Austin. Piensa en RoboTTT no como un robot que simplemente "recuerda" una larga lista de pasos, sino como un robot que tiene un cuaderno mágico y de autoactualización. Mientras que los robots tradicionales tienen un cerebro estático que permanece igual una vez construido, RoboTTT tiene un sistema especial de "pesos rápidos". Imagina que cada vez que el robot ve algo nuevo o realiza un movimiento, escribe instantáneamente una pequeña nota en su cuaderno, cambiando su propio cableado interno lo justo para comprender mejor la situación actual. Esto sucede en tiempo real, incluso mientras el robot trabaja. Al escalar este "cuaderno" para que contenga una cantidad masiva de historia —hasta 8,000 pasos de tiempo (que son unos cinco minutos de acción continua a alta velocidad)—, RoboTTT desbloquea superpoderes que los robots anteriores ni siquiera podían soñar. Puede observar a un humano realizar una tarea una sola vez y copiarla perfectamente sin ningún entrenamiento previo en esa configuración específica. También puede corregir sus propios errores instantáneamente si un humano lo golpea o si se le cae una pieza, todo mediante la observación de su propio historial reciente para descubrir qué salió mal.

Los investigadores descubrieron que dotar a los robots de esta memoria de contexto largo no es solo una pequeña mejora; es un cambio de juego. En sus pruebas, RoboTTO fue capaz de completar una tarea de ensamblaje compleja de diez etapas que tomó cinco minutos para terminar—una tarea que ningún otro modelo de robot, incluso los mejores con memorias cortas, podría haber terminado jamás. Mientras que los robots estándar fallaron al no pasar los primeros pasos, RoboTTT tuvo éxito en 6 de cada 10 ensayos de imitación de un solo paso (copiando un video humano que nunca había visto antes) y se recuperó de golpes externos con una tasa de éxito del 83%, en comparación con solo el 53% del mejor robot de memoria corta. El artículo sugiere que simplemente hacer que la memoria del robot sea más larga es una nueva forma de hacerlos más inteligentes, mostrando mejoras constantes a medida que la memoria crecía de unos pocos segundos a más de cuatro minutos.

Uno de los trucos más geniales que ejecuta RoboTTT es algo llamado "Destilación DAgger". Imagina a un estudiante aprendiendo a montar en bicicleta. Si se cae, un padre podría atraparlo y guiarlo de nuevo por el camino. Un robot normal podría simplemente olvidar la caída e intentar montar de nuevo, cometiendo el mismo error. RoboTTT, sin embargo, trata la caída y la corrección como una sola historia. Aprende del error (la caída) observando la corrección (la ayuda del padre) y actualiza su "cuaderno" interno para recordar: "Cuando me inclino de esta manera, necesito girar de aquella otra". Esto le permite mejorar su propio rendimiento sobre la marcha, sin necesidad de que un humano le enseñe de nuevo. El estudio muestra que este método ayuda al robot a recuperarse de los errores un 36% mejor que los modelos que no utilizan esta técnica.

El artículo también descarta algunas ideas comunes sobre cómo solucionar la memoria de los robots. Por ejemplo, pegar simplemente una larga lista de imágenes pasadas en el cerebro del robot (como una transmisión de video larga) no funciona bien; de hecho, confunde al robot y hace que su rendimiento empeore. Del mismo modo, usar una memoria "recurrente" estándar (como un bucle simple que actualiza un estado) no es suficiente. Los investigadores descubrieron que la clave es la forma en que la memoria se actualiza: necesita ser un sistema flexible y no lineal que cambie sus propios parámetros utilizando un proceso similar a cómo los humanos aprenden de la experiencia (descenso de gradiente), en lugar de simplemente desplazar un estado estático.

Al final, RoboTTT sugiere que el futuro de la inteligencia robótica podría no tratarse solo de hacer el cerebro del robot más grande o más inteligente en un sentido estático, sino de darle la capacidad de aprender y adaptarse continuamente mientras trabaja. Al escalar el contexto a 8,000 pasos de tiempo, los investigadores demostraron que los robots pueden volverse mucho más robustos, capaces de manejar tareas largas y complejas, e incluso aprender de una sola demostración humana. Aunque el artículo señala que entrenar estos modelos es costoso y que todavía no pueden manejar cada posible fallo, los resultados sugieren fuertemente que el "contexto largo" es un nuevo y poderoso eje para escalar la inteligencia robótica, convirtiendo máquinas torpes y con visión corta en solucionadores de problemas adaptables y a largo plazo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →