VGGT-DP: Generalizable Robot Control via Vision Foundation Models
VGGT-DP es un marco de control robótico generalizable que mejora el rendimiento de la política visuomotriz integrando prioris geométricos de un modelo de percepción 3D preentrenado con retroalimentación propioceptiva, mientras emplea la reutilización de tokens por fotograma y la poda aleatoria de tokens para mejorar el anclaje espacial, la robustez y la eficiencia de la inferencia.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los robots han luchado durante mucho tiempo por moverse con la fluidez y confianza de una criatura viva. Durante décadas, los ingenieros programaron máquinas con reglas rígidas y escritas a mano, diciéndoles exactamente cómo mover sus brazos para cada situación posible. Este enfoque funcionaba en fábricas controladas, pero fallaba estrepitosamente cuando el mundo cambiaba aunque fuera ligeramente. En años recientes, un nuevo enfoque ha tomado fuerza: enseñar a los robots mostrándoles ejemplos, de forma muy similar a como un niño aprende observando a un padre. El robot observa a un humano realizar una tarea e intenta copiar los movimientos. Sin embargo, estos sistemas de aprendizaje a menudo carecen de una comprensión profunda del espacio. Pueden reconocer un objeto, pero frecuertemente fallan en comprender cómo ese objeto se asienta en el espacio tridimensional en relación con el propio cuerpo del robot. Esta brecha en la comprensión espacial limita la capacidad de un robot para manejar tareas complejas o adaptarse cuando el ángulo de la cámara cambia o el entorno se modifica.
Un equipo de investigadores ha desarrollado un nuevo sistema diseñado para cerrar esta brecha, inspirándose en cómo funciona la visión biológica. En la naturaleza, los animales no dependen de un solo sentido para navegar; combinan lo que ven con un sentido interno constante de la posición de su propio cuerpo, conocido como propiocepción. Esta retroalimentación interna permite a una mosca aterrizar sobre una hoja en movimiento o a un gato caminar por un saliente estrecho sin caerse. Los investigadores, liderados por Shijia Ge y colegas de la Universidad de Tsinghua y otras instituciones, crearon un marco llamado VGGT-DP que imita esta estrategia biológica. En lugar de depender de instrucciones lingüísticas o simples señales visuales, su sistema fusiona un potente modelo visual preentrenado con los sensores del estado interno del robot. Esta combinación permite al robot construir un mapa tridimensional robusto de su entorno y comprender exactamente dónde se encuentran sus propias extremidades dentro de ese espacio.
El núcleo de este nuevo sistema es un motor visual entrenado con cantidades masivas de datos de reconstrucción 3D. Mientras que los modelos de visión robótica estándar suelen estar diseñados para ser pequeños y rápidos, sacrificando detalle por velocidad, este sistema utiliza un modelo de gran escala capaz de predecir la profundidad, los ángulos de la cámara y la ubicación precisa de cada punto en una escena. Los investigadores descubrieron que, al utilizar este modelo visual de alto rendimiento, el robot ganaba un sentido de la geometría mucho más fuerte. Sin embargo, ejecutar un modelo tan grande en tiempo real es computacionalmente costoso y lento. Para resolver esto, el equipo inventó un truco ingenioso llamado reutilización de tokens por fotograma (frame-wise token reuse). En una transmisión de video típica, muchos fotogramas se solapan significativamente; el fondo y la mayoría de los objetos no camban de un milisegundo a otro. El nuevo sistema reconoce esto y deja de recalcular las características visuales de las partes de la imagen que no han cambiado. Solo procesa la nueva información que llega en el último fotograma, reutilizando los datos almacenados en caché de los momentos anteriores. Este enfoque redujo drásticamente el tiempo que el robot tarda en "pensar", haciendo que el potente modelo visual sea práctico para el uso en el mundo real.
Para asegurar que la visión del robot coincidiera con su realidad física, los investigadores añadieron una capa de supervisión interna. Enseñaron al sistema visual a predecir los ángulos de las articulaciones y la posición de la mano del robot basándose únicamente en lo que veía. Si los ojos del robot veían una mano alcanzando una taza, el sistema debía ser capaz de adivinar correctamente dónde se encontraba esa mano en el espacio. Esto obligó al modelo visual a alinearse perfectamente con el estado interno del robot, creando un bucle de retroalimentación estrecho. La pieza final del rompecabezas involucró un método llamado poda de tokens aleatorios (random token pruning), donde el sistema ignora intencionalmente partes pequeñas y aleatorias de los datos visuales durante el entrenamiento. Esta técnica actúa como una forma de prueba de estrés, obligando al robot a aprender la forma y estructura general de una escena en lugar de memorizar detalles específicos, lo que lo hace más resiliente a la información faltante o al ruido.
Al ser probado en un conjunto de tareas desafiantes que involucran manipulación, como recoger objetos de agujeros, barrer artículos hacia una cesta o tirar de un palo, el nuevo sistema mostró mejoras notables sobre los métodos existentes. En escenarios difíciles que requieren razonamiento espacial preciso, el nuevo enfoque logró tasas de éxito significativamente más altas que los modelos líderes anteriores. Por ejemplo, en una tarea que requiere que el robot recoja un objeto de un agujero profundo, el nuevo sistema tuvo éxito en el 55% de los intentos, mientras que el mejor método anterior (DP3) logró solo un 14%. El sistema también demostró ser altamente efectivo en tareas como barrer artículos hacia un montón, donde tuvo éxito el 44% de las veces en comparación con solo el 15% de su competidor más cercano. Estos resultados sugieren que dotar a los robots de una comprensión geométrica profunda del espacio es mucho más crítico para la manipulación compleja que simplemente añadir capacidades lingüísticas.
Sin embargo, los investigadores fueron cuidadosos al señalar dónde el sistema todavía presenta deficiencias. Aunque destacó en tareas que requieren un razonamiento espacial complejo, no siempre superó a los modelos más antiguos y simples en tareas muy básicas, como alcanzar un objeto cercano. En estos escenarios simples, el pesado modelo visual a veces introducía una complejidad innecesaria. Más significativamente, el sistema tuvo dificultades cuando el ángulo de la cámara cambiaba incluso ligeramente. Cuando los investigadores probaron el robot con la cámara rotada apenas cinco grados, la tasa de éxito cayó drásticamente de casi un 40% a casi cero. Esto indica que, si bien el sistema ha aprendido a entender el espacio 3D bien, aún no ha aprendido a ser lo suficientemente flexible para manejar puntos de vista que no estaban presentes en sus datos de entrenamiento. Los investigadores sugieren que el trabajo futuro debe centrarse en hacer que estas representaciones visuales sean más robustas a los cambios de perspectiva.
El estudio concluye que el camino hacia robots más capaces no reside en hacerlos más inteligentes mediante el lenguaje, sino en hacer que su visión esté más fundamentada en la realidad física. Al combinar un modelo visual de gran escala que entiende la geometría 3D con el sentido interno del propio cuerpo del robot, los investigadores crearon un sistema que puede navegar y manipular el mundo con un nivel de precisión previamente no visto en el aprendizaje por imitación. El trabajo demuestra que la clave para un control robótico generalizable es una comprensión espacial profunda del entorno, apoyada por una conciencia interna del propio estado del robot. Aunque persisten desafíos, particularmente en el manejo de cambios inesperados en los ángulos de la cámara, los hallazgos ofrecen una dirección clara para el futuro del control robótico: priorizar la fundamentación espacial y la inspiración biológica sobre la complejidad lingüística.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.