← Últimos artículos
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

Este artículo propone un método de consistencia de acción entre vistas que regulariza las políticas de Visión-Lenguaje-Acción basadas en flujo para lograr robustez frente a cambios en el punto de vista de la cámara de la escena utilizando únicamente imágenes RGB y propiocepción, mejorando significativamente el rendimiento tanto en tareas robóticas simuladas como en el mundo real sin requerir etiquetas de cámara ni entradas de profundidad.

Autores originales: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Publicado 2026-09-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que aprenden de las demostraciones humanas son cada vez más capaces, pero a menudo sufren una fragilidad peculiar: están ligados al punto de vista específico desde el cual fueron entrenados. Imagine un robot entrenado para recoger una taza mientras una cámara se encuentra en un estante sobre la mesa. Si esa cámara es golpeada, movida hacia un lado o elevada más alto, el robot puede fallar repentinamente, a pesar de que la taza, la mesa y el propio cuerpo del robot no se han movido en absoluto. Esto sucede porque el "cerebro" del robot, un tipo de inteligencia artificial que conecta lo que ve con lo que debe hacer, ha aprendido a reconocer la tarea basándose en el ángulo exacto de la cámara original. En el mundo real, las cámaras se golpean, los robots se mueven y la iluminación cambia, por lo que un sistema que no puede adaptarse a un cambio de punto de vista no es verdaderamente útil. Los investigadores han intentado resolver esto dotando a los robots de sensores más complejos, como cámaras de profundidad que ven en 3D, o enseñándoles a comprender la geometría de la habitación, pero estas soluciones suelen requerir hardware costoso o una calibración compleja que es difícil de mantener.

Un equipo de investigadores de la Universidad de Tsinghua y la Universidad de Ámsterdam ha encontrado una forma de hacer que las políticas robóticas sean robustas al movimiento de la cámara sin añadir nuevos sensores ni cambiar cómo opera el robot en el mundo real. Se centraron en un tipo específico de controlador robótico que aprende prediciendo un "flujo" de acciones, similar a cómo el agua fluye hacia un destino, en lugar de simplemente adivinar el siguiente movimiento. El núcleo de su descubrimiento es un método de entrenamiento que obliga al robot a estar de acuerdo consigo mismo. Crearon pares de imágenes de entrenamiento que muestran exactamente la misma escena física desde dos ángulos diferentes: uno desde la posición de la cámara original y otro desde una posición ligeramente desplazada. Crucialmente, se aseguraron de que se le indicara al robot que realizara exactamente la misma acción para ambas imágenes. Al entrenar al robot para que prediga el mismo flujo de movimiento para ambas vistas, le enseñaron a ignorar el cambio en la posición de la cámara y a concentrarse únicamente en la tarea en cuestión.

Los investigadores probaron esta idea en un entorno simulado utilizando un banco de pruebas llamado LIBERO-Plus, que está diseñado específicamente para ver qué tan bien manejan los robots los desplazamientos de cámara. Compararon su nuevo método con las técnicas de entrenamiento estándar. Cuando se movía la cámara, un robot entrenado con métodos estándar tenía éxito en solo un 17% de los intentos. Un robot entrenado en muchos ángulos de cámara diferentes sin su regla especial de consistencia mejoró a aproximadamente un 75% de éxito. Sin embargo, el robot entrenado con su nueva regla de consistencia entre vistas alcanzó una tasa de éxito del 87,2%. Esta mejora fue significativa y constante a través de diferentes puntos de partida aleatorios para el entrenamiento. Los investigadores también demostraron que el éxito dependía enteramente del hecho de que las dos imágenes mostraran el mismo estado físico. Cuando desordenaron los datos de entrenamiento para que el robot intentara emparejar una vista de una taza con una acción destinada a un estado diferente, el rendimiento colapsó hasta el 25,8%, demostrando que el robot no solo estaba suavizando sus respuestas, sino que realmente estaba aprendiendo a vincular diferentes vistas de la misma realidad con la misma acción.

Para asegurar que esto no fuera solo un resultado de la simulación por computadora, el equipo llevó su método a un brazo robótico real en un laboratorio. Recopilaron datos de entrenamiento utilizando tres cámaras sincronizadas que observaban la misma mesa, lo que les permitió crear los pares de vistas necesarios a partir del mundo real. Luego probaron el robot utilizando una sola cámara colocada en una posición que nunca había visto durante el entrenamiento. El robot entrenado con su nuevo método tuvo éxito en el 74,4% de estas pruebas de cámaras no vistas, mientras que el método estándar tuvo éxito en el 53,3%. La mejora fue más dramática en tareas difíciles, como retirar auriculares de un soporte, donde el método estándar falló completamente en las nuevas posiciones de la cámara, pero el nuevo método tuvo éxito en casi la mitad de los intentos. El estudio confirma que, al enseñar a un robot a ver la consistencia de sus propias acciones a través de diferentes ángulos, este puede volverse mucho más confiable en el mundo real, todo ello sin necesidad de cámaras adicionales, sensores de profundidad o mapas geométicos complejos. El robot simplemente aprende que la tarea sigue siendo la misma, incluso si la imagen cambia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →