← Últimos artículos
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBe es un marco de trabajo de post-entrenamiento y eficiencia de parámetros que adapta rastreadores de movimiento para el control de cuerpo completo humanoide perceptivo mediante el injerto de retroalimentación visual relevante para la tarea vía adaptadores de bajo rango, permitiendo una transferencia robusta de simulación a realidad de cero disparos a través de diversas tareas de locomoción y manipulación.

Autores originales: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Publicado 2026-09-10
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que caminan y se mueven como los humanos han sido durante mucho tiempo un objetivo de la ingeniería, pero enseñarles a hacerlo en el mundo real es un rompecabezas de dos partes distintas. Primero, está la capacidad de imitar el movimiento humano, una habilidad que los investigadores han dominado al entrenar a las máquinas para copiar vastas bibliotecas de datos de movimiento humano. Estos "rastreadores" son excelentes siguiendo un guion, moviendo sus extremidades de manera natural y fluida sobre un terreno plano y predecible. Sin embargo, están diseñados intencionalmente para ser ciegos a su entorno; no ven un bordillo, una pelota o una caja. Segundo, está la capacidad de percibir el mundo y reaccionar ante él. Tradicionalmente, los ingenieros han resuelto esto construyendo un sistema separado que actúa como un planificador: observa el entorno, decide qué debe hacer el robot y luego le dice al rastreador ciego que ejecute ese plan. Esta separación funciona, pero crea una brecha. El rastreador no puede realizar ajustes pequeños e instantáneos, como desplazar un pie para evitar una piedra o esquivar un objeto entrante, porque está esperando instrucciones de arriba. Carece de los reflejos visuales que permiten a un humano tropezar y recuperarse sin pensar.

Un equipo de investigadores de la Universidad del Sur de California ha desarrollado una nueva forma de cerrar esta brecha, permitiendo que un robot vea y reaccione directamente mientras se mueve. Llaman a su sistema ViBe, un método que toma un robot ya entrenado para caminar como un humano y le otorga la capacidad de adaptar sus movimientos basándose en lo que ve, sin tener que reaprender a caminar desde cero. En lugar de construir un nuevo cerebro o un nuevo planificador, insertaron una interfaz pequeña y eficiente entre los ojos y los músculos del robot. Esta interfaz aprende a seleccionar los detalles visuales específicos que importan para una tarea —como el borde de un bordillo o la posición de una pelota— y alimenta esa información directamente en el sistema de movimiento del robot. El resultado es una máquina que puede realizar tareas complejas y dinámicas en el mundo real, como correr parkour sobre terreno irregular, esquivar una pelota lanzada o reorientar un cubo en su mano, todo ello manteniendo el movimiento natural y humano que se le enseñó originalmente.

Los investigadores comenzaron con un robot que ya había aprendido a rastrear el movimiento humano perfectamente en terreno plano. Este robot era "ciego" en el sentido de que no utilizaba imágenes de cámara para guiar sus pasos; simplemente seguía una secuencia de movimientos preestablecida. Para darle visión, el equipo adjuntó un sistema visual preentrenado, uno que ya había aprendido a reconocer objetos y escenas a partir de millones de imágenes. Sin embargo, mostrarle al robot una transmisión de cámara no era suficiente; el robot necesitaba saber qué partes de la imagen eran importantes. Una pared de píxeles contiene demasiada información, y la mayor parte de ella es irrelevante para la tarea de caminar o esquivar. El equipo diseñó un módulo pequeño, un extractor, que actúa como un filtro. Observa la posición corporal actual del robot y la tarea que intenta realizar, y luego utiliza ese contexto para escanear la imagen de la cámara y seleccionar solo las pistas visuales más útiles. Si el robot intenta saltar sobre un bordillo, el extractor se enfoca en el borde del bordillo. Si intenta atrapar una pelota, se enfoca en la trayectoria de la pelota.

Esta información visual seleccionada se inyecta luego en el sistema de movimiento del robot mediante una técnica que cambia solo una fracción mínima de los ajustes internos del robot. Los investigadores mantuvieron el rastreador de movimiento original congelado, preservando su marcha natural y humana, y solo ajustaron las pequeñas vías que transportaban los nuevos datos visuales. Este enfoque les permitió entrenar al robot para tareas específicas utilizando un método llamado aprendizaje por refuerzo, donde el robot aprende mediante ensayo y error, recibiendo recompensas por acciones exitosas. Probaron este sistema en cuatro desafíos muy diferentes. En uno, el robot tenía que caminar y correr sobre bordillos y terrenos irregulares, ajustando la colocación de sus pies en tiempo real para evitar tropezar. En otro, tenía que realizar parkour, saltando a través de huecos y aterrizando en superficies estrechas. Una tercera tarea implicaba mover objetos grandes, donde el robot tenía que ajustar su equilibrio y agarre mientras transportaba una maleta o un cubo de basura. El desafío final fue el dodgeball (balón prisionero), donde el robot tenía que permanecer quieto, observar una pelota que volaba hacia él y mover su cuerpo para esquivarla sin caerse.

Los resultados mostraron que este método funcionó notablemente bien. Al probarse en el mundo real, el robot realizó estas tareas con un alto grado de éxito, igualando a menudo el rendimiento de sistemas que recibieron información privilegiada perfecta sobre el entorno que los robots reales no pueden tener. Por ejemplo, en la tarea de parkour, el robot navegó con éxito obstáculos que causaron que una versión ciega del mismo robot chocara y cayera. En el escenario de dodgeball, el robot aprendió a esquivar la pelota mientras mantenía su equilibrio, una hazaña que requería que se desviara de su postura de pie estándar de una manera controlada y reactiva. Los investigadores también descubrieron que el sistema era robusto; funcionaba bien incluso cuando la iluminación cambiaba de luz solar brillante a condiciones interiores tenues, o cuando los colores de los objetos variaban. Esto sugiere que el robot aprendió a entender la forma y la posición de las cosas en lugar de simplemente memorizar colores o texturas específicos.

Para demostrar que el robot estaba realmente reaccionando a lo que veía, los investigadores compararon su sistema con una versión que no podía ver. El robot ciego, incluso con el mismo entrenamiento de movimiento subyacente, falló al atravesar bordillos o evitar obstáculos, a menudo desviándose de su curso o colisionando con objetos. La versión con visión, sin embargo, realizó correcciones precisas y locales en su movimiento. Ajustó la colocación de su pie para aterrizar en un bordillo, desplazó su peso para cargar un objeto pesado y movió su cuerpo para evitar una pelota. Estas no fueron maniobras grandes y preplanificadas, sino pequeños ajustes inmediatos que ocurrían mientras el robot se movía. El equipo también demostró que esta adaptación visual podía combinarse con un planificador simple de alto nivel. En una tarea en la que el robot tenía que reorientar un cubo para que una cara de color específico quedara en la parte superior, un planificador muy básico simplemente elegía una secuencia de movimientos. El sistema visual del robot se encargaba entonces del trabajo difícil de encontrar el cubo, agarrarlo y ajustar su agarre para que el movimiento fuera exitoso, incluso si el cubo estaba en una posición ligeramente distinta a la esperada.

El estudio destaca un cambio significativo en cómo se puede enseñar a los robots a interactuar con el mundo. En lugar de entrenar a un robot desde cero para cada nueva tarea, o depender de sistemas de planificación complejos y separados, es posible tomar un robot que ya sabe cómo moverse y darle la capacidad de ver y reaccionar. Los investigadores demostraron que, al mantener intactas las habilidades de movimiento centrales y solo entrenar la pequeña conexión entre la visión y la acción, podían crear un robot que es tanto natural en su movimiento como capaz de manejar la imprevisibilidad del mundo real. Aunque el sistema no es perfecto y a veces puede confundirse por objetos que se mueven rápido o distracciones visuales inusuales, representa un paso adelante poderoso. Demuestra que un robot no necesita ser enseñado todo desde el principio; puede aprender a adaptar sus habilidades existentes a nuevas situaciones simplemente aprendiendo qué buscar. Este enfoque ofrece un camino práctico hacia la creación de humanoides que puedan moverse a través de nuestro mundo con la misma fluidez y adaptabilidad que esperamos de un humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →