← Últimos artículos
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA introduce un marco unificado que integra la navegación y la manipulación en una única arquitectura con un cabezal de acción compartido y una estrategia de entrenamiento progresivo de múltiples etapas, logrando un rendimiento de vanguardia tanto en entornos simulados como en el mundo real para avanzar en el desarrollo de agentes robóticos de propósito general.

Autores originales: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Publicado 2026-06-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico. Hasta ahora, construir este robot era como contratar a dos especialistas distintos: una persona que es experta en caminar (navegación) pero pésima usando sus manos, y otra persona que es una maestra chef (manipulación) pero que no puede caminar a través de la habitación para buscar ingredientes. Si querías que el robot "caminara hacia la cocina y pusiera una taza en el microondas", tenías que cambiar entre estos dos "cerebros" o modelos diferentes.

El artículo presenta OneVLA, que es como contratar a un empleado "Navaja Suiza" que es naturalmente bueno tanto para caminar como para usar sus manos, todo dentro de un mismo cerebro.

Aquí hay un desglose sencillo de cómo lo hicieron:

1. El "Control Remoto Universal" (Cabezal de Acción Unificado)

La mayoría de los robots tienen diferentes "controles remotos" para diferentes trabajos. Un control remoto tiene botones para avanzar o girar a la izquierda. Otro control remoto tiene deslizadores para mover un brazo robótico hacia arriba, hacia abajo o girarlo.

OneVLA crea un único control remoto universal.

  • Combina los botones para caminar y los deslizadores para el brazo en una sola tira larga de controles.
  • Cuando el robot recibe una instrucción como "Ve a la puerta", solo presiona los "botones de caminar" de la tira.
  • Cuando la instrucción es "Recoge la taza", solo mueve los "deslizadores del brazo".
  • La Magia: El robot no necesita cambiar su cerebro o su control remoto. Simplemente sabe qué parte del control remoto usar según la tarea.

2. El "Campamento de Entrenamiento de Tres Pasos" (Estrategia Multietapa)

No puedes simplemente lanzar a un robot a un mundo complejo y esperar que lo sepa todo inmediatamente. Los autores entrenaron a OneVLA en tres fases específicas, como un estudiante progresando a través de la escuela:

  • Etapa 1: Aprender a usar las manos. Primero, le enseñaron al robot cómo agarrar, levantar y colocar objetos usando un brazo robótico. También le enseñaron a mirar imágenes y describirlas (para que entienda el mundo).
  • Etapa 2: Aprender a caminar. Después, añadieron datos de navegación. Ahora el robot aprende cómo moverse del punto A al punto B. Debido a que ya sabe "ver" y "pensar" de la Etapa 1, aprende a caminar más rápido y de forma más inteligente.
  • Etapa 3: Aprender a pensar en voz alta (Cadena de Pensamiento). Finalmente, le enseñaron al robot a "explicar su proceso de pensamiento". Antes de moverse, se dice a sí mismo: "Estoy en el pasillo. Necesito girar a la derecha para llegar a la cocina". Este paso ayuda al robot a conectar los puntos entre lo que ve, lo que necesita hacer y cómo moverse.

3. El Resultado: Dos Habilidades, Un Cerebro

El artículo afirma que, al entrenar estas dos habilidades juntas, estas en realidad se ayudan mutuamente a mejorar.

  • La Analogía: Piensa en un jugador de baloncesto que también juega al fútbol. Aprender a botar un balón de baloncesto (manipulación) podría mejorar su juego de pies y equilibrio, lo que le ayuda a correr mejor en el campo de fútbol (navegación).
  • La Prueba: En las pruebas, este robot único (OneVLA) superó a los robots que estaban especializados solo en caminar o solo en usar las manos. También fue mejor que otros robots "híbridos" que intentaban hacer ambas cosas pero que aún requerían "modos" o configuraciones separadas para cada tarea.

En Resumen

OneVLA es un nuevo tipo de cerebro robótico que no necesita ser reprogramado cuando le pides que camine o cuando le pides que agarre algo. Utiliza un sistema unificado para entender el lenguaje, ver el mundo y controlar tanto sus pies como sus manos. Los autores demuestran que enseñar estas habilidades juntas hace que el robot sea más inteligente en ambas que si se enseñaran por separado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →