← Últimos artículos
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

Este artículo presenta OneTwoVLA, un modelo unificado de visión, lenguaje y acción que mejora la capacidad de los robots para realizar tareas complejas mediante la adaptación dinámica entre razonamiento explícito y ejecución de acciones, potenciada por un pipeline escalable de datos de razonamiento corporativo.

Autores originales: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Publicado 2026-03-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que quieres enseñarle a un robot a cocinar una cena compleja o a preparar un cóctel perfecto. Antes, los robots eran como obreros muy rápidos pero un poco torpes: podían agarrar cosas y moverlas, pero si algo salía mal (se les caía un ingrediente o no entendían una orden confusa), se quedaban bloqueados o seguían haciendo lo mismo sin pensar.

Este paper presenta a OneTwoVLA, un robot con una nueva "mente" que combina dos cosas que los humanos hacemos naturalmente: pensar y actuar.

Aquí tienes la explicación sencilla, usando analogías de la vida diaria:

1. El Problema: El "Jefe" y el "Obrero" que no se entienden

Antes, los robots usaban un sistema de dos partes (como un jefe y un obrero):

  • El Jefe (Sistema 2): Era un cerebro muy inteligente (como un chatbot avanzado) que pensaba mucho tiempo, leía la receta y daba instrucciones detalladas. Pero era lento y a veces le decía al obrero cosas que este no podía hacer (como "agarrar el objeto invisible").
  • El Obrero (Sistema 1): Era el robot físico, muy rápido para moverse, pero tonto. Solo hacía lo que le decían, sin entender el contexto. Si el jefe tardaba en responder, el obrero se quedaba esperando o hacía cosas obsoletas.

El resultado: El robot era lento, se confundía y no podía recuperarse si se equivocaba.

2. La Solución: OneTwoVLA (El "Cocinero Maestro")

OneTwoVLA es un único robot que tiene la capacidad de ser tanto el Jefe como el Obrero al mismo tiempo. Imagina a un chef experto que cocina con las manos (actúa) pero que, de repente, se detiene a pensar en voz alta si algo no va bien.

  • ¿Cómo funciona?
    • Modo "Actuar" (Rápido): La mayoría del tiempo, el robot simplemente hace lo que tiene que hacer: agarrar, mover, verter. Es rápido y eficiente.
    • Modo "Pensar" (Lento): Solo se detiene en momentos críticos. Por ejemplo:
      • Cuando termina una tarea (ej. "Ya puse el aceite").
      • Cuando ve un error (ej. "¡Oh, se me cayó el huevo!").
      • Cuando un humano le habla (ej. "Cambia el vodka por limón").
    • En esos momentos, el robot "piensa" en voz alta: "Veo que el huevo se cayó. Mi plan original era romperlo en la sartén, pero ahora necesito limpiar el suelo y coger otro huevo". Luego, vuelve a actuar basándose en ese nuevo pensamiento.

3. El Secreto: "Entrenamiento con Libros de Recetas"

Para que este robot sea tan inteligente, los autores no solo le enseñaron con videos de robots reales (que son caros y difíciles de conseguir). Crearon una fábrica de datos sintéticos.

  • La Analogía: Imagina que quieres aprender a cocinar. En lugar de solo practicar en una cocina real (que es lento), también lees miles de libros de cocina, ves videos de chefs y practicas en una cocina virtual.
  • Lo que hicieron: Usaron inteligencia artificial para crear miles de imágenes de mesas con objetos (como si fueran fotos de un videojuego) y le pidieron a otra IA que escribiera "recetas" y "razonamientos" para esas imágenes.
    • Ejemplo: "Veo una mesa con una manzana y una pera. Si el usuario dice 'dame la fruta roja', debo pensar: 'La manzana es roja, la pera es verde. Voy a agarrar la manzana'".
  • Al entrenar al robot con estos "libros de recetas virtuales" y datos reales, aprendió a entender el mundo mucho mejor, incluso con objetos que nunca había visto antes.

4. ¿Qué puede hacer este robot ahora?

Gracias a esta mezcla de pensar y actuar, OneTwoVLA logra cosas increíbles:

  • Planificación a largo plazo: Puede hacer una comida completa (como un hotpot o un cóctel) siguiendo una secuencia de pasos compleja sin perderse.
  • Recuperación de errores: Si se le cae un ingrediente, no se rinde. Se detiene, piensa: "Se me cayó, debo recogerlo y limpiar", y lo hace.
  • Interacción natural: Si le dices "No quiero naranja, quiero limón", el robot entiende el cambio, deja lo que estaba haciendo y ajusta su plan al instante.
  • Entender lo que no está en su "memoria": Si le pides "dame el objeto para leer", y ve un libro y unas gafas, puede entender que las gafas sirven para leer (o el libro, según el contexto), incluso si nunca entrenó con esas gafas específicas.

En resumen

OneTwoVLA es como darle a un robot un cerebro humano: no solo mueve sus brazos mecánicamente, sino que piensa, se detiene a reflexionar cuando es necesario y se adapta a los imprevistos. Es el paso de tener un "brazo robótico" a tener un "asistente robótico inteligente" que puede cocinar, limpiar y conversar contigo de forma natural.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →