← Últimos artículos
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA es un modelo de Visión-Lenguaje-Acción de menos de mil millones de parámetros que logra una robustez de vanguardia en el benchmark LIBERO-Plus mediante el aprovechamiento de técnicas de supervisión estructurada —incluyendo entradas temporales de doble vista, destilación jerárquica de cadena de pensamiento y aumentación por paráfrasis— en lugar de aumentar el tamaño del modelo.

Autores originales: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Publicado 2026-07-29
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los robots no son solo máquinas sin mente que siguen códigos rígidos, sino compañeros útiles que comprenden nuestras palabras habladas y pueden descifrar cómo mover sus propios brazos para realizar tareas. Este es el sueño de la "IA incorporada" (embodied AI), un campo donde las computadoras aprenden a ver el mundo a través de cámaras, comprenden el lenguaje humano y traducen esas dos cosas en acciones físicas. Durante mucho tiempo, los robots más inteligentes necesitaban cerebros masivos —modelos computacionales con miles de millones de "neuronas"— para manejar esto. Estos modelos gigantes eran como supercomputadoras que necesitaban servidores enormes y costosos para funcionar, lo que hacía imposible que cupieran dentro de un pequeño robot que pudiera rodar por una casa o ayudar en una cocina. La gran pregunta que los investigadores se han estado haciendo es: ¿Podemos hacer un robot que sea igual de inteligente y confiable, pero lo suficientemente pequeño como para caber en una mochila?

Este artículo presenta un nuevo cerebro robótico llamado CoTinyVLA. Piensa en él como un cerebro robótico diminuto y súper eficiente que logra superar a los modelos masivos y pesados que lideran el campo actualmente, todo esto utilizando solo una fracción de la memoria. Los investigadores no solo encogieron el cerebro; le enseñaron una mejor forma de pensar. En lugar de intentar memorizar cada situación posible, le dieron al robot una "hoja de trucos" para razonar. Le enseñaron a descomponer una tarea grande en un plan simple (como una lista de tareas pendientes) y luego a reflexionar sobre cada pequeño paso antes de moverse. También le dieron un par de ojos especiales: uno que mira desde lejos para ver toda la habitación y otro en su muñeca para ver exactamente lo que su mano está tocando —y le enseñaron a observar un video corto de los últimos segundos para entender el movimiento—. El resultado es un modelo de robot con solo 0,9 mil millones de parámetros (diminuto comparado con los gigantes de 7 mil millones) que puede manejar situaciones complicadas y desordenadas del mundo real mejor que modelos ocho veces más grandes.

El Problema: Cerebros Grandes, Robots Pequeños

Durante años, los mejores robots para seguir instrucciones han sido como tanques gigantes y pesados. Para entender un comando como "toma la taza azul y ponla sobre la mesa", estos robots utilizan modelos computacionales masivos con 3 a 7 mil millones de parámetros. Aunque estos modelos son increíblemente inteligentes, también son enormes. Requieren alrededor de 20 gigabytes de memoria computacional solo para funcionar. Eso es como intentar meter una biblioteca completa en una mochila; simplemente no cabe en las pequeñas computadoras alimentadas por batería que se encuentran en robots móviles o dispositivos de asistencia.

Los investigadores querían saber: ¿Realmente necesitamos un cerebro tan gigante para ser inteligentes? ¿O podemos construir un robot diminuto y eficiente que sea igual de bueno manejando el desorden inesperado del mundo real?

La Solución: Un Cerebro Diminuto con una Gran Estrategia

El equipo construyó CoTinyVLA, un cerebro robótico con solo 0,9 mil millones de parámetros. Para que este modelo diminuto fuera tan fuerte como los gigantes, no solo le dieron más datos; cambiaron cómo aprendía y a qué prestaba atención. Utilizaron tres trucos principales, que llaman "supervisión estructurada", para enseñar al robot a pensar mejor.

1. El "Reloj de Tiempo" de Dos Ojos
Imagina intentar atrapar una pelota. Si solo ves una imagen de la pelota, no sabes si viene hacia ti o se aleja de ti. Necesitas ver un video corto para entender el movimiento.
CoTinyVLA es enseñado a mirar el mundo a través de dos "ojos" diferentes al mismo tiempo:

  • El Ojo de Tercera Persona: Una cámara que mira toda la habitación para ver dónde está cada cosa.
  • El Ojo de la Muñeca: Una cámara en la mano del robot para ver exactamente qué está tocando la pinza.
    En lugar de solo mirar el momento actual, el robot observa una corta "película" de los últimos 16 fotogramas (8 de cada ojo). Esto le da un sentido del tiempo y el movimiento, ayudándole a entender qué tan rápido se mueven las cosas y hacia dónde van.

2. La Hoja de Trucos de "Planificar y Pensar"
Este es el truco más importante. Antes de que el robot se mueva, se le enseña a escribir una historia.

  • El Plan: Al inicio de una tarea, el robot escribe una "lista de tareas" de alto nivel (por ejemplo, "Primero, toma la taza. Segundo, levántala. Tercero, ponla sobre la mesa"). Este plan permanece igual durante toda la tarea.
  • El Pensar: Antes de cada pequeño movimiento, el robot escribe una nota rápida sobre lo que está haciendo en ese momento (por ejemplo, "Estoy cerrando mi pinza", o "Estoy levantando la taza").
    El robot aprende esto observando a un robot mucho más grande y más inteligente (un "maestro" de 35 mil millones de parámetros) resolver las mismas tareas. El pequeño robot copia el proceso de pensamiento del maestro. Esto ayuda al pequeño robot a entender por qué está haciendo algo, no solo qué hacer.

3. El Juego de la "Paráfrasis"
Los robots a menudo se confunden si dices lo mismo de una manera diferente. Si un robot es entrenado solo con la frase "toma la taza", podría quedarse trabado si dices "agarra la taza".
Para solucionar esto, los investigadores entrenaron al robot con 40 instrucciones básicas y las expandieron a 800 versiones diferentes. Cambiaron palabras (como cambiar "tomar" por "agarrar" o "levantar"), cambiaron las descripciones de los objetos (como "tazón negro" a "tazón oscuro"), e incluso añadieron frases corteses como "Podría, por favor...". Esto enseñó al robot a entender el significado del comando, no solo las palabras específicas.

Los Resultados: Lo Diminuto Gana en Grande

Los investigadores probaron CoTinyVLA en LIBERO-Plus, un conjunto de pruebas exigente diseñado para ver qué tan bien los robots manejan los cambios en el mundo. La prueba incluye más de 10,000 escenarios diferentes donde las cosas están mal: el robot comienza en una posición extraña, la iluminación cambia, el fondo es diferente o las instrucciones se formulan de manera extraña.

Los resultados fueron sorprendentes. CoTinyVLA, con sus diminutos 0,9 mil millones de parámetros, venció a los modelos más fuertes de 7 mil millones de parámetros en las cuatro categorías principales de prueba:

  • Espacial: 90,8% de éxito (superando a los modelos grandes por 4,7 puntos).
  • Objeto: 87,3% de éxito (superando a los modelos grandes por 2,8 puntos).
  • Meta (Goal): 86,6% de éxito (superando a los modelos grandes por un enorme 15,9 puntos).
  • Largo (Long): 80,7% de éxito (superando a los modelos grandes por 3,0 puntos).

La mayor victoria fue en la categoría "Meta", donde el pequeño robot fue casi 16 puntos mejor que el mejor robot gigante. Esto es especialmente impresionante porque el pequeño robot se ejecuta en una computadora que utiliza solo 2,25 GiB de memoria, lo cual es lo suficientemente pequeño como para caber en muchos robots del mundo real.

Por Qué Es Importante

El artículo demuestra que no necesitas un cerebro masivo para ser un robot inteligente. Al enseñar a un robot pequeño a "pensar" de una manera estructurada (hacer planes y revisar sus pasos) y al darle el tipo de entrenamiento visual y lingüístico adecuado, puede manejar el mundo real, desordenado e impredecible, mejor que los modelos mucho más grandes.

Los investigadores también descubrieron que la parte de "Plan" del proceso de pensamiento es crucial. Si le quitas al robot la capacidad de escribir un plan, su tasa de éxito cae entre 40 y 45 puntos. Esto demuestra que el robot no solo está adivinando; realmente está usando el plan para guiar sus acciones.

En resumen, CoTinyVLA demuestra que, con los métodos de enseñanza adecuados, un robot pequeño y eficiente puede ser tan capaz como una supercomputadora gigante, acercándonos un paso más a tener robots inteligentes y útiles en nuestros hogares y lugares de trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →