← Últimos artículos
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

El artículo propone CAST, un método que aprovecha los modelos de visión y lenguaje para generar etiquetas contrafácticas para aumentar los conjuntos de datos de robots, mejorando significativamente las capacidades de seguimiento de instrucciones de los modelos de visión, lenguaje y acción sin requerir la recolección de datos adicionales.

Autores originales: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Publicado 2026-06-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo navegar por una casa o recoger objetos. Le muestras un vídeo de un robot caminando por un pasillo y girando a la derecha. Le dices al robot: "Esto es lo que parece 'ir recto'".

El problema es que el robot es un estudiante un poco perezoso. Nota que cada vez que ve un pasillo, el robot del vídeo gira a la derecha. Así que aprende un atajo: "Si veo un pasillo, giro a la derecha". Deja de escuchar tus instrucciones específicas (como "gira a la izquierda en la mesa azul") porque piensa que la imagen del pasillo le dice todo lo que necesita saber. En los términos técnicos del artículo, esto se llama "colapso posterior" (posterior collapse): el robot ignora tu voz y simplemente adivina basándose en lo que ve.

La solución CAST: El juego del "¿Qué pasaría si...?"

Los autores de este artículo, de la UC Berkeley y Princeton, idearon un truco ingenioso para solucionar esto. Llaman a esto CAST (Counterfactual Labels Improve Instruction Following o Etiquetas Contrafácticas Mejoran el Seguimiento de Instrucciones).

Piensa en CAST como un entrenador de escritura creativa para robots. En lugar de limitarse a mostrarle al robot el único camino que realmente tomó, el entrenador le pide al robot que juegue a un juego de "¿Qué pasaría si...?".

Así es como funciona, paso a paso:

  1. La escena original: El robot tiene un vídeo de sí mismo caminando por un pasillo.
  2. La pregunta "¿Qué pasaría si...?": Los investigadores utilizan una IA superinteligente (un Modelo de Visión y Lenguaje) para mirar ese mismo pasillo y preguntar: "Oye, ¿qué más podría haber hecho el robot aquí?".
    • Original: "Ir recto".
    • Contrafáctico (¿Qué pasaría si...?): "Girar a la derecha en la mesa naranja", o "Moverse a lo largo de la pared de la izquierda".
  3. Inventando el camino: La IA no solo inventa una frase; también inventa un camino de vídeo falso que coincida con esa nueva frase. Imagina: "De acuerdo, si el robot girara a la derecha en la mesa naranja, ¿cómo se verían los siguientes segundos?".
  4. La nueva lección: Ahora, el robot tiene dos lecciones para el mismo pasillo:
    • Lección A: "Ir recto" (el vídeo real).
    • Lección B: "Girar a la derecha en la mesa naranja" (el vídeo inventado).

Por qué esto lo cambia todo

Antes de este truco, el robot veía un pasillo y pensaba: "¡Ya conozco esto! ¡Giro a la derecha!". No necesitaba escuchar tus palabras.

Después del truco CAST, el robot ve el mismo pasillo pero se da cuenta: "Espera, a veces voy recto y otras veces giro a la derecha en la mesa naranja. La imagen por sí sola no me dice qué hacer. Debo escuchar las palabras específicas que me das para saber qué camino tomar".

Los resultados

Los investigadores probaron esto en dos tipos de robots:

  • Robots de navegación: Robots que caminan por interiores y exteriores.
  • Robots de manipulación: Brazos robóticos que recogen cosas como brócoli o cucharas.

Descubrieron que al usar estos datos de "qué pasaría si" (sin necesidad de recolectar nuevos vídeos del mundo real), los robots mejoraron mucho en el seguimiento de instrucciones.

  • En navegación, la tasa de éxito se duplicó en comparación con los robots entrenados sin este truco.
  • En tareas de manipulación (como recoger objetos cuando hay objetos que distraen cerca), los robots mejoraron un 27%.

La conclusión

CAST es como darle a un robot una biblioteca de "realidades alternativas". Al mostrarle al robot que una misma escena puede conducir a muchos resultados diferentes dependiendo de la instrucción, se le obliga a dejar de adivinar y empezar a escuchar. Convierte a un robot que solo "mira y adivina" en un robot que realmente "escucha y actúa".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →