← Últimos artículos
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

Este artículo presenta **In-Context VLA**, un marco que mejora los modelos de Visión-Lenguaje-Acción al reemplazar la generación de cadena de pensamiento de forma libre por un post-entrenamiento en contexto sobre evidencia perceptiva estructurada y el uso de herramientas agénticas, permitiendo así un consumo de lenguaje fundamentado para un control de bajo nivel superior y un rendimiento de vanguardia en tareas de manipulación en simulación y en el mundo real.

Autores originales: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Publicado 2026-08-07
📖 3 min de lectura☕ Lectura para el café

Autores originales: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a hacer tareas del hogar, como preparar un sándwich o recoger una habitación desordenada. Durante mucho tiempo, los científicos han intentado enseñar a estas máquinas mostrándoles vídeos de humanos realizando la tarea y diciéndole al robot: "Copia exactamente lo que ves". Esto funciona aceptablemente para tareas sencillas, pero es como intentar aprender un nuevo idioma memorizando únicamente una frase única y rígida. Si le pides al robot que "recoja la taza roja", pero luego dices "agarra esa taza carmesí", el robot podría confundirse porque nunca aprendió a entender el significado detrás de las palabras, solo a coincidir con los sonidos específicos que escuchó durante el entrenamiento.

Para solucionar esto, investigadores probaron recientemente a darle a los robots un paso de "pensamiento", similar a cómo los humanos hablan consigo mismos antes de actuar. Esperaban que el robot primero escribiera un plan como: "Bien, la taza está sobre la mesa y necesito mover mi mano hacia la izquierda", y luego actuara. Esto se llama "Cadena de Pensamiento" (Chain-of-Thought). Pero aquí está el giro: para los robots, hablar demasiado antes de moverse en realidad los hace peores en su trabajo. Es como intentar conducir un coche mientras escribes una novela sobre la carretera; para cuando termines tu frase, habrás perdido el giro. El robot se queda atrapado en un bucle de narrar sus propios pensamientos en lugar de agarrar realmente el objeto, y a menudo inventa hechos sobre dónde están las cosas porque está adivinando en lugar de observar.

Este artículo presenta una nueva forma de enseñar a los robots llamada VLA-Talker. En lugar de obligar al robot a escribir sus propios pensamientos, los investigadores le dan un "asistente inteligente" que hace el trabajo de mirar e informar por él. Piensa en ello como un robot con un par de gafas superpotentes y un copiloto servicial. Cuando el robot necesita saber dónde está una cuchara, no adivina ni escribe un párrafo al respecto. En su lugar, pregunta instantáneamente a su copiloto (que utiliza herramientas especiales como cámaras de profundidad y detectores de objetos) para que diga: "La cuchara está 42 píxeles a la derecha y ligeramente más abajo de tu mano". El robot lee entonces este informe claro y factual y actúa de inmediato.

Los investigadores descubrieron que este método cambia las reglas del juego. Al permitir que el robot consuma lenguaje claro y fundamentado de sus herramientas en lugar de generar su propio parloteo confuso, el robot se vuelve mucho más rápido y preciso. En sus pruebas, este enfoque no solo funcionó mejor, sino que fue casi 4,6 veces más rápido que los antiguos métodos de "pensamiento", porque el robot no perdió tiempo escribiendo ensayos antes de moverse. Lo probaron en simulaciones informáticas complejas e incluso en un robot real con forma humana, y consistentemente resolvió tareas con las que otros robots tenían dificultades, demostando que, a veces, la mejor forma de pensar es escuchar a alguien más que conoce los hechos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →