← Últimos artículos
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA unifica los modos de lenguaje, visión-lenguaje e instrucción visual en un único modelo de Visión-Lenguaje-Acción al canonicalizarlos en prompts de texto y máscaras deicas, demostrando una generalización superior a objetos y expresiones no vistos en comparación con las líneas base de solo lenguaje.

Autores originales: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Publicado 2026-08-31
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un brazo robótico sentado en una cocina, listo para ayudar. Para decirle qué hacer, un humano podría decir: "Recoge la taza roja de la izquierda". Esto parece simple, pero para una máquina, el mundo suele estar lleno de muchas tazas rojas, o tazas que son casi idénticas. Si el humano intenta ser más específico, diciendo: "Recoge la tercera taza roja desde la izquierda, la que está al lado de la servilleta azul", el robot aún podría confundirse. Los robots modernos se están volviendo mejores entendiendo el lenguaje, pero a menudo tienen dificultades cuando las instrucciones son demasiado detalladas o cuando los objetos frente a ellos no coinciden exactamente con las imágenes que aprendieron durante su entrenamiento. Podrían agarrar el objeto equivocado simplemente porque se ve ligeramente más familiar, ignorando las palabras específicas que el humano acaba de pronunciar.

Para resolver esto, los investigadores han estado explorando una forma diferente de hablar con las máquinas: el uso de un gesto de señalar. Así como un humano podría decir: "Recoge esta", mientras señala con el dedo un objeto, un robot puede aprender a entender un clic en una pantalla como un comando directo. Este enfoque, conocido como gesto deíctico, elimina la confusión del lenguaje al mostrarle al robot exactamente lo que se quiere decir. Sin embargo, hasta ahora, los robots generalmente habían sido entrenados para escuchar solo palabras, o para escuchar palabras mientras se les señalaba, pero rara vez para manejar todas estas formas de comunicación al mismo la vez. Un nuevo estudio introduce un sistema que unifica estos métodos, permitiendo que un solo cerebro robótico cambie fluidamente entre escuchar una oración, escuchar una oración mientras se le señala, o simplemente seguir un punto sin palabras de por medio.

Los investigadores, trabajando con un tipo de inteligencia artificial llamada modelo de Visión-Lenguaje-Acción, desarrollaron un sistema que llaman DeicticVLA. Estos modelos son como el cerebro de un robot que ha leído millones de libros y visto millones de imágenes, aprendiendo cómo conectar lo que ve con lo que debe hacer. El desafío era hacer que este cerebro fuera lo suficientemente flexible como para aceptar tres tipos diferentes de entrada: un comando de texto, un comando de texto combinado con un gesto de señalar, o simplemente un gesto de señalar. En el primer modo, el usuario escribe una oración completa. En el segundo, el usuario escribe una oración que incluye una palabra como "esto" o "allí" y hace clic en la pantalla para definir a qué se refiere esa palabra. En el tercer modo, el usuario hace clic en el objeto que desea mover y en el lugar donde desea que vaya, sin decir nada en absoluto.

Para que esto funcione, el equipo creó un paso de traducción que convierte estas tres entradas diferentes en el mismo formato interno. Cuando un usuario hace clic en una pantalla, el sistema utiliza una poderosa herramienta de análisis de imágenes para convertir ese único clic en un contorno preciso del objeto, una máscara que resalta exactamente lo que el humano está tocando. Esta máscara se combina luego con un mensaje de texto (prompt). Si el usuario habló, el mensaje de texto son sus palabras. Si solo hizo clic, el sistema utiliza una frase predeterminada como "sigue la instrucción visual". De esta manera, el cerebro del robot siempre recibe un paquete consistente: una instrucción de texto y un resaltado visual del objetivo. Los investigadores luego probaron diferentes formas de introducir este resaltado visual en el cerebro del robot. Probaron pintando un cuadro alrededor del objeto en la imagen de la cámara, desvaneciendo el resto de la escena para que el objeto destaque, o introduciendo el contorno como una capa de información separada que el robot procesa junto con la imagen.

El equipo primero probó estas ideas en un entorno simulado, un mundo digital donde los robots pueden practicar miles de veces sin romper nada. Descubrieron que el sistema podía aprender con éxito a manejar todos los modos de instrucción a la vez. Cuando se le pedía al robot realizar tareas que nunca había visto, como recoger un objeto de una nueva disposición de muebles o identificar un objeto mediante una nueva descripción espacial, los métodos de señalar funcionaron significativamente mejor que las palabras por sí solas. En una prueba que involucraba cuencos negros idénticos, donde el robot tenía que recoger el que estaba al lado de un objeto de referencia específico, el enfoque de solo lenguaje falló la mayor parte de las veces. Sin embargo, cuando el usuario señaló el cuenco correcto, el robot tuvo éxito casi siempre. El estudio mostró que el método de entrenamiento de dos etapas fue crucial: el robot primero aprendió a seguir comandos de texto, y luego aprendió a combinar esos comandos con gestos de señalar. Este orden ayudó al robot a mantener su capacidad de entender el lenguaje mientras adquiría la nueva habilidad de seguir un punto.

Para ver si esto funcionaba en el mundo real, los investigadores construyeron una configuración física con un brazo robótico, una cámara y una tableta. Enseñaron al robot a recoger bloques, colocarlos en cuencos y organizar juguetes de peluche. Probaron al robot con instrucciones que nunca había escuchado antes, como pedirle que recogiera el bloque "más a la izquierda" cuando solo había sido entrenado con instrucciones de "más a la derecha", o pedirle que moviera un tipo específico de juguete que nunca había visto. En estos escenarios difíciles, el robot que dependía solo del lenguaje tenía dificultades, a menudo adivinando mal o fallando en su acción. Pero cuando el usuario señalaba el objetivo, la tasa de éxito del robot se disparaba. En una prueba con categorías completamente nuevas de juguetes de peluche, el robot que dependía solo del lenguaje tuvo éxito solo aproximadamente una sexta parte de las veces. Los métodos basados en el señalamiento, sin embargo, lograron una tasa de éxito perfecta. El robot no necesitaba saber el nombre del juguete o a qué categoría pertenecía; simplemente necesitaba ver hacia dónde señalaba el humano.

Los resultados sugieren que el futuro de la interacción humano-robot puede no ser elegir entre hablar y señalar, sino tener ambos disponibles al mismo tiempo. El sistema permite a un usuario comenzar con una oración y, si el robot parece confundido, simplemente señalar para aclarar. O, para una tarea rápida y rutinaria, el usuario puede simplemente señalar sin decir una palabra. La investigación indica que, si bien el lenguaje es poderoso para describir ideas complejas, señalar es una forma más confiable de identificar objetos específicos en un mundo desordenado y cambiante. Al unificar estos métodos en un solo sistema, los investigadores han creado una forma más flexible y robusta para que los humanos guíen a las máquinas, asegurando que el robot entienda no solo lo que decimos, sino lo que queremos decir.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →