← Últimos artículos
🤖 AI

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

Este artículo presenta un conjunto de datos sintéticos de acceso público generado en NVIDIA Omniverse para entrenar Modelos de Visión-Lenguaje en razonamiento espacial y Toma de Perspectiva Visual, sirviendo como un paso fundacional hacia la cognición corporizada en la interacción humano-robot.

Autores originales: Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

Publicado 2026-07-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando al escondite con un amigo en una sala de estar gigante y desordenada. Te estás escondiendo detrás del sofá y tu amigo está de pie junto a la puerta. Si gritas: "¡Veo la pelota roja a mi izquierda!", tu amigo tiene que hacer algo sorprendentemente difícil: no puede simplemente mirar a su izquierda desde su propio lugar, sino que tiene que ponerse mentalmente en tus zapatos, girar para ver la habitación desde tu ángulo y luego averiguar dónde está esa pelota roja en relación con él. Esta gimnasia mental se llama "Toma de Perspectiva Visual". Este es un superpoder que los humanos tenemos y que nos permite entender lo que otros ven, piensan y sienten. Para que los robots puedan realmente pasar el rato con nosotros, jugar con nosotros o ayudarnos en nuestros hogares, necesitan este mismo superpoder. En este momento, los robots son a menudo como personas que solo pueden ver el mundo desde sus propios ojos; les cuesta entender que la "izquierda" para ellos podría ser la "derecha" para ti. Este artículo se sumerge en el mundo de la Inteligencia Artificial (IA) para ver si podemos enseñar a los robots a realizar este acto de giro mental, específicamente utilizando un tipo especial de datos de entrenamiento que actúa como un simulador de videojuegos.

Los investigadores detrás de este artículo, Joel Currie y su equipo, están abordando un problema específico: los robots y los cerebros de IA que los impulsan son excelentes reconociendo objetos, pero son pésimos entendiendo exactamente dónde están esos objetos en el espacio 3D, especialmente cuando los miran desde diferentes ángulos. Mientras que algunos métodos robóticos más antiguos utilizan reglas matemáticas rígidas para calcular el espacio, el equipo sugiere que los modernos "Modelos de Visión-Lenguaje" (IA que puede ver imágenes y leer texto) podrían ser el futuro, pero solo si podemos enseñarles mejor. El artículo sostiene que estos modelos inteligentes están fallando actualmente en el razonamiento espacial no porque sean "tontos", sino porque no han sido entrenados con suficientes datos que vinculen perfectamente cómo se ve un objeto con su ubicación exacta.

Para solucionar esto, el equipo creó un nuevo "gimnasio de entrenamiento" para los robots, pero en lugar de una habitación real, construyeron una digital dentro de un potente motor de videojuegos llamado NVIDIA Omniverse. Piensa en ello como un banco de arena digital donde pueden soltar un único cubo ligeramente deformado, tomar una foto de él con una cámara de altura aleatoria y escribir una oración que lo describa. La parte mágica es que, como construyeron este mundo en una computadora, conocen la matemática exacta de dónde está el cubo, hasta el milímetro. Generaron un conjunto de datos lleno de estas escenas, emparejando una imagen, un comando de lenguaje y una precisa "matriz de transformación 4×4" (una cuadrícula matemática elegante que indica exactamente cómo está posicionado el objeto).

En este primer experimento, el equipo no pidió a la IA que resolviera todo el rompecabezas del espacio 3D a la vez. En su lugar, se centraron en una habilidad más simple y fundamental: adivinar qué tan lejos está el objeto a lo largo del eje Z (la línea de profundidad relativa a la cámara), manteniendo todo lo demás estático. Quieren ver si la IA puede mirar la imagen y la descripción y adivinar correctamente esa distancia. Si la IA puede aprender esto en su mundo sintético perfecto, la esperanza es que eventualmente aprenda a manejar la complejidad total y desordenada de una habitación real. El artículo presenta esto como una "prueba de concepto", lo que significa que es una prueba de etapa inicial para ver si la idea funciona. No pretenden haber resuelto la inteligencia robótica hoy; más bien, están colocando el primer ladrillo de un cimiento. Han hecho público este conjunto de datos para que otros científicos puedan usarlo para entrenar sus propios robots, con el objetivo de un futuro donde los robots puedan comprender realmente "lo que otros ven" y navegar por nuestro mundo con la misma conciencia espacial que damos por sentada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →