← Últimos artículos
💬 NLP

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

Este artículo presenta el Punto de Vista de Referencia (POVBench) para evaluar la capacidad de los modelos de visión y lenguaje para realizar la "anclaje del observador contextual" —inferir la perspectiva situada de un hablante a partir de pistas contextuales— y demuestra que, si bien los modelos actuales tienen dificultades con esta tarea, los desgloses explícitos del razonamiento espacial relativo al observador pueden mejorar significamente la localización del objetivo.

Autores originales: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Publicado 2026-09-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar encontrar un objeto perdido en una habitación en la que nunca has entrado, basándote únicamente en la descripción de un amigo sobre dónde lo dejó. Podrías escuchar: "Dejé mis llaves sobre la mesa a la izquierda de la lámpara mientras preparaba café". Para resolver este rompecabezas, no basta con saber qué es una mesa y qué es una lámpara; primero debes reconstruir la posición de tu amigo en la habitación, imaginar su línea de visión y luego situar mentalmente las llaves en relación con ese punto de vista específico. Esta capacidad de comprender el espacio desde la perspectiva de otra persona, utilizando pistas sobre su actividad y el entorno, es una parte fundamental de la comunicación humana. Nos permite colaborar de manera eficiente sin necesidad de compartir cada detalle visual. Para que los robots y la inteligencia artificial trabajen junto a nosotros en nuestros hogares, deben dominar esta misma habilidad, conocida como razonamiento espacial situado.

Un nuevo estudio realizado por investigadores de la Universidad de Tokio y la Universidad Carnegie Mellon investiga si los sistemas modernos de inteligencia artificial pueden realizar realmente esta tarea. El equipo, liderado por Mimo Shirasaka, Haochen Zhang y Yonatan Bisk, creó una prueba rigurosa llamada el Punto de Referencia de Punto de Vista (Point-of-View Benchmark) para ver si las máquinas pueden inferir la ubicación de un hablante y luego localizar un objeto basándose en esa perspectiva inferida. Su trabajo revela que, si bien los modelos de IA actuales son impresionantes en muchas tareas visuales, tienen dificultades significativas cuando se les pide que razonen sobre el espacio desde un punto de vista que no pueden ver directamente, incluso cuando se les dan instrucciones claras.

Los investigadores construyeron su prueba utilizando un mundo generado por computadora de casas creadas procedimentalmente, con muebles y distribuciones realistas. En este entorno digital, un robot simulado explora cada casa, capturando una serie de imágenes en primera persona a medida que se desplaza de una habitación a otra. El núcleo del experimento consiste en una oración en lenguaje natural que describe la ubicación de un objeto, como "Vi el libro a la izquierda de la cama". El desafío para la inteligencia artificial es mirar las fotos de la exploración del robot, determinar dónde estaba parado la persona que hablaba cuando dijo esa frase y luego señalar dónde estaría el libro en ese punto de vista específico. El estudio probó tres niveles diferentes de dificultad para entender exactamente dónde se queda estancada la IA. En la versión más difícil, la oración solo da una pista sobre la actividad, como "Mientras reemplazaba una bombilla", obligando a la IA a adivinar la ubicación. En una versión media, la oración nombra explícitamente el objeto con el que la persona estaba interactuando, como "Mientras reemplazaba la bombilla de la lámpara de pie". En la versión más fácil, simplemente se le muestra a la IA la foto exacta desde la perspectiva del hablante.

Los resultados fueron reveladores. A través de una amplia gama de modelos de IA avanzados, incluyendo tanto sistemas comerciales como versiones de código abierto, el rendimiento se mantuvo bajo en los tres escenarios. Incluso cuando se le decía explícitamente a la IA qué objeto estaba cerca del hablante, o cuando se le daba la foto exacta desde el punto de vista del hablante, los modelos fallaban con frecuencia al señalar la ubicación correcta. La brecha entre la versión más difícil y la media fue sorprendentemente pequeña, lo que sugiere que la dificultad principal no es solo averiguar dónde estaba parado el hablante, sino más bien comprender cómo traducir una descripción como "a la izquierda de" en un lugar específico en una escena visual. Los modelos a menudo elegían la habitación equivocada o confundían el objeto de referencia, como confundir el marco de una puerta con un refrigerador, porque no podían combinar eficazmente las pistas visuales con el contexto de la actividad.

Para entender si los modelos podrían mejorar con ayuda, los investigadores probaron un enfoque diferente. Pidieron a la IA que desglosara su proceso de pensamiento paso a paso, indicando explícitamente cómo identificó la posición del hablante, localizó el objeto de referencia y luego determinó la dirección del objetivo. Este método, que los autores llaman razonamiento espacial estructurado, condujo a una mejora notable en la precisión. Cuando los modelos eran guiados para razonar el problema de esta manera estructurada, se volvían mejores localizando los objetos ocultos. Esto sugiere que la IA posee las piezas de información necesarias, pero tiene dificultades para ensamblarlas en un modelo mental coherente sin una guía explícita sobre cómo conectar los puntos.

El estudio también probó estas ideas en el mundo real utilizando metraje de video real de personas caminando a través de casas. Los resultados reflejaron las simulaciones por computadora: los modelos de IA continuaron teniendo dificultades con la tarea, con un rendimiento igual o inferior al cincuenta por ciento de éxito. Sin embargo, los modelos que utilizaron el enfoque de razonamiento paso a paso mostraron nuevamente mejores resultados que aquellos que no lo hicieron. Esto indica que la dificultad no es solo un fallo del entorno generado por computadora, sino un desafío genuino para la tecnología actual cuando se enfrenta a la realidad desordenada y compleja de los espacios humanos.

En última instancia, esta investigación resalta una brecha crítica en las capacidades de la inteligencia artificial incorporada. Si bien las máquinas pueden reconocer objetos y responder preguntas sobre lo que ven, aún no han aprendido a inferir naturalmente la perspectiva de un hablante humano o a reconstruir una escena desde un punto de vista que nunca han observado directamente. Los hallazgos sugieren que, para que los robots puedan colaborar verdaderamente con los humanos en nuestra vida diaria, necesitan desarrollar una capacidad más profunda para razonar sobre el espacio desde el punto de vista de otra persona, utilizando el contexto y el sentido común para llenar las piezas faltantes del rompecabezas visual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →