Visuospatial Perspective Taking in Multimodal Language Models
El estudio revela que los modelos de lenguaje multimodales presentan deficiencias significativas en la toma de perspectiva visoespacial de nivel 2, lo que limita su capacidad para inhibir su propia visión y adoptar la de otros en contextos colaborativos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
🧠 ¿Ven el mundo como nosotros? La prueba de "ponerse en los zapatos del otro" de la IA
Imagina que estás jugando a un juego de mesa con un robot muy inteligente. Tú ves el tablero desde tu lado, y el robot lo ve desde el suyo. Si tú le dices: "Pásame la pieza que está a mi izquierda", el robot tiene que hacer algo muy difícil: olvidar cómo ve él las cosas y imaginar cómo las ves tú.
Si el robot te pasa la pieza que está a su izquierda (que para ti está a la derecha), se equivoca. Esto se llama "Toma de Perspectiva Visoespacial". Es la capacidad de entender que lo que tú ves no es lo mismo que ve el otro.
Este artículo investiga si los nuevos modelos de Inteligencia Artificial (IA) que pueden "ver" imágenes (como GPT-4o o o3) son buenos en este juego mental.
🎭 El escenario: Dos pruebas de realidad
Los investigadores diseñaron dos juegos para poner a prueba a la IA, inspirados en cómo estudiamos a los niños y a los humanos:
El juego del "Giro" (Rotating Figure Task):
- La escena: Imagina una foto desde arriba de una persona en una habitación con un número en el suelo (por ejemplo, un "6").
- El reto: La persona en la foto está girada. Si tú miras el número, es un "6". Pero si la persona está de espaldas, para ella ese número es un "9".
- La pregunta: "¿Qué ve la persona?"
- El truco: La IA tiene que girar mentalmente la imagen, como si fuera un holograma, para ver lo que ve el otro, no lo que ve ella.
El juego del "Director" (Director Task):
- La escena: Imagina una estantería con cajas. Hay un "Director" al otro lado de la estantería. Algunas cajas están ocultas detrás de un panel para el Director, pero tú las ves perfectamente.
- El reto: El Director te dice: "Por favor, pásame la caja azul más pequeña".
- El truco: Si tú ves dos cajas azules pequeñas (una que él ve y otra oculta), la IA debe ignorar la que ella ve y elegir solo la que el Director puede ver. Si el Director dice "la de la izquierda", la IA debe recordar que para el Director, "izquierda" es lo opuesto a su propia izquierda.
📉 Lo que descubrieron: ¡La IA se pierde en el giro!
Los resultados fueron bastante reveladores y un poco preocupantes para quienes esperan que la IA sea un compañero social perfecto:
- Nivel 1 (Lo fácil): La IA es bastante buena diciendo "¿Puede la persona ver el número?". Si hay un muro entre ellos, la IA entiende que no. Esto es como decir: "¿Ves el sol?". Sí o no.
- Nivel 2 (Lo difícil): Aquí es donde la IA falla estrepitosamente. Cuando tiene que decir "¿Cómo se ve el número para la persona?" (¿Es un 6 o un 9?) o "¿Está a su izquierda o derecha?", la IA se confunde.
- El problema del "Espejo": La IA a veces funciona bien si la persona está girada 180 grados (exactamente al revés), como si usara un truco de espejo simple. Pero si la persona está girada 45 o 90 grados, la IA se pierde. Es como si solo supiera girar en ángulos rectos, pero no en diagonal.
- La alucinación: A veces, la IA inventa cosas. Por ejemplo, dice que ve un número que no existe o que la persona está mirando hacia una pared que no está ahí.
🤖 ¿Por qué fallan? (La analogía del actor de teatro)
Imagina que la IA es un actor de teatro muy talentoso que ha leído millones de guiones.
- Cuando le preguntas algo simple, actúa perfecto.
- Pero cuando le pides que cambie de personaje y vea el mundo desde los ojos de otro, el actor se queda en su propio personaje. Sigue usando su propia "lente" en lugar de ponerse la lente del otro.
Los modelos más avanzados (los que "piensan" antes de responder, como o3) son un poco mejores, pero siguen cometiendo el mismo error: no pueden girar mentalmente el mundo. Usan atajos (heurísticas) en lugar de realmente "imaginar" la perspectiva del otro.
💡 ¿Por qué importa esto?
Si quieres que un robot te ayude en casa, en un hospital o en una oficina, necesita saber qué ves tú y qué ve él.
- Si un robot médico no entiende que tú ves un medicamento en un lugar donde él no puede verlo, podría darte la medicina equivocada.
- Si un robot colaborador no entiende que "izquierda" para ti es "derecha" para él, chocará contra los muebles.
🎯 Conclusión en una frase
Aunque estas inteligencias artificiales son geniales hablando y reconociendo imágenes, todavía no tienen la capacidad humana de "ponerse en los zapatos del otro". Les cuesta mucho imaginar el mundo desde una perspectiva diferente a la suya, especialmente cuando hay que girar mentalmente las cosas.
En resumen: La IA es un genio que sabe mucho, pero todavía le cuesta entender que el mundo no se ve igual para todos. 🌍👀🔄
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.