← Últimos artículos
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

Este artículo evalúa el rendimiento de los principales modelos fundacionales multimodales, como GPT-4o, en tareas estándar de visión por computadora mediante un nuevo marco de encadenamiento de prompts para revelar que, aunque funcionan como generalistas respetables con una sólida comprensión semántica, aún se quedan atrás frente a los modelos especializados en tareas geométricas y presentan modos de fallo específicos.

Autores originales: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

Publicado 2026-05-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de bibliotecarios increíblemente inteligentes y muy leídos (los Modelos Fundacionales Multimodales o MFMs, como GPT-4o, Gemini y Claude). Estos bibliotecarios han leído casi todos los libros de internet y pueden describir una imagen con un detalle hermoso y poético. Son famosos por responder preguntas como: "¿Qué está pasando en esta foto?" o "Escribe una historia sobre este perro".

Pero los investigadores del EPFL plantearon una pregunta diferente: "¿Pueden estos bibliotecarios realmente hacer el trabajo de un fotógrafo profesional o de un arquitecto 3D?"

Para averiguarlo, no solo les pidieron a los bibliotecarios que charlaran; los sometieron a una serie de exámenes rigurosos y técnicos, usualmente reservados para robots especializados en visión por computadora. Así es como lo hicieron y lo que descubrieron, explicado de forma sencilla.

El Desafío: El Problema de "Solo Texto"

El problema principal es que estos modelos de IA están entrenados para hablar, no para dibujar o medir. Si le pides a un robot de visión estándar que "encuentre al gato", dibuja un recuadro alrededor de él. Si le pides a una IA basada en texto, podría decir: "Veo un gato".

Para probarlos de manera justa, los investigadores inventaron un juego de traducción llamado "Encadenamiento de Prompts".

  • La Analogía: Imagina que estás vendado y necesitas encontrar un libro específico en una biblioteca masiva. No puedes ver, pero puedes hacerle preguntas a un guía.
  • El Método: En lugar de pedirle a la IA que "dibuje un recuadro alrededor del gato" (algo que no puede hacer de forma nativa), los investigadores descompusieron la tarea en pasos diminutos basados en texto. Le preguntaron a la IA: "¿Hay un gato en la esquina superior izquierda?" "No." "¿Hay un gato en el medio?" "Sí". Luego, "¿Está en la mitad superior del medio?" "Sí".
  • Al encadenar estas pequeñas preguntas de "Sí/No", la IA finalmente construye un mapa de dónde está el objeto, "dibujando" efectivamente un recuadro o una máscara solo a través de texto. Esto permitió a los investigadores comparar a los "hablantes" contra los "hacedores" (modelos especialistas) en las mismas tareas exactas.

El Examen: ¿Qué Probaron?

Los investigadores sometieron a los modelos a seis tipos diferentes de pruebas, desde fáciles hasta muy difíciles:

  1. Clasificación: "¿Qué es esto?" (Como identificar una cebra).
  2. Detección de Objetos: "¿Dónde está la cebra?" (Dibujando un recuadro alrededor de ella).
  3. Segmentación: "¿Qué píxeles pertenecen a la cebra?" (Coloreando la cebra perfectamente).
  4. Agrupación: "Si toco la oreja de la cebra, ¿qué otros píxeles pertenecen a la misma cebra?"
  5. Predicción de Profundidad: "¿Qué parte de la imagen está más cerca de la cámara?" (Creando un mapa de distancia 3D).
  6. Normales de Superficie: "¿Hacia dónde apunta la superficie?" (¿Esta pared mira a la izquierda, derecha, arriba o abajo?).

Los Resultados: El "Generalista" vs. El "Especialista"

1. Son excelentes "Generalistas", pero no "Especialistas".
Los modelos de IA se desempeñaron sorprendentemente bien al ser generalistas. Podían identificar objetos y entender la escena general mejor que el azar. Sin embargo, aún se quedan significativamente atrás de los robots especializados construidos específicamente para estos trabajos.

  • Analogía: La IA es como un brillante médico de cabecera que sabe un poco de todo. Los modelos especialistas son como neurocirujanos. El generalista puede diagnosticar un dolor de cabeza, pero no puede realizar una cirugía cerebral tan bien como el cirujano.

2. La Brecha entre "Semántica" y "Geometría"
Los modelos fueron mucho mejores en tareas Semánticas (entender qué son las cosas) que en tareas Geométricas (entender dónde están las cosas en el espacio 3D).

  • Podían decirte "Esa es una cebra" fácilmente.
  • Les costaba decirte "Esa cebra está a 5 metros de distancia y su lomo mira ligeramente a la izquierda".
  • Analogía: Son excelentes describiendo la trama de una película, pero terribles dibujando el diseño del escenario o calculando la física de las explosiones.

3. El Problema de la "Visión Borrosa"
Cuando los investigadores intentaron hacer que la IA dibujara contornos precisos, los modelos a menudo luchaban con los detalles finos. Era como si tuvieran "visión borrosa".

  • Para solucionar esto, los investigadores tuvieron que darle a la IA recortes de la imagen "acercados" (como mirar a través de una lupa) para ayudarle a ver los bordes claramente. Sin esta ayuda, los contornos de la IA eran desordenados.

4. Los Modelos de "Razonamiento" están Cambiando el Juego
El artículo probó un nuevo tipo de IA llamado "Modelos de Razonamiento" (como o1, o3 y o4-mini). Estos modelos toman tiempo extra para "pensar" antes de responder.

  • El Resultado: Estos modelos pensadores fueron mucho mejores en las tareas difíciles de geometría 3D (profundidad y normales de superficie) que los modelos estándar. Parecían usar la lógica para deducir las relaciones espaciales, mientras que los modelos estándar simplemente adivinaban basándose en patrones.

5. El Problema de la "Alucinación"
Cuando los investigadores probaron el GPT-4o más nuevo, que puede realmente generar imágenes (dibujar cuadros) en lugar de solo hablar, descubrieron que era propenso a alucinaciones.

  • Analogía: Si le pides que "dibuje la cebra", podría dibujar una cebra, pero también podría añadir accidentalmente un cuerno de unicornio o colocar las patas de la cebra en el lugar equivocado. La generación de imágenes es prometedora, pero actualmente poco fiable para tareas precisas.

La Conclusión

El artículo concluye que, aunque estos masivos modelos de IA son impresionantes "generalistas" que pueden entender el significado de una imagen, aún no están listos para reemplazar las herramientas especializadas utilizadas por ingenieros y científicos para mediciones precisas y reconstrucción 3D.

Sin embargo, los modelos de "Razonamiento" están mostrando los primeros signos de cerrar esta brecha, lo que sugiere que a medida que la IA aprende a "pensar" más profundamente, su capacidad para entender el mundo físico 3D está empezando a ponerse al día con su capacidad para entender el lenguaje.

Nota Importante: Los investigadores enfatizan que su método de "Encadenamiento de Prompts" es una herramienta de prueba, no una forma práctica de usar estos modelos en la vida real. Es como usar una regla para medir la altura de un modelo; es una forma de obtener un número, pero no usarías una regla para construir una casa. El objetivo fue simplemente ver qué tan buenos son realmente estos modelos, y la respuesta es: "Muy buenos hablando sobre imágenes, pero aún aprendiendo a medirlas".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →