← Últimos artículos
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

Este artículo presenta VISTAQA, un benchmark integral y la métrica de evaluación GROVE diseñadas para evaluar conjuntamente la corrección de la respuesta a preguntas visuales y la precisión de la fundamentación de evidencia a nivel de píxel, revelando una brecha significativa en el rendimiento de los modelos multimodales actuales que no logran alinear las respuestas con la evidencia visual.

Autores originales: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Publicado 2026-05-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un detective para resolver un misterio basado en una sola fotografía.

En el pasado, si el detective te daba el nombre correcto del culpable, lo contratabas. No te importaba cómo lo sabía. Podría haber adivinado basado en un presentimiento, un estereotipo o una adivinanza afortunada. Si decía: "Fue el mayordomo", y tenía razón, recibía una estrella dorada. Incluso si señalaba a la persona equivocada en la foto y decía: "¿Ves? ¡Ese es el mayordomo!", aún le dabas la estrella dorada porque el nombre era correcto.

Este artículo argumenta que esta antigua forma de probar la IA está rota. Es como contratar a un detective que obtiene la respuesta correcta pero no puede mostrarte la evidencia.

El Problema: La IA de la "Adivinanza Afortunada"

Los autores dicen que los modelos actuales de IA (llamados Modelos de Lenguaje Multimodal Grandes) son excelentes adivinando las palabras correctas. Pero son terribles demostrando por qué tienen razón.

  • La Trampa del "Solo Texto": Si una IA dice: "Hay tres patas en ese perro", pero el perro en la imagen claramente tiene cuatro, la IA podría seguir diciendo "tres" porque aprendió de textos que los perros suelen tener cuatro, o simplemente adivinó. Si obtiene el número correcto por accidente, lo recompensamos.
  • La Trampa del "Solo Anclaje": Por el contrario, algunos modelos de IA son buenos señalando cosas en una imagen (como dibujar un círculo alrededor de un perro) pero son malos respondiendo preguntas. Podrían señalar perfectamente al perro pero decir: "Esto es un gato".

El artículo llama a esto una "brecha de modalidad". El cerebro de la IA (texto) y sus ojos (visión) no están hablando correctamente entre sí.

La Solución: VISTAQA (La Prueba "Muéstrame tu Trabajo")

Para solucionar esto, los autores crearon una nueva prueba llamada VISTAQA.

Piensa en VISTAQA como un profesor estricto que no solo califica tu respuesta final; califica tu trabajo.

  • Las Reglas: Para obtener una calificación aprobatoria, la IA debe hacer dos cosas al mismo tiempo exacto:
    1. Responder la pregunta correctamente (por ejemplo: "El coche es rojo").
    2. Dibujar una máscara (como un marcador) sobre los píxeles exactos del coche rojo en la imagen para probar que lo vio.

Si la IA obtiene la respuesta correcta pero resalta el coche equivocado, reprueba. Si resalta el coche correcto pero dice que es azul, reprueba. Debe hacer ambas cosas perfectamente para obtener una alta puntuación.

El Conjunto de Datos: Una Mezcla de Desafíos

La prueba no es solo un tipo de pregunta. Los autores construyeron una biblioteca de 1.157 acertijos curados por expertos que cubren:

  • Seis Tipos de Pensamiento: Desde lo simple "¿De qué color es esto?" (Percepción) hasta lo complejo "¿Qué objeto está más cerca del brazo robótico?" (Razonamiento).
  • Seis Mundos Diferentes: Habitaciones interiores, calles exteriores, diagramas matemáticos, gráficos científicos, laboratorios de robots y escenas de coches autónomos.
  • Las Preguntas "Trampa": Aproximadamente el 27% de las preguntas son trampas. Preguntan sobre cosas que no están en la imagen (por ejemplo: "¿Cuántos elefantes rojos hay en esta cocina?"). Una IA inteligente debería decir: "No hay ninguno", y dejar la imagen en blanco. Una IA "alucinando" intentará dibujar un elefante rojo que no existe.

La Puntuación: GROVE

¿Cómo calificas una prueba donde tienes que tener razón de dos maneras diferentes? No puedes simplemente sumar las puntuaciones. Si obtienes un 100% en el texto pero un 0% en la imagen, no deberías obtener un promedio alto.

Los autores inventaron un nuevo sistema de puntuación llamado GROVE.

  • La Analogía: Imagina un taburete de dos patas. Si una pata está rota, el taburete se cae. No puedes decir: "Bueno, la otra pata es perfecta, así que el taburete está bien".
  • Cómo funciona: GROVE multiplica la "Puntuación de Texto" y la "Puntuación de Imagen". Si cualquiera de las dos es cero (o muy baja), la puntuación final se desploma. Esto obliga a la IA a ser buena en ambas cosas o recibir una mala calificación.

Los Resultados: La IA Aún Está Aprendiendo

Los autores probaron los modelos de IA más inteligentes disponibles hoy en día (incluyendo modelos de Google, OpenAI y otros) en esta nueva y más estricta prueba.

¿El veredicto? Incluso los mejores modelos lucharon.

  • Eran excelentes adivinando las palabras correctas.
  • Eran aceptables señalando cosas.
  • Pero cuando se les pidió hacer ambas cosas al mismo tiempo, sus puntuaciones disminuyeron significativamente.

El artículo concluye que, aunque la IA se está volviendo más inteligente hablando, aún no ha aprendido completamente a "ver" y "probar" sus respuestas simultáneamente. Hay una enorme brecha entre lo que la IA dice y lo que realmente ve.

Resumen

  • Antigua Forma: ¿Obtuviste la respuesta correcta? ¿Sí? Buen trabajo. (Ignora si hiciste trampa o adivinaste).
  • Nueva Forma (VISTAQA): ¿Obtuviste la respuesta correcta Y puedes señalar la prueba en la imagen?
  • La Puntuación (GROVE): Si fallas en cualquiera de las dos partes, repruebas.
  • El Hallazgo: La IA actual sigue siendo como un estudiante que puede memorizar la hoja de respuestas pero no entiende la lección. Necesita aprender a mostrar su trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →