← Últimos artículos
💬 NLP

VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

Este artículo presenta VistaHop, un nuevo referente y entorno de evaluación diseñado para evaluar las capacidades de los modelos de razonamiento multimodal de gran escala al realizar razonamiento visual complejo de múltiples saltos e inspección iterativa de imágenes para Visual DeepSearch, revelando que los modelos actuales de vanguardia todavía presentan dificultades significativas con estas tareas.

Autores originales: Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un detective para resolver un misterio. En el pasado, la mayoría de las "pruebas de detective" para la IA eran como acertijos simples: le mostrabas a la IA una sola foto y le preguntabas: "¿De qué color es el coche?". La IA solo miraba una vez, adivinaba el color y seguía adelante.

Pero la investigación en el mundo real es mucho más difícil. A veces, para resolver un caso, necesitas hacer zoom en un pequeño logo en un zapato, buscar la historia de esa marca, averiguar dónde está su fábrica, revisar el clima allí y luego conectar todos esos puntos para descubrir quién estuvo en la escena.

Este artículo, VistaHop, trata sobre la creación de una prueba mucho más difícil para ver si los detectives de IA realmente pueden realizar este tipo de trabajo profundo y de múltiples pasos.

El Problema: La Trampa del "Vistazo Único"

Los autores argumentan que las pruebas actuales de IA son demasiado fáciles. Son como darle a un detective una foto y preguntarle: "¿Hay un perro en esta imagen?". La IA solo echa un vistazo y dice "Sí".

El verdadero "Visual DeepSearch" (Búsqueda Visual Profunda) es diferente. Requiere que la IA:

  1. Mire de cerca: Haga zoom en partes específicas de una imagen (como un texto diminuto en un letrero).
  2. Vaya y vuelva: Se dé cuenta de que pasó por alto una pista, haga zoom de nuevo y observe una parte diferente de la imagen.
  3. Conecte los puntos: Combine lo que ve en la foto con conocimiento externo (como consultar una base de datos) a través de muchos pasos.

Los autores dicen que las pruebas existentes fallan porque permiten que la IA haga trampa usando pistas de texto o simplemente adivinando sin realmente "ver" los detalles.

La Solución: VistaHop (La "Pista de Obstáculos")

Para solucionar esto, el equipo creó VistaHop, un nuevo benchmark (una suite de pruebas) diseñado como una compleja pista de obstáculos.

  • La Configuración: Reunieron 300 fotos de alta calidad (como una calle concurrida de una ciudad o un museo).
  • La Tarea: Crearon 350 preguntas que obligan a la IA a realizar un largo viaje.
    • Ejemplo: "Mira el contenedor de envío naranja en la parte inferior derecha. Encuentra el logo de la empresa. Averigua cuándo fue fundada esa empresa. Ahora, encuentra la ciudad donde se encuentra su sede central. ¿En qué año fue fundada esa ciudad? Resta los dos años".
  • Las Reglas: La IA no puede simplemente adivinar. Debe demostrar que miró la parte específica de la imagen, encontró el logo y siguió la cadena de pistas. Si intenta responder usando solo el texto de la pregunta (sin mirar la imagen), la prueba la detecta y rechaza la respuesta.

También construyeron VistaArena, un "gimnasio" donde pueden observar a la IA entrenar. Permite que la IA utilice herramientas como una lupa (para recortar/hacer zoom en imágenes), un motor de búsqueda (para encontrar hechos) y una calculadora.

Los Resultados: La IA Todavía es un Novato

Los autores sometieron a los modelos de IA más inteligentes disponibles (como SenseNova, GPT-5 y Gemini) a esta pista de obstáculos.

El veredicto? La IA tuvo serias dificultades.

  • Incluso el mejor modelo solo acertó aproximadamente el 24% de las respuestas al primer intento.
  • Cuando se obligó a la IA a limitarse solo a mirar la imagen sin usar herramientas de búsqueda, acertó menos del 8%.
  • La IA mejoró cuando se le permitió usar herramientas (hacer zoom y buscar), pero aun así falló con frecuencia cuando la "cadena de pistas" era demasiado larga o requería mirar diferentes puntos de la foto.

La Conclusión

El artículo concluye que, si bien la IA se está volviendo buena en "ver" imágenes, todavía es muy mala siendo una investigadora persistente. Tiende a rendirse demasiado rápido, pasa por alto detalles diminutos o se olvida de volver a revisar la imagen.

Los autores construyeron VistaHop no para vender un producto, sino para mostrar al mundo que necesitamos mejores pruebas y mejores métodos de entrenamiento si queremos que la IA realmente comprenda misterios visuales complejos. Han hecho públicos sus datos y su código para que otros investigadores puedan intentar construir mejores "detectives".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →