InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Este artículo presenta InterLV-Search, una evaluación integral y un marco de evaluación para la búsqueda agente multimodal intercalada que pone de manifiesto limitaciones significativas actuales en la capacidad de los sistemas para integrar dinámicamente evidencia textual y visual en escenarios de búsqueda activa, controlada fuera de línea y de web abierta.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando resolver un misterio complejo, como encontrar a una persona específica basándote en una serie de pistas.
La Vieja Forma (Puntos de Referencia Anteriores):
La mayoría de los actuales "detectives" de IA se entrenan así: Les das una foto de un sospechoso y preguntas: "¿Quién es este?" o "¿De qué color es su sombrero?". La IA mira la foto y responde. Si la foto no es suficiente, la IA podría buscar en internet texto sobre la persona, pero trata la foto solo como el punto de partida o la respuesta final. Rara vez utiliza una foto que encuentra en medio de su investigación para cambiar su dirección. Es como un detective que mira una foto de la escena del crimen, luego solo lee un artículo de periódico, y nunca se da cuenta de que una nueva foto que encuentra en la página 3 del periódico en realidad lo dirige a una ciudad completamente diferente.
La Nueva Forma (InterLV-Búsqueda):
Los autores de este artículo, "InterLV-Búsqueda", construyeron un nuevo campo de entrenamiento (un punto de referencia) para probar si la IA puede hacer algo mucho más difícil: Búsqueda Agente Multimodal Entrelazada.
Piensa en esto como un detective que debe cambiar constantemente entre mirar mapas (texto) y mirar fotos (imágenes) para resolver el caso.
- El Giro: La IA encuentra una foto, la mira y se da cuenta: "¡Oh! El logotipo en este edificio de la foto me dice que necesito buscar un nombre de marca específico". Luego busca esa marca, encuentra una nueva foto de un coche, ve una matrícula, y esa matrícula le dice que busque una ciudad específica.
- El Objetivo: La foto no es solo la respuesta; la foto es un volante. Le dice a la IA hacia dónde conducir a continuación.
Los Tres Niveles de Dificultad
El artículo prueba a la IA en tres niveles, como un videojuego con dificultad creciente:
Nivel 1: El Desafío "Encuentra la Foto".
- La Tarea: Se le da a la IA una descripción textual como: "Encuentra el juego que presenta este barco pirata". Tiene que averiguar qué es el barco, buscarlo, encontrar la imagen y luego responder una pregunta sobre la imagen (por ejemplo, "¿Qué motor usa el barco?").
- La Metáfora: Se te da un acertijo sobre un objeto oculto. Tienes que encontrar el objeto primero antes de poder responder al acertijo.
Nivel 2: El Desafío "Laberinto Controlado".
- La Tarea: La IA está en una habitación cerrada (una base de datos offline controlada) con un mapa. Comienza con una pista textual, encuentra una foto, la foto da una nueva pista, encuentra otra foto, y así sucesivamente.
- La Metáfora: Imagina una búsqueda del tesoro donde encontrar una foto de una puerta roja te lleva a una pista textual sobre un coche azul, que te lleva a una foto de un pájaro amarillo. La IA debe usar la foto de la puerta para decidir buscar el coche. Si ignora la foto y sigue solo leyendo texto, se pierde.
Nivel 3: El Desafío "Internet Salvaje".
- La Tarea: Ahora la IA está fuera en el internet real y desordenado. Tiene que buscar pistas, encontrar fotos, darse cuenta de que algunas fotos son falsas o irrelevantes, comparar diferentes caminos (por ejemplo, "¿Esta película dura 60 minutos o 90 minutos?") y elegir el camino correcto para continuar.
- La Metáfora: Esto es como un detective intentando resolver un caso usando todo internet. Tiene que tamizar millones de sitios web, algunos con fotos malas, otros con fechas incorrectas, y decidir qué camino seguir basándose en lo que ve en las imágenes.
¿Qué Descubrieron?
Los autores probaron muchos de los modelos de IA más inteligentes (como GPT-5, Gemini y Claude) en esta nueva prueba.
- El Resultado: Los modelos de IA son actualmente muy malos en esto. Incluso los mejores obtuvieron menos del 50% de las respuestas correctas.
- El Problema: Los modelos de IA son excelentes leyendo texto y excelentes mirando una sola imagen. Pero luchan por conectar los puntos cuando una foto encontrada en medio de una búsqueda necesita cambiar todo el plan de búsqueda. A menudo se quedan atascados buscando texto cuando deberían estar mirando una foto, o tratan la foto solo como una "verificación final" en lugar de una "nueva pista".
El Kit de Herramientas (InterLV-Agente)
Para asegurarse de que todos jugaran bajo las mismas reglas, los autores construyeron un "controlador de juego" estándar llamado InterLV-Agente. Esta herramienta permite a la IA usar un navegador web, buscar imágenes, recortar imágenes y mantener un "cuaderno de notas" (memoria) de lo que ha encontrado hasta ahora. Esto asegura que cuando digamos que una IA falló, sea porque no pudo resolver el rompecabezas, no porque no tuviera las herramientas adecuadas.
Resumen
En términos simples, este artículo dice: "Construimos una nueva prueba más difícil para detectives de IA. Descubrimos que, aunque la IA se está volviendo más inteligente, aún no puede usar eficazmente las imágenes que encuentra durante una búsqueda para cambiar de opinión y encontrar la siguiente pista. Es como un detective que puede leer un mapa y mirar una foto, pero no puede darse cuenta de que la foto en realidad le dice que tome un camino diferente".
Los autores han liberado esta prueba y las herramientas para que otros investigadores intenten construir una IA que sea mejor en este estilo de pensamiento "entrelazado".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.