From Web to Pixels: Bringing Agentic Search into Visual Perception
Este artículo introduce "Perception Deep Research", un nuevo desafío de percepción visual en mundo abierto donde los objetos deben identificarse mediante conocimiento externo antes de su localización, y lo aborda con el benchmark WebEye y el marco de agentes Pixel-Searcher, que demuestra un rendimiento de vanguardia de código abierto en anclaje basado en búsqueda, segmentación y VQA.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás jugando a "¿Dónde está Waldo?" (o "¿Dónde está Wally?"), pero con un giro.
En el juego clásico, miras una imagen abarrotada y encuentras a Waldo basándote en su apariencia: una camisa a rayas rojas y blancas, un sombrero y gafas. No necesitas saber quién es Waldo; solo necesitas detectar el patrón visual.
Este artículo argumenta que la mayoría de los sistemas actuales de visión por IA están atrapados jugando el juego clásico. Son excelentes encontrando cosas que parecen un "coche rojo" o una "persona con una camisa azul". Pero tienen dificultades cuando la pregunta no se refiere a cómo algo se ve, sino a quién es, basándose en hechos que no puedes ver en la imagen.
El Nuevo Desafío: "El Invitado Misterioso"
Los autores introducen una versión nueva y más difícil del juego llamada Investigación Profunda de la Percepción.
Imagina una foto de una fiesta concurrida. La pregunta no es "Encuentra a la persona con la camisa roja". En cambio, la pregunta es:
"Encuentra a la persona que se convirtió en embajadora global de una marca de cuidado de la piel en enero de 2026, después de que esa marca fuera comprada por una empresa por 2.700 millones de dólares".
No puedes resolver esto solo mirando la foto. La foto no muestra la etiqueta de precio de la adquisición ni la fecha del anuncio del embajador. Para encontrar a la persona correcta, la IA debe:
- Ir a una Cacería Web: Buscar en internet para descubrir qué marca fue comprada, en qué mes y quién era el embajador.
- Resolver el Misterio: Darse cuenta: "Ah, la persona en la foto llamada 'Winter' es la que estamos buscando".
- Señalar el Píxel: Finalmente, volver a la foto y dibujar un recuadro alrededor de Winter.
El artículo llama a esto "De la Web a los Píxeles". Se trata de conectar hechos de internet con puntos específicos en una imagen.
Las Herramientas que Construyeron
Para probar si la IA puede hacer esto, el equipo construyó dos cosas principales:
1. WebEyes (El Curso de Pruebas)
Piensa en esto como un circuito de obstáculos especializado para la IA. Contiene 120 imágenes complejas y cientos de preguntas difíciles.
- El Giro: Cada pregunta requiere que la IA busque hechos ocultos (como el papel reciente de una celebridad, la fecha de lanzamiento de un producto o la historia de fondo de un personaje) antes de poder siquiera adivinar dónde mirar en la imagen.
- El Objetivo: La IA no solo debe responder la pregunta; debe señalar a la persona u objeto exacto en la imagen que coincide con la respuesta.
2. Pixel-Searcher (El Detective Inteligente)
Este es el nuevo agente de IA que los autores crearon para realizar la prueba. En lugar de solo mirar la imagen y adivinar, Pixel-Searcher actúa como un detective con una lupa y una computadora portátil.
- Paso 1: La Búsqueda. Descompone la pregunta. "¿Quién era el embajador?" "¿Cuándo se cerró el trato?" Busca en la web y lee los resultados.
- Paso 2: La Deducción. Conecta los puntos. "Bien, el trato ocurrió en enero y el embajador es Winter".
- Paso 3: La Cacería. Vuelve a la imagen. Busca a una persona que se parezca a Winter (quizás verificando ropa o características específicas mencionadas en la búsqueda) y dibuja un recuadro alrededor de ella.
Lo que Descubrieron
Los investigadores probaron a Pixel-Searcher contra otros modelos de IA inteligentes. Aquí está el veredicto:
- Modelos de IA Antiguos: Cuando se enfrentaron a estas preguntas de "Invitado Misterioso", los modelos de IA estándar se confundieron. Intentaron adivinar basándose solo en lo que veían en la imagen o en lo que ya "sabían" de su entrenamiento. A menudo elegían a la persona equivocada porque no podían encontrar los hechos ocultos.
- Pixel-Searcher: Este nuevo agente tuvo el mejor rendimiento entre los modelos de código abierto. Al buscar realmente en la web y razonar a través de las pistas, encontró los objetivos correctos con mucha más frecuencia.
Donde aún tiene dificultades:
El artículo señala que la IA no falla porque no pueda dibujar un recuadro perfecto alrededor de una persona. Falla antes en el proceso:
- Búsqueda Deficiente: A veces busca lo incorrecto o pasa por alto un hecho clave.
- Identidad Incorrecta: Descubre los hechos correctos pero elige a la persona equivocada en la foto (por ejemplo, sabe que el embajador es "Winter", pero señala a la persona equivocada llamada Winter).
- Vinculación: Le cuesta conectar el "hecho" (Winter) con lo "visual" (la persona en la foto).
El Panorama General
El artículo concluye que para que la IA comprenda verdaderamente el mundo, no puede ser solo una "cámara" que ve formas. Necesita ser un "investigador" que pueda buscar información, resolver acertijos y luego usar ese conocimiento para señalar lo correcto en una imagen. Llaman a este nuevo campo Investigación Profunda de la Percepción, y han proporcionado las herramientas (WebEyes y Pixel-Searcher) para ayudar a otros científicos a construir mejores IAs "detectives".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.