← Últimos artículos
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

Este artículo investiga si los modelos de visión y lenguaje exhiben comportamientos de búsqueda visual similares a los humanos utilizando el recuento de tokens de razonamiento como un sustituto del tiempo de reacción, encontrando que, si bien los modelos replican firmas humanas clave como los costos de búsqueda de características planos y los costos de conjunción crecientes, también revelan divergencias cognitivas distintas en las pendientes de presencia de objetivo, la precisión de enumeración y las estrategias de deliberación adaptativa.

Autores originales: Farahnaz Wick

Publicado 2026-06-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Farahnaz Wick

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando una partida de "¿Dónde está Waldo?" en un dibujo abarrotado. Si estás buscando un sombrero rojo en un mar de sombreros azules, tu cerebro lo detecta instantáneamente, sin importar cuántas personas haya en la multitud. Pero si buscas un sombrero que sea rojo y que además tenga forma de estrella (y todos los demás llevan sombreros azules o rojos circulares), tu cerebro tiene que escanear la imagen persona por persona. Cuanta más gente hay, más tiempo tardas en encontrar el objetivo.

Este es el clásico juego de "Búsqueda Visual" que los psicólogos han utilizado durante décadas para comprender cómo funciona la atención humana. Un nuevo artículo plantea una pregunta fascinante: ¿Juegan los modelos de IA este juego de la misma manera que lo hacen los humanos?

Dado que la IA no tiene un latido del corazón ni un cronómetro, el investigador no pudo medir cuánto tiempo "pensó" la IA sobre una imagen. En su lugar, utilizó un trucción ingeniosa: contó el número de "tokens de pensamiento" que la IA generó antes de dar una respuesta. Piensa en estos tokens como el monólogo interno de la IA o sus notas de "borrador".

  • Pocos tokens = La IA echó un vistazo a la imagen y dijo: "Fácil, lo veo". (Reacción rápida).
  • Muchos tokens = La IA escribió una larga lista de razones, revisó la imagen de nuevo y debatió la respuesta. (Reacción lenta y esforzada).

Esto es lo que el estudio descubrió, utilizando analogías sencillas:

1. El "Efecto Pop-Out" vs. "La aguja en un pajar"

Comportamiento Humano: Cuando el objetivo es obvio (un sombrero rojo entre sombreros azules), los humanos lo encuentran al instante. Cuando es difícil (una estrella roja entre círculos rojos), los humanos tardan más a medida que la multitud crece.
Comportamiento de la IA: Los modelos de IA más inteligentes hicieron exactamente lo mismo.

  • Para las tareas fáciles de "pop-out" (destacado inmediato), la IA utilizó una cantidad mínima y constante de tokens de pensamiento, independientemente de cuántos elementos hubiera en la imagen.
  • Para las tareas difíciles de "aguja en un pajar", el recuento de tokens de la IA aumentó a medida que la imagen se volvía más concurrida.
    La Conclusión: La curva de esfuerzo interno de la IA se parece mucho a la curva de tiempo de reacción humana. Esto sugiere que, cuando estas IA están "pensando", en realidad están realizando una búsqueda serial, elemento por elemento, tal como el ojo humano escanea una habitación.

2. La reversión de la "Habitación Vacía"

Comportamiento Humano: Si estás buscando un objeto específico y no está ahí, tienes que revisar a cada una de las personas en la multitud para estar seguro. Esto lleva mucho tiempo. Si el objeto está allí, puedes detenerte en cuanto lo encuentres. Por lo tanto, los humanos trabajan más cuando la respuesta es "No".
Comportamiento de la IA: La IA invirtió este guion. Trabajó más duro cuando la respuesta era "Sí" y encontró el objeto, y trabajó menos cuando la respuesta era "No".
La Conclusión: Parece que la IA tiene una estrategia de "Encuentra uno y luego justifícalo". Una vez que detecta el objetivo, dedica muchos tokens a verificarlo y explicar su hallazgo. Pero si no ve uno inmediatamente, podría simplemente responder "No" rápidamente sin realizar un barrido completo y paciente de toda la imagen.

3. El superpoder de "Contar"

Comportación Humano: Si le pides a un humano que cuente 5 o 6 objetos en una imagen con mucha actividad, a menudo pierde la cuenta o comete errores. Nuestro cerebro se cansa de mantener la cuenta en la cabeza.
Comportamiento de la IA: Los modelos de IA fueron perfectos contando. Incluso en imágenes concurridas con muchos elementos, no perdieron la cuenta.
La Conclusión: En lugar de cansarse y cometer errores como los humanos, la IA simplemente gastó más energía. No falló en la tarea; simplemente la llevó a cabo con un esfuerzo extra de computación. Cambió "esfuerzo" por "precisión".

4. El acertijo de la "Barra Inclinada"

Comportamiento Humano: Los humanos somos excelentes detectando una barra inclinada entre barras verticales rectas (esta "destaca"). Pero somos pésimos detectando una barra recta entre barras inclinadas (esto es difícil).
Comportamiento de la IA: La IA también encontró una dirección más difícil que la otra, pero expresó esta dificultad de manera diferente según el modelo:

  • Modelo A (El Esforzado): Dedicó una cantidad masiva de tokens de pensamiento a la tarea difícil, pero aun así obtuvo la respuesta correcta.
  • Modelo B (El Atajo): No dedicó casi ningún token de pensamiento a la tarea difícil y simplemente obtuvo la respuesta incorrecta (alucinando una barra inclinada que no estaba allí).
    La Conclusión: La misma dificultad visual puede resolverse mediante "trabajar más duro" o "rendirse y adivinar", dependiendo de la "personalidad" específica de la IA.

El Panorama General

El artículo concluye que los modelos de IA modernos han desarrollado una "huella digital" de la búsqueda visual humana. Saben cuándo escanear rápidamente y cuándo escanear lentamente. Sin embargo, no son humanos. No se cansan de la misma manera, no dejan de buscar de forma distinta y manejan las tareas "difíciles" ya sea trabajando duro con esfuerzo extra o fallando espectacularmente.

El investigador argumenta que, al observar cuánto piensa una IA (su recuento de tokens) en lugar de solo qué responde, podemos ver la mecánica oculta de su "visión". Es como escuchar el zumbido de un motor para entender cómo funciona un coche, en lugar de solo mirar a dónde termina su trayecto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →