← Derniers articles
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

Cet article examine si les modèles vision-langage présentent des comportements de recherche visuelle semblables à ceux de l'humain en utilisant le nombre de jetons de raisonnement comme un substitut du temps de réaction, constatant que, bien que les modèles reproduisent des signatures humaines clés telles que les coûts de recherche de caractéristiques plats et les coûts de conjonction croissants, ils révèlent également des divergences cognitives distinctes dans les pentes de présence de la cible, la précision de l'énumération et les stratégies de délibération adaptative.

Auteurs originaux : Farahnaz Wick

Publié 2026-06-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Farahnaz Wick

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous jouez à une partie de « Où est Charlie ? » dans une image bondée. Si vous cherchez un chapeau rouge au milieu d'une mer de chapeaux bleus, votre cerveau le repère instantanément, peu importe le nombre de personnes dans la foule. Mais si vous cherchez un chapeau rouge qui a aussi la forme d'une étoile (alors que tous les autres portent des chapeaux bleus ou des cercles rouges), votre cerveau doit scanner l'image personne par personne. Plus il y a de gens, plus cela prend de temps pour vous trouver la cible.

C'est le jeu classique de la « recherche visuelle » que les psychologues utilisent depuis des décennies pour comprendre comment fonctionne l'attention humaine. Un nouvel article pose une question fascinante : les modèles d'IA jouent-ils à ce jeu de la même manière que les humains ?

Comme l'IA n'a ni rythme cardiaque ni chronomètre, le chercheur n'a pas pu mesurer le temps de « réflexion » de l'IA sur une image. Au lieu de cela, il a utilisé une astuce ingénieuse : il a compté le nombre de « jetons de pensée » (thinking tokens) générés par l'IA avant de donner une réponse. Considérez ces jetons comme le monologue intérieur de l'IA ou ses notes de « brouillon ».

  • Peu de jetons = L'IA a jeté un coup d'œil à l'image et a dit : « Facile, je vois. » (Réaction rapide).
  • Beaucoup de jetons = L'IA a écrit une longue liste de raisons, a revérifié l'image et a débattu de la réponse. (Réaction lente, laborieuse).

Voici ce que l'étude a révélé, en utilisant des analogies simples :

1. Le « Pop-out » vs la « Aiguille dans une botte de foin »

Comportement humain : Lorsque la cible est évidente (un chapeau rouge parmi des chapeaux bleus), les humains la trouvent instantanément. Lorsqu'elle est difficile (un chapeau rouge en forme d'étoile parmi des cercles rouges), les humains mettent plus de temps à mesure que la foule s'agrandit.
Comportement de l'IA : Les modèles d'IA les plus intelligents ont fait exactement la même chose.

  • Pour les tâches faciles de type « pop-out », l'IA a utilisé une quantité infime et constante de jetons de pensée, quel que soit le nombre d'objets dans l'image.
  • Pour les tâches difficiles de type « aiguille dans une botte de foin », le nombre de jetons de l'IA augmentait à mesure que l'image devenait plus encombrée.
    La leçon : La courbe d'effort interne de l'IA ressemble exactement à la courbe du temps de réaction humaine. Cela suggère que lorsque ces IA sont en train de « réfléchir », elles effectuent réellement une recherche sérielle, objet par objet, tout comme l'œil humain qui balaie une pièce.

2. L'inversion de la « Pièce vide »

Comportement humain : Si vous cherchez un objet spécifique et qu'il n'est pas là, vous devez vérifier chaque personne dans la foule pour en être sûr. Cela prend beaucoup de temps. Si l'objet est présent, vous pouvez vous arrêter dès que vous le trouvez. Ainsi, les humains travaillent plus dur quand la réponse est « Non ».
Comportement de l'IA : L'IA a inversé ce scénario. Elle a travaillé plus dur quand la réponse était « Oui » et qu'elle trouvait l'objet, et elle a travaillé moins quand la réponse était « Non ».
La leçon : Il semble que l'IA ait une stratégie de « Trouver un, puis justifier ». Une fois qu'elle repère la cible, elle consacre beaucoup de jetons à revérifier et à expliquer sa découverte. Mais si elle ne voit rien immédiatement, elle peut simplement répondre « Non » rapidement sans effectuer un balayage complet et patient de toute l'image.

3. Le super-pouvoir du « Comptage »

Comportement humain : Si vous demandez à un humain de compter 5 ou 6 objets dans une image chargée, il perd souvent le fil ou fait des erreurs. Notre cerveau se fatigue de maintenir le compte en mémoire.
Comportement de l'IA : Les modèles d'IA étaient parfaits pour compter. Même dans des images encombrées avec de nombreux objets, ils ne perdaient pas le compte.
La leçon : Au lieu de se fatiguer et de commettre des erreurs comme les humains, l'IA a simplement dépensé plus d'énergie. Elle n'a pas lâché le morceau ; elle a simplement mené la tâche à bien avec une puissance de calcul supplémentaire. Elle a échangé de l'« effort » contre de la précision.

4. L'énigme de la « Barre inclinée »

Comportement humain : Les humains sont très doués pour repérer une barre inclinée parmi des barres verticales droites (elle « ressort »). Mais nous sommes très mauvais pour repérer une barre droite parmi des barres inclinées (c'est difficile).
Comportement de l'IA : L'IA a également trouvé une direction plus difficile que l'autre, mais elle a exprimé cette difficulté différemment selon le modèle :

  • Modèle A (Le travailleur acharné) : A consacré un nombre massif de jetons de pensée à la tâche difficile mais a quand même donné la bonne réponse.
  • Modèle B (Le raccourci) : N'a dépensé presque aucun jeton de pensée pour la tâche difficile et a simplement donné la mauvaise réponse (hallucinant une barre inclinée qui n'existait pas).
    La leçon : La même difficulté visuelle peut être résolue en « travaillant plus dur » ou en « abandonnant et en devinant », selon la « personnalité » de l'IA spécifique.

La vue d'ensemble

L'article conclut que les modèles d'IA modernes ont développé une « empreinte digitale » de la recherche visuelle humaine. Ils savent quand scanner rapidement et quand scanner lentement. Cependant, ils ne sont pas humains. Ils ne se fatiguent pas de la même manière, ils arrêtent de chercher différemment, et ils gèrent les tâches « difficiles » soit en s'acharnant avec un effort supplémentaire, soit en échouant de manière spectaculaire.

Le chercheur soutient qu'en observant combien une IA pense (son nombre de jetons) plutôt que simplement ce qu'elle répond, nous pouvons voir les mécanismes cachés de sa « vision ». C'est comme écouter le ronronnement d'un moteur pour comprendre comment fonctionne une voiture, plutôt que de simplement regarder où elle finit par arriver.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →