← Derniers articles
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL établit un nouveau état de l'art en prédiction de parcours de regard visuel en reformulant la tâche comme une génération de jetons autorégressive au sein d'un modèle vision-langage, permettant un conditionnement flexible sur l'identité du spectateur et les tâches tout en réalisant des gains de performance significatifs et en facilitant des simulations comportementales in-silico contrôlées.

Auteurs originaux : Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Publié 2026-07-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez essayer de prédire où les yeux d'une personne se porteront ensuite lorsqu'elle voit une image. Pendant longtemps, les scientifiques ont construit des machines spéciales et rigides uniquement pour cette tâche. Ces machines avaient des règles fixes (comme « les gens regardent toujours le centre en premier ») et ne pouvaient pas facilement apprendre de nouveaux tours, comme « cette personne est un médecin cherchant un diagnostic » ou « cette personne est un enfant cherchant un jouet ».

Le document présente un nouveau modèle appelé DeepGaze3.5-VL qui change la donne. Au lieu de construire une machine spéciale, les auteurs traitent les mouvements oculaires comme l'écriture d'une histoire.

Voici la décomposition de son fonctionnement et de ce qu'ils ont découvert, en utilisant des analogies simples :

1. L'idée centrale : Les mouvements oculaires comme une histoire de « texte »

Considérez le chemin parcouru par les yeux d'une personne (appelé scanpath) comme une phrase.

  • L'ancienne méthode : Vous construisiez un robot sur mesure pour dessiner la phrase, mais si vous vouliez changer de style (par exemple, passer de l'écriture d'un enfant à celle d'un adulte), vous deviez reconstruire le robot.
  • La nouvelle méthode : Les auteurs ont réalisé que les mouvements oculaires sont simplement une séquence de coordonnées (comme « regarder ici, puis regarder là »). Ils ont appris à un immense IA pré-entraîné (un Grand Modèle Vision-Langage) à traiter ces coordonnées comme des mots dans une phrase.

En transformant les positions oculaires en « tokens » (comme les lettres d'un mot), l'IA peut utiliser son cerveau gigantesque — déjà entraîné à comprendre les images et le langage — pour prédire le prochain « mot » (le prochain endroit où l'œil regardera).

2. La « magie » du prompt

Parce que ce modèle pense en termes de langage, vous pouvez lui donner des instructions exactement comme vous le feriez avec un chatbot.

  • L'analogie : Imaginez un guide touristique. Si vous dites au guide : « Montrez-moi le musée comme un touriste », il vous montrera les statues célèbres. Si vous dites : « Montrez-le-moi comme un historien de l'art », il pointera du doigt les coups de pinceau.
  • Le résultat : Les chercheurs ont montré qu'en changeant simplement le prompt textuel (par exemple, « Prédisez le regard d'une personne cherchant un chat » contre « Prédisez le regard d'une personne qui regarde simplement autour d'elle »), le modèle s'adapte instantanément. Il n'a pas besoin de nouveau matériel ou de changements de code complexes ; il lit simplement l'instruction.

3. Pourquoi est-ce meilleur : Le débat « Intelligent » vs « Grand »

Les chercheurs se sont demandé : Ce modèle est-il bon simplement parce qu'il est énorme, ou parce qu'il comprend réellement la scène ?

  • Le test : Ils ont comparé leur modèle à d'autres modèles de pointe qui utilisaient les mêmes « yeux » (encodeur de vision) mais des « cerveaux » différents.
  • La conclusion : Le « cerveau » (la partie linguistique de l'IA) compte plus que le simple fait d'avoir de plus grands « yeux ». Un modèle qui comprend le sens de l'image et l'histoire du mouvement oculaire est bien plus performant qu'un modèle qui voit seulement des pixels.
  • Le score : Sur un test standard (MIT1003), leur modèle a amélioré la précision de la prédiction de 46 % par rapport à la meilleure méthode précédente.

4. L'expérience de la « Machine à remonter le temps » (Interventions)

L'une des choses les plus cool que ce papier démontre est la capacité de faire tourner des scénarios de type « et si » (what-if) à l'intérieur de l'ordinateur, sans avoir besoin de vrais humains.

  • L'analogie : Imaginez un jeu vidéo où vous pouvez mettre le temps en pause, changer une variable (comme « le joueur était fatigué ») et voir instantanément comment le jeu se déroule différemment.
  • L'expérience : Les chercheurs ont pris un moment spécifique où un humain a regardé une image pendant une courte durée (50 ms) et ont demandé au modèle : « Et s'ils avaient regardé pendant une longue durée (600 ms) ? »
  • Le résultat : Le modèle a prédit que les regards courts ont tendance à être des coups d'œil rapides, instinctifs (comme un réflexe), tandis que les regards longs mènent à une exploration plus errante et réfléchie. Le modèle a compris ces comportements humains complexes uniquement en lisant les données, agissant comme un bac à sable numérique pour la vision humaine.

5. Le facteur « Qui » (Personnalisation)

Le modèle peut également être informé de qui regarde.

  • L'analogie : Si vous savez que votre ami adore les chiens, et que vous lui montrez une photo d'un parc, vous savez qu'il regardera le chien en premier. Si vous montrez la même photo à quelqu'un qui aime les oiseaux, il regardera l'arbre.
  • Le résultat : En injectant un « Subject ID » spécifique (comme « Subject A3F8 »), le modèle a appris à prédire les habitudes uniques de cette personne précise. Il n'avait pas besoin d'une nouvelle architecture ; il a simplement appris que différents « personnages » ont des « histoires » différentes.

Résumé

DeepGaze3.5-VL est une nouvelle façon de prédire où les humains regardent. Au lieu de construire des outils rigides et spécialisés, les auteurs ont transformé l'eye-tracking en un problème de langage. En faisant cela, ils ont créé un modèle qui est :

  1. Plus intelligent : Il comprend le contexte et le sens de la scène.
  2. Flexible : Vous pouvez changer son comportement en tapant simplement une nouvelle instruction.
  3. Précis : Il bat tous les records précédents par une marge considérable.
  4. Expérimental : Il permet aux scientifiques de simuler des scénarios de type « et si » concernant la vision humaine instantanément, sans avoir besoin de mener de nouvelles expériences physiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →