← Derniers articles
💻 computer science

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

Cet article présente Gazette, un nouveau cadre qui exploite les grands modèles de langage multimodaux et des transcriptions synthétiques de « pensée à voix haute » pour décoder les parcours oculaires humains en descriptions en langage naturel libre de buts, allant au-delà du décodage catégoriel traditionnel pour capturer les nuances ouvertes des intentions humaines.

Auteurs originaux : Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

Publié 2026-07-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vos yeux soient comme le faisceau d'une lampe de poche dans une pièce sombre. Quand vous regardez quelque chose, ce faisceau ne reste pas immobile ; il s'agite, se posant sur différents points pendant de minuscules fractions de seconde. Ce motif de mouvement est appelé un « scanpath » (chemin de balayage). Pendant longtemps, les scientifiques ont essayé de deviner ce que vous pensez simplement en observant où votre faisceau de lampe de poche se pose. Habituellement, ils traitaient cela comme un questionnaire à choix multiples. Ils demandaient : « La personne cherche-t-elle un chat ou un chien ? » et l'ordinateur choisissait une réponse parmi une liste fixe. Mais les pensées humaines sont désordonnées et créatives. Parfois, vous ne cherchez pas seulement un « chien » ; vous cherchez « le golden retriever ébouriffé portant un bandana rouge qui se cache derrière le canapé ». L'ancienne façon de poser des questions était trop simple pour capturer ce genre de détails. C'est là qu'intervient un nouveau domaine appelé le « décodage du regard » (gaze decoding), qui tente de traduire ces mouvements oculaires en les récits riches et ouverts qui se déroulent dans nos têtes.

Entrez dans un nouvel article de recherche qui introduit une nouvelle façon ingénieuse de résoudre ce casse-tête. Les auteurs, travaillant à l'Université de Stony Brook et à l'Université d'Adélaïde, ont construit un système appelé Gazette. Au lieu de forcer l'ordinateur à choisir dans une liste à choix multiples, Gazette est conçu pour écrire une histoire libre sur ce qu'une personne cherche, en utilisant le langage naturel comme le ferait un humain. Considérez cela comme une mise à niveau, passant d'une liste de contrôle rigide à un écrivain créatif capable de décrire exactement ce que vous voyez.

Le gros problème auquel les chercheurs ont été confrontés est que les yeux de chacun bougent un peu différemment, même lorsqu'ils cherchent la même chose. Si dix personnes doivent trouver une « voiture rouge », dix personnes différentes pourraient regarder la voiture de dix manières légèrement différentes. Certains pourraient regarder les roues d'abord, d'autres les fenêtres. Si vous montrez simplement à un ordinateur les mouvements oculaires d'une seule personne, il est confus par toutes ces habitudes personnelles. C'est comme essayer de deviner une chanson en écoutant une personne fredonner faux ; vous entendez peut-être l'air, mais le bruit rend difficile d'en être certain.

Pour corriger cela, l'équipe a trouvé une astuce intelligente impliquant une stratégie de « pensée à voix haute » (think-aloud). Ils ont réalisé que si les mouvements oculaires de chacun sont uniques, la raison de leurs mouvements est la même. Ainsi, ils ont utilisé une IA puissante (GPT-4) pour observer les mouvements oculaires de nombreuses personnes différentes essayant toutes de trouver le même objet. L'IA a agi comme un détective, ignorant les particularités individuelles pour trouver le motif commun — la « recette secrète » de la façon dont les humains cherchent cet objet spécifique. L'IA a ensuite écrit une « transcription de pensée à voix haute », qui est essentiellement une histoire expliquant la stratégie : « D'abord, regardez les formes imposantes, puis zoomez sur les parties rouges. »

Ils ont appris à leur nouveau modèle, Gazette, à lire ces histoires générées par l'IA en même temps que les mouvements oculaires. Cela a aidé le modèle à apprendre à séparer l'« objectif » (ce que la personne cherche) du « bruit » (la façon unique de regarder de la personne). Lorsqu'ils l'ont testé, Gazette était bien meilleur pour deviner l'objectif que les méthodes précédentes. Par exemple, lorsqu'on lui demandait de trouver une voiture spécifique dans une image, Gazette ne disait pas seulement « voiture ». Il pouvait dire : « La voiture noire dans le coin supérieur droit », et il le faisait avec une grande précision, même lorsque la tâche était difficile.

L'article montre qu'en apprenant à l'ordinateur à comprendre la stratégie derrière les mouvements oculaires, plutôt que de simples mouvements eux-mêmes, nous pouvons décoder les intentions humaines avec beaucoup plus de détails. Bien que le système fonctionne mieux lorsque les gens sont d'accord sur ce qu'ils cherchent (comme trouver un objet spécifique), cela suggère que nous nous rapprochons d'un futur où les ordinateurs pourront comprendre nos objectifs simplement en observant où nous regardons, ouvrant la voie à de meilleures technologies d'assistance et à une compréhension plus profonde de la façon dont nous interagissons avec le monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →