← Derniers articles
🤖 AI

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite est un prédicteur de regard à double processus, léger et embarqué, qui permet une compréhension de vidéo égocentrée efficace en termes de jetons pour les LLM multimodaux en recadrant précisément la vidéo basée sur le regard prédit, éliminant ainsi le besoin de matériel dédié d'oculométrie tout en maintenant la qualité de description et en opérant en temps réel sur du matériel grand public.

Auteurs originaux : Matteo Stoiber, Niels Buus Lassen

Publié 2026-08-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Matteo Stoiber, Niels Buus Lassen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez porter une paire de lunettes intelligentes capables de regarder le monde à travers vos yeux et de décrire ce que vous faites. Cette technologie promet d'aider un chirurgien à se remémorer une procédure complexe, de guider un mécanicien lors d'une réparation ou d'assister une personne malvoyante en lui racontant son environnement. Pour que cela fonctionne, les lunettes doivent envoyer un flux vidéo à un système d'intelligence artificielle puissant, capable de comprendre les images et le langage. Cependant, il existe un goulot d'étranglement important : l'envoi de vidéos en haute définition nécessite une quantité massive de données, bien plus que ce qu'un petit appareil portable peut facilement transmettre ou traiter. Les systèmes informatiques qui comprennent ces vidéos ont également du mal lorsqu'ils sont alimentés par trop d'informations visuelles à la fois, se sentant souvent submergés par le volume considérable de pixels.

Des chercheurs ont trouvé un moyen ingénieux de résoudre ce problème de données en se concentrant uniquement sur ce que la personne regarde réellement. Au lieu d'envoyer toute la vue large, le système peut recadrer la vidéo pour ne montrer que la petite zone où le regard du porteur est fixé. Cela réduit la quantité de données que l'ordinateur doit traiter d'environ quatre-vingt-dix pour cent, rendant la tâche beaucoup plus rapide et moins coûteuse. Jusqu'à présent, cette approche nécessitait un matériel spécialisé et coûteux intégré aux lunettes pour suivre précisément les mouvements oculaires. Sans ce matériel dédié, le système ne pouvait pas savoir où regarder, laissant le potentiel de ces lunettes intelligentes inexploité pour les consommateurs ordinaires.

Une équipe de chercheurs a maintenant démontré qu'un capteur de suivi oculaire dédié n'est pas réellement nécessaire. Ils ont développé un programme logiciel léger capable de prédire où une personne regarde simplement en analysant le flux vidéo lui-même. Ce programme, appelé EgoGazeLite, s'exécute directement sur un smartphone standard et est suffisamment précis pour remplacer les capteurs matériels coûteux. Les chercheurs ont testé cela en injectant des clips vidéo dans un système d'intelligence artificielle, en les recadrant soit selon les données réelles de suivi oculaire, soit selon la prédiction du logiciel. Ils ont ensuite demandé à l'intelligence artificielle de décrire les actions dans la vidéo. Les résultats ont montré que les descriptions générées à partir du regard prédit étaient pratiquement identiques à celles générées à partir du suivi oculaire réel. Dans chaque cas de test, la prédiction logicielle a fonctionné aussi bien que la mesure matérielle, prouvant que le système peut fonctionner sans le capteur spécialisé.

Le logiciel lui-même est remarquablement efficace. Il est assez petit pour s'exécuter en temps réel sur du matériel grand public, tel que le processeur d'un smartphone moderne, en complétant la prédiction et le recadrage de chaque image vidéo en moins de vingt-deux millisecondes. Cette vitesse est cruciale car elle signifie que le système peut suivre un flux vidéo en direct sans décalage. Les chercheurs ont entraîné ce logiciel sur des milliers d'heures de vidéo de personnes effectuant diverses tâches, allant de la cuisine et la réparation de bicyclettes au jeu de football et la pratique de la RCP. Lorsqu'ils ont testé le système sur de nouvelles vidéos inédites, celui-ci a réussi à identifier avec précision où la personne regardait. Le logiciel fonctionne en apprenant deux manières différentes de prêter attention : l'une basée sur ce qui est visuellement brillant ou en mouvement dans la scène, et une autre basée sur l'endroit où la personne regardait un instant auparavant. Il combine ces deux indices pour deviner le prochain point de focalisation.

Pour s'assurer de la robustesse de leurs conclusions, les chercheurs ne se sont pas appuyés sur une seule méthode d'évaluation. Ils ont utilisé deux grands modèles de langage différents pour générer les descriptions vidéo et ont fait juger ces descriptions par des systèmes de notation automatisés ainsi que par d'autres modèles d'intelligence artificielle avancés. Ils ont comparé la qualité des descriptions issues du regard prédit par rapport à la vérité terrain des capteurs matériels, ainsi que par rapport à une ligne de base simple qui se contentait de recadrer le centre de l'écran. Les résultats étaient clairs : le regard prédit produisait des descriptions nettement meilleures que le recadrage central et statistiquement indiscernables du regard basé sur le matériel. En fait, la prédiction logicielle était si proche des données de suivi oculaire réelles que la différence était trop faible pour être mesurée comme significative dans les dix scénarios de test différents qu'ils ont menés.

Ce travail lève un obstacle majeur à l'adoption généralisée de l'intelligence artificielle sensible au regard. En prouvant qu'un modèle logiciel peut remplacer le capteur matériel, les chercheurs ont montré que les futures lunettes intelligentes n'ont pas besoin d'être encombrées de composants de suivi oculaire coûteux et gourmands en énergie pour être utiles. Le système peut désormais être déployé sur n'importe quel appareil doté d'une caméra et d'un processeur standard, ouvrant la voie à une assistance abordable et en temps réel pour une large gamme d'activités quotidiennes. Bien que l'étude ait été menée sur des ensembles de données et des modèles spécifiques, les résultats suggèrent un changement fondamental dans la manière dont nous pouvons construire ces systèmes, passant d'un matériel spécialisé vers un logiciel intelligent et léger capable de comprendre l'attention humaine simplement en observant ce que nous voyons.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →