← Derniers articles
💻 computer science

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

Cet article présente LongEgoRefer, un nouveau benchmark exigeant construit à partir de vidéos Ego4D de longue durée qui traite les limites des ensembles de données actuels de clips courts en présentant une extrême parcimonie de la cible et des interactions complexes, révélant que les modèles de pointe actuels éprouvent des difficultés significatives avec le positionnement spatio-temporel égocentrique de longue durée.

Auteurs originaux : Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

Publié 2026-07-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous portez une caméra sur la tête qui enregistre toute votre journée, du moment où vous vous réveillez jusqu'au moment où vous allez vous coucher. Cela produit un film massif, non édité, d'environ 45 minutes. Maintenant, imaginez que quelqu'un vous donne une phrase spécifique, comme : « Trouve le moment où tu prends le mug bleu avec l'éclat sur l'anse et où tu y verses du café. »

Votre tâche est de regarder ce film de 45 minutes et de localiser précisément quand cela se produit et se trouve le mug dans le cadre.

C'est le défi que présente l'article « LongEgoRefer ». Voici une décomposition de ce qu'ils ont fait, en utilisant des analogies simples :

1. Le Problème : L'aiguille dans une botte de foin

Les jeux vidéo précédents pour l'IA étaient comme chercher une aiguille dans un petit tas de foin. Ils utilisaient de courts clips vidéo (de quelques secondes) où l'objet était toujours visible, comme une balle rouge brillante rebondissant dans une pièce.

Mais la vraie vie ne ressemble pas à cela. Dans la vraie vie, l'« aiguille » que vous cherchez peut n'apparaître que pendant quelques secondes dans un film de 45 minutes. Elle peut être cachée derrière votre main, ou vous ne la touchez qu'une seule fois avant de la ranger. L'article soutient que les modèles d'IA actuels sont médiocres à cela car ils sont habitués à des clips courts et faciles. Ils se perdent dans le long film et oublient ce qu'ils cherchent.

2. La Solution : Un nouvel « examen » pour l'IA

Les auteurs ont créé un nouveau benchmark appelé LongEgoRefer. Considérez cela comme un nouvel examen final, beaucoup plus difficile, pour les modèles d'IA.

  • La Source : Ils ont pris des milliers d'heures de vidéos de la « vie réelle en première personne » (issues d'un ensemble de données appelé Ego4D) où des gens effectuent des tâches quotidiennes.
  • Les Questions : Ils ont écrit 1 498 questions spécifiques (appelées « expressions de référence »). Celles-ci ne sont pas simples comme « Où est la tasse ? » Elles sont des histoires complexes comme : « La carafe en verre transparent, qui était vide sur la balance, a ensuite été remplie de grains sombres provenant d'un sac argenté. »
  • La Difficulté :
    • Temps : Les vidéos sont énormes (moyenne de 45 minutes).
    • Rareté : L'objet dont on parle peut n'apparaître que pendant 1 % de la vidéo. C'est comme demander à quelqu'un de trouver une conversation de 10 secondes spécifiques dans une émission de radio de 45 minutes.
    • Complexité : Les descriptions nécessitent de comprendre comment les objets bougent et interagissent avec les mains, pas seulement ce à quoi ils ressemblent.

3. Le Test : Comment l'IA s'en est-elle sortie ?

Les auteurs ont testé les modèles d'IA les plus intelligents disponibles (y compris des géants comme GPT-5 et Gemini) sur ce nouvel examen.

  • Le Résultat : Les modèles d'IA ont énormément lutté. Même les modèles les plus avancés ont obtenu des scores très bas.
  • L'Analogie : C'est comme donner à un étudiant un test de mathématiques où il doit se souvenir d'un nombre spécifique d'un livre qu'il a lu il y a 40 minutes, alors que le livre tourne sans cesse les pages. La plupart des modèles se sont perdus au milieu du livre.
  • Le Gagnant : Le modèle nommé GPT-5 a le mieux performé, mais même lui n'a obtenu qu'environ 16 % des détails « spatio-temporels » (temps et lieu) corrects. Cela prouve que la tâche est incroyablement difficile, même pour la meilleure technologie que nous ayons actuellement.

4. Pourquoi ont-ils échoué ?

L'article a trouvé deux raisons principales pour lesquelles l'IA a échoué :

  1. Perte de mémoire : Les modèles n'ont pas pu garder la trace de toute l'histoire de 45 minutes. Ils ont oublié l'apparence de l'objet lorsqu'ils sont arrivés à la fin de la vidéo.
  2. Le piège du « Quand » vs « Où » : L'IA doit d'abord déterminer quand l'événement se produit, puis se trouve l'objet. Si l'IA se trompe de moment (par exemple, « cela s'est passé à la minute 10 » alors qu'en réalité cela s'est passé à la minute 30), elle échoue complètement, même si elle sait à quoi ressemble l'objet. C'est comme essayer de trouver une page spécifique dans un livre mais commencer sa recherche dans le mauvais chapitre.

5. La Conclusion

L'article conclut que nous avons besoin d'une nouvelle génération d'IA capable de véritablement « regarder » de longues vidéos sans se perdre ou oublier des détails. Ils ont publié ce nouvel « examen » (le benchmark) ainsi que le code afin que d'autres chercheurs puissent essayer de construire de meilleurs modèles pour résoudre ce problème de l'« aiguille dans une botte de foin ».

En bref : Ils ont construit un test super difficile utilisant de longues vidéos de la vie réelle pour montrer que l'IA d'aujourd'hui est encore incapable de trouver des moments spécifiques et rares dans de longs flux vidéo, et ils lancent un défi au monde pour le résoudre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →