← Derniers articles
🤖 AI

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

Cet article révèle que les Video-LLM actuels échouent largement à suivre véritablement des personnages spécifiques dans des vidéos de longue durée, s'appuyant plutôt sur des indices de genre superficiels et échouant à distinguer des individus de même genre, ce qui fait que les scores de référence surestiment leurs réelles capacités de raisonnement temporel et de suivi d'identité.

Auteurs originaux : Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

Publié 2026-07-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez engagé un robot détective super intelligent, doté de 7 à 8 milliards de paramètres, pour surveiller un épisode entier de The Big Bang Theory. Votre mission pour le robot est simple : « Regarde Sheldon, et dis-moi l'ordre exact dans lequel ses tenues changent. »

Vous vous attendriez à ce que le robot soit comme un faucon, verrouillant le visage de Sheldon, le suivant à travers chaque scène et notant ses changements de garde-robe avec une précision parfaite. Mais voici le rebondissement : le robot ne regarde pas réellement Sheldon. Il se contente de deviner en utilisant un raccourci très paresseux.

Le grand échange de « Sheldon »

Pour comprendre ce qui se passait, les chercheurs ont utilisé un tour de passe-passe ingénieux. Ils ont pris exactement la même vidéo et les mêmes réponses à choix multiples, mais ils ont simplement changé le nom dans la question.

  • Question originale : « Dans quel ordre Sheldon change-t-il de tenue ? »
  • L'échange : « Dans quel ordre Leonard change-t-il de tenue ? » (Même vidéo, mêmes réponses).

Si le robot suivait réellement les personnages, il aurait dû dire : « Attendez, Leonard porte des vêtements différents de ceux de Sheldon ! » et choisir une autre réponse. Mais devinez quoi ? Le robot s'en fichait.

Dans environ 7 % à 17 % des échanges de même genre (comme remplacer Sheldon par Leonard), le robot a changé sa réponse. C'est à peine mieux que de jouer aux dés. Il ignorait principalement le nom et choisissait simplement une réponse qui lui plaisait.

Le bug du « Genre »

Alors, s'il ne regarde pas la personne, que regarde-t-il ? Les chercheurs ont découvert que le robot utilisait un filtre très grossier et flou : le genre.

Lorsqu'ils remplaçaient un personnage masculin par un personnage féminin (comme Sheldon par Penny), le robot changeait sa réponse beaucoup plus souvent (20 % à 43 % du temps). Il semblait penser : « Oh, la question est passée d'un "mec" à une "fille", donc les vêtements doivent être différents ! »

Mais si vous remplaciez un gars par un autre gars, le robot était complètement perdu. Il ne pouvait pas distinguer Sheldon de Howard mieux qu'il ne distinguait un chat d'un chien. Il voyait « mâle » et « femelle », mais il ne voyait pas « Sheldon ».

L'illusion de la « boîte magique »

L'article a également vérifié si le robot trichait en mémorisant la série grâce à ses données d'entraînement (comme s'il avait lu le script au préalable). Ils ont testé cela en montrant au robot uniquement le texte de la question et le titre de la série, sans aucune vidéo. Le robot obtenait un score proche du hasard (environ 18–20 %). Il ne trichait donc pas avec un script ; il était simplement mauvais dans la partie visuelle.

Ils ont aussi essayé de donner plus d'images au robot (plus de « clichés » de la vidéo) pour voir s'il avait juste besoin de plus de visibilité. Donner 32 images au lieu de 16 le rendait légèrement meilleur pour repérer les vêtements en général, mais cela ne l'aidait toujours pas à mieux suivre un personnage spécifique. C'était comme donner de meilleures lunettes à un aveugle : il voit mieux les vêtements, mais il ne sait toujours pas qui les porte.

Le piège du choix multiple

Voici la partie la plus surprenante : le robot obtenait 37–38 % de bonnes réponses lors du test standard. Cela semble impressionnant ! Mais ce score était un mirage.

Lorsque les chercheurs ont demandé au robot d'écrire la réponse avec ses propres mots (format ouvert) plutôt que de choisir dans une liste (choix multiple), le score a chuté de 18 à 25 points.

  • Score en choix multiple : ~38 %
  • Score en format ouvert : ~13–19 %

Pourquoi cette chute ? Parce que le test à choix multiple offrait au robot une « boîte magique » de cinq options. Même si le robot se contentait de deviner ou de choisir l'option qu'il préférait (comme « E » ou « A »), il avait une chance sur cinq d'avoir raison. Lorsqu'on le forçait à générer la réponse de zéro, il n'avait plus de filet de sécurité, et il échouait complètement. En fait, zéro des 151 réponses ouvertes des robots en open-source n'étaient entièrement correctes.

Le mot de la fin

L'article conclut que ces modèles de type Video-LLM ne sont pas réellement en train de suivre des personnages. Ils « hallucinent » un lien entre le nom et la vidéo. Ils sont capables de repérer qu'« une personne porte une chemise », mais ils sont terribles pour répondre à la question « Quel personnage ? ».

Les chercheurs suggèrent que les scores élevés actuels sur les benchmarks sont trompeurs. Ils mesurent la capacité des modèles à deviner en se basant sur des indices de genre ou des coups de chance dans les choix multiples, et non leur capacité à réellement suivre une histoire. Tant qu'un modèle ne peut pas réussir le test de « l'échange de nom » et le test du « format ouvert », nous ne pouvons pas dire qu'il « regarde » vraiment la vidéo.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →