← Derniers articles
💻 computer science

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs

Ce papier présente VidHal, un benchmark conçu pour évaluer les hallucinations temporelles dans les modèles de langage visuel (VLLM) en proposant une tâche de classement de légendes afin de mesurer la finesse des erreurs générées par ces modèles face aux dynamiques spatio-temporelles des vidéos.

Auteurs originaux : Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

Publié 2026-04-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🎬 VidHal : Le "Test de Vérité" pour les Films des Robots

Imaginez que vous avez un ami très intelligent, mais un peu rêveur. Il a lu des millions de livres et vu des milliards de photos. Quand vous lui montrez une photo, il décrit ce qu'il voit avec une précision incroyable. Mais si vous lui montrez une vidéo (une histoire qui bouge dans le temps), il commence à inventer des détails. Il vous dit que le chien a couru vers la gauche alors qu'il est allé vers la droite, ou que la voiture a fait demi-tour alors qu'elle est restée droite.

C'est ce qu'on appelle une hallucination : le robot "voit" des choses qui n'existent pas ou les interprète mal, même si sa réponse semble logique.

Jusqu'à présent, les chercheurs savaient que ces robots (appelés VLLM ou Modèles de Langage Visuel) avaient ce problème avec les images fixes. Mais personne n'avait vraiment mesuré à quel point ils se trompaient sur les vidéos, où le temps et le mouvement sont cruciaux.

C'est là qu'intervient VidHal.

1. Le Problème : Le Robot qui Raconte des Histoires

Les vidéos sont comme des films. Elles ont une chronologie (d'abord ça, puis ça), des directions (gauche, droite, haut, bas) et des changements d'état (une pomme qui pourrit, une personne qui se lève).

Les chercheurs ont découvert que les robots actuels sont comme des spectateurs de cinéma un peu distraits :

  • Ils confondent l'ordre des scènes (ils pensent que la fin est au début).
  • Ils se trompent sur la direction (ils disent "vers la droite" alors que c'est "vers la gauche").
  • Ils inventent des actions qui n'ont jamais eu lieu.

Le problème, c'est que les anciens tests étaient trop simples. Ils demandaient au robot : "Est-ce que le chien est rouge ?" (Oui/Non). Si le robot disait "Non" alors qu'il était rouge, on savait qu'il avait halluciné. Mais ces tests ne pouvaient pas attraper les erreurs subtiles, comme dire que le chien était "orange" au lieu de "rouge".

2. La Solution : VidHal, le Grand Jeu de l'Ordre

Pour résoudre ce problème, les chercheurs de l'Université Nationale de Singapour ont créé VidHal.

Imaginez VidHal comme un jeu de tri de cartes très sophistiqué :

  • Le Déroulement : On montre une vidéo au robot.
  • Les Cartes : On lui donne trois descriptions (des "captions") de cette vidéo.
    • La carte A est la description parfaite (la vérité).
    • La carte B est une description avec une petite erreur (une "demi-hallucination").
    • La carte C est une description complètement fausse (une "grosse hallucination").
  • Le Défi : Au lieu de juste dire "A est vrai", on demande au robot : "Mets ces trois cartes dans l'ordre, de la plus vraie à la plus fausse."

C'est comme demander à un critique de cinéma de classer trois résumés d'un film : lequel est exact, lequel a un petit détail faux, et lequel est un conte de fées ?

3. Ce que VidHal a révélé (Les Résultats)

Les chercheurs ont testé 23 robots différents (des modèles open-source comme LLaVA ou Qwen, et des géants privés comme GPT-4 ou Gemini).

Voici ce qu'ils ont découvert, avec une analogie simple :

  • Les robots sont forts sur les objets statiques : Si on leur demande de reconnaître un "chat" ou une "chaise", ils sont excellents. C'est comme si le robot avait une très bonne mémoire pour les photos.
  • Les robots sont faibles sur le temps et le mouvement : Dès qu'il faut comprendre l'ordre des événements ou la direction d'un mouvement, ils commencent à bégayer.
    • Analogie : Imaginez un photographe talentueux qui devient un mauvais réalisateur. Il voit très bien chaque image, mais il ne comprend pas comment les images s'enchaînent pour raconter une histoire cohérente.
  • La taille ne fait pas tout : Parfois, un petit robot (7 milliards de "cerveaux") est plus intelligent qu'un géant (72 milliards) pour éviter ces erreurs, à condition qu'il ait été entraîné spécifiquement pour comprendre le temps.

4. Pourquoi est-ce important ?

Aujourd'hui, nous voulons utiliser ces robots pour des choses sérieuses :

  • Aider les médecins à analyser des vidéos d'opérations.
  • Surveiller la sécurité dans les usines.
  • Décrire des événements sportifs pour les personnes malvoyantes.

Si le robot hallucine et dit "Le joueur a marqué un but" alors qu'il a raté, c'est un problème. VidHal est donc comme un examen de conduite pour ces robots. Il ne suffit pas qu'ils sachent conduire (voir une image), il faut qu'ils sachent naviguer dans le trafic (comprendre le temps et le mouvement) sans faire d'accidents.

En résumé

VidHal est un nouveau test qui force les intelligences artificielles à trier des descriptions de vidéos du plus vrai au plus faux. Il a révélé que, bien que ces robots soient très forts, ils ont encore du mal à suivre le fil du temps et à ne pas inventer de détails dans les vidéos. C'est une étape cruciale pour les rendre plus fiables dans le monde réel.

L'équipe a rendu ce test public pour que tout le monde puisse s'entraîner et améliorer ces robots, afin qu'ils ne soient plus de simples rêveurs, mais de véritables observateurs de la réalité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →