← Derniers articles
💬 NLP

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

Cet article introduit VCIFBench, un benchmark complet conçu pour évaluer et améliorer la capacité des grands modèles de langage multimodaux à suivre des instructions complexes et riches en contraintes dans les tâches de compréhension vidéo, révélant les lacunes de performance actuelles et démontrant l'efficacité de l'entraînement DPO pour l'amélioration.

Auteurs originaux : Huangchen Xu, Yuan Wu, Yi Chang

Publié 2026-06-04
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Huangchen Xu, Yuan Wu, Yi Chang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagiez un assistant très intelligent et très rapide pour regarder une vidéo pour vous et rédiger un rapport. Vous ne voulez pas simplement qu'il dise : « Un chien a poursuivi un chat ». Vous voulez lui donner une liste de règles très spécifique et complexe :

  • « Dites-moi exactement ce qui s'est passé, mais utilisez uniquement des mots commençant par la lettre 'B'. »
  • « Rédigez le rapport sous forme de bloc de code JSON. »
  • « Restez en dessous de 50 mots. »
  • « Ne mentionnez pas la couleur du chien. »
  • « Commencez par la phrase 'Il était une fois' et terminez par 'Fin'. »

C'est le problème que le papier VCIFBench tente de résoudre.

Le Problème : L'assistant « Intelligent mais Maladroit »

Les auteurs ont découvert que, bien que les modèles d'IA modernes (appelés Modèles de Langage de Grande Taille Multimodaux) soient excellents pour comprendre les vidéos, ils sont souvent médiocres pour suivre des règles strictes et complexes.

Considérez ces modèles d'IA comme un chef brillant qui sait cuisiner un plat délicieux (comprendre la vidéo) mais qui oublie sans cesse de suivre les restrictions alimentaires spécifiques du client (les contraintes).

  • Le chef peut préparer une excellente soupe, mais il a oublié d'enlever le sel.
  • Il peut écrire une belle histoire, mais il a utilisé la mauvaise police de caractères ou a dépassé le nombre de mots.
  • Parfois, si vous lui demandez de faire deux choses qui se contredisent (comme « être bref » et « inclure chaque détail »), il ignore simplement les règles et vous donne une réponse normale quand même.

La Solution : Un nouveau « Test de Stress » (VCIFBench)

Les chercheurs ont construit un nouveau terrain d'essai appelé VCIFBench (Video Complex Instruction Following Benchmark). C'est comme un examen de conduite pour l'IA, mais au lieu de simplement vérifier si la voiture peut rouler dans la rue, ils vérifient si le conducteur peut :

  1. Rouler sur le côté droit.
  2. S'arrêter à chaque feu rouge.
  3. Maintenir une vitesse exacte de 30 mph.
  4. Chanter une chanson en le faisant.
  5. Tout cela sans heurter un seul cône.

Comment ils l'ont construit :

  • Ils ont pris des jeux de données vidéo existants (comme des émissions de cuisine, des clips scientifiques et des vidéos de la vie quotidienne).
  • Ils ont écrit 306 « ordres » spécifiques pour l'IA, mélangeant différents types de règles :
    • Format : « Écrivez sous forme de liste », « Utilisez le JSON », « Pas de puces ».
    • Contenu : « Parlez uniquement de la voiture rouge », « Ne mentionnez pas la musique de fond ».
    • Style : « Parlez comme un pirate », « Soyez très formel ».
    • Structure : « Mettez la chose la plus importante en premier », « Groupez par ordre chronologique ».

Ils ont également inclus une section spéciale de « pièges » avec 30 ordres impossibles (ex: « Décrivez un éléphant bleu qui n'est pas dans la vidéo, mais décrivez uniquement les choses que vous pouvez voir »). Une bonne IA devrait dire : « Je ne peux pas faire cela », tandis qu'une mauvaise IA va halluciner un éléphant bleu.

Les Résultats : L'IA est encore en apprentissage

Les chercheurs ont testé 10 modèles d'IA différents (certains provenant de grandes entreprises technologiques, d'autres en open-source) sur ce nouveau test. Voici ce qu'ils ont trouvé :

  1. L'écart entre « Une seule chose » et « Tout ensemble » :
    La plupart des modèles étaient capables de suivre une règle. Si vous demandiez « Écrivez en JSON », ils pouvaient le faire. Si vous demandiez « Résumez la vidéo », ils pouvaient aussi le faire. Mais quand vous leur demandiez de faire les deux en même temps, ils commençaient à échouer.

    • Analogie : C'est comme un étudiant qui peut résoudre des problèmes de mathématiques parfaitement et peut aussi écrire un excellent essai, mais si vous lui demandez de résoudre le problème mathématique à l'intérieur de l'essai sans faire de fautes d'orthographe, il s'embrouille et échoue.
  2. Le problème du « Raté de peu » :
    Les meilleurs modèles (comme ceux de Google et OpenAI) étaient proches du but. Ils comprenaient bien la vidéo et le style, mais ils manquaient souvent un minuscule détail, comme oublier une virgule ou utiliser un mot de trop.

    • Analogie : Ils ont construit une maison parfaite, mais ont oublié de mettre la porte d'entrée du bon côté.
  3. Le problème de l'« Obéissance Aveugle » :
    Face à des instructions impossibles (les questions pièges), les modèles les plus faibles inventaient des choses. Ils ne réalisaient pas que la requête était contradictoire.

    • Analogie : Si vous dites à un robot : « Peins le mur en bleu et en rouge en même temps », un robot intelligent dira : « Je ne peux pas faire ça ». Un robot stupide peindra un mur violet informe en espérant que vous ne remarquiez rien.
  4. Plus de vidéo ne signifie pas forcément mieux :
    Les chercheurs ont essayé de donner à l'IA des vidéos de meilleure qualité (plus de trames, meilleure résolution) pour voir si cela l'aiderait. Étonnamment, cela n'aidait pas toujours. Parfois, voir plus de choses faisait que l'IA parlait trop et oubliait la limite de mots.

    • Analogie : Donner à un étudiant un manuel de 1 000 pages au lieu d'un résumé de 10 pages ne l'a pas aidé à écrire un essai d'une page ; cela l'a juste poussé à divaguer.

La Bonne Nouvelle : L'entraînement aide

Les auteurs ont également essayé d'« enseigner » à l'un des modèles en utilisant une technique spéciale appelée DPO (Direct Preference Optimization). Ils ont montré au modèle des exemples de « bonnes » réponses (qui suivaient toutes les règles) et de « mauvaises » réponses (qui ne les respectaient pas).

  • Après cet entraînement, le modèle est devenu nettement meilleur pour suivre les règles complexes. Il est passé d'un échec quasi systématique à un taux de réussite d'environ 33 %.
  • Analogie : C'est comme donner au chef une liste de contrôle spécifique et une récompense pour avoir suivi les instructions parfaitement. Après quelques essais, il a enfin commencé à respecter la commande.

L'essentiel

Le papier conclut que, bien que l'IA devienne très douée pour « regarder » des vidéos, elle a encore du mal à être un « bon employé » capable de suivre une longue liste d'instructions strictes. Pour rendre ces modèles utiles pour des tâches réelles (comme le reporting automatisé ou des outils spécialisés), nous devons leur apprendre non seulement à comprendre la vidéo, mais aussi à respecter les limites et les règles que nous leur imposons.

Les auteurs préviennent que ce test est simplement un « test de stress » pour les règles, et non une mesure complète de l'intelligence globale de l'IA, mais il met en lumière un fossé critique qui doit être comblé avant que ces modèles ne puissent être confiés à des tâches complexes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →