VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
Le document présente VKnowU, un benchmark complet pour évaluer la compréhension de la connaissance visuelle dans les grands modèles de langage multimodaux, et propose VideoKnow+, un modèle basé sur l'apprentissage par renforcement qui améliore considérablement les performances sur ce benchmark et sur d'autres tâches de compréhension vidéo en incorporant explicitement une connaissance visuelle structurée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un ami robot très intelligent capable de regarder des vidéos et de répondre à des questions à leur sujet. Depuis longtemps, ce robot est excellent pour repérer les choses. Si vous lui montrez une vidéo d'un chien poursuivant une balle, il peut vous dire : « C'est un chien », « C'est une balle » et « Le chien court ».
Mais il y a un problème : le robot ne comprend pas vraiment le monde comme nous, les humains. Il ne sait pas intuitivement que si vous lâchez une balle, elle tombera au sol (la gravité), ou qu'un verre est fragile et pourrait se briser si vous le faites tomber, ou qu'une personne qui fronce les sourcils est probablement mécontente. Il voit les pixels, mais il passe à côté du « bon sens » qui se cache derrière eux.
Ce document présente une nouvelle façon de tester et d'enseigner aux robots ce bon sens qui leur manque, ce que les auteurs appellent la Connaissance Visuelle.
Le Problème : Le Robot est « Aveugle » au Bon Sens
Les auteurs ont créé un test géant appelé VKnowU (Visual Knowledge Understanding). Voyez cela comme un examen final pour les robots, mais au lieu de mathématiques ou d'histoire, les questions portent sur la façon dont le monde fonctionne et dont les gens pensent.
Le test est divisé en deux matières principales :
- Centré sur le Monde (Le cours de Physique) : Le robot sait-il qu'une boîte lourde est plus difficile à soulever qu'une plume ? Sait-il qu'une pièce va tomber au sol ?
- Centré sur l'Humain (Le cours de Psychologie) : Le robot comprend-il qu'un garçon regardant une chambre en désordre pourrait prévoir de faire encore plus de désordre ? Sait-il que si des adultes entrent, ils pourraient être choqués ?
Les Résultats : Lorsqu'ils ont soumis ce test aux robots les plus intelligents disponibles (comme ceux de Google, OpenAI et des équipes open-source), les robots ont obtenu de mauvais scores. Ils étaient particulièrement mauvais dans le « Cours de Physique ». Ils pouvaient décrire la scène parfaitement, mais échouaient à prédire ce qui allait se passer ensuite ou à comprendre la matière des objets. Ils « voyaient » mais ne « comprenaient » pas.
La Solution : Apprendre au Robot à « Voir, Penser, Répondre »
Pour corriger cela, les auteurs ont conçu une nouvelle méthode d'entraînement appelée VideoKnow+. Ils ont réalisé que les robots essayaient de deviner les réponses en se basant sur leur entraînement linguistique (comme essayer de deviner la réponse à une énigme sans regarder l'image).
Ils ont introduit une nouvelle règle pour le robot : « Voir, Penser, Répondre ».
- Voir : Avant de répondre, le robot doit d'abord décrire exactement ce qu'il voit dans la vidéo, en se concentrant sur les indices visuels.
- Penser : Ensuite, il utilise ces indices visuels pour raisonner.
- Répondre : Enfin, il donne la réponse.
Ils ont également créé un système de « récompense » spécial. Imaginez un professeur notant le robot. Si le robot essaie de deviner la réponse en utilisant uniquement les mots, le professeur lui donne une note basse. Mais si le robot écrit une description qui prouve qu'il a vu la preuve visuelle (comme « La boîte est en bois, donc elle est lourde »), le professeur lui donne une note élevée. Cela force le robot à réellement prêter attention à la vidéo, et non pas seulement à sa base de données interne de faits.
Le Résultat
Après un entraînement avec cette nouvelle méthode et un nouvel ensemble massif de vidéos (appelé VKnowQA), le robot s'est nettement amélioré.
- Il a considérablement augmenté son score au test de « Connaissance Visuelle ».
- Il s'est également amélioré dans d'autres tests vidéo généraux, prouvant que l'apprentissage de la compréhension du monde l'aide dans de nombreux domaines.
La Vision Globelle
L'article soutient que pour que les robots deviennent véritablement intelligents, ils doivent cesser d'être de simples « détecteurs de formes » (reconnaître des objets) et commencer à être des « compréhensions du monde ». Tout comme un enfant apprend qu'un feu est chaud et qu'un verre est cassable en observant le monde, les robots doivent apprendre ces « vérités visuelles » pour combler le fossé entre le simple fait de voir une image et la compréhension réelle de ce qui s'y passe.
En bref : L'article a construit un test pour montrer que les robots sont mauvais en bon sens, puis a construit une nouvelle méthode d'entraînement qui les force à examiner les preuves avant de deviner, ce qui les rend beaucoup plus intelligents et fiables.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.