Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
L'équipe gagnante Mia a utilisé le modèle génératif T5-3B, optimisé par de nouvelles tâches de pré-entraînement (MLM et RPP) pour aligner les caractéristiques visuelles et textuelles, afin de remporter le défi TextVQA 2021.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le Défi : L'Enfant qui doit lire dans le monde réel
Imaginez un enfant à qui vous montrez une photo d'une rue bondée et vous lui demandez : "De quelle couleur est le nom du restaurant au coin de la rue ?".
Pour répondre, l'enfant ne peut pas juste "voir" l'image. Il doit faire trois choses très difficiles en même temps :
- Scanner l'image pour trouver les lettres.
- Lire ces lettres (même si elles sont un peu floues ou de travers).
- Réfléchir pour comprendre la question et faire le lien entre le texte et l'image.
C'est exactement ce que les chercheurs de l'équipe Mia ont voulu apprendre à une intelligence artificielle (IA) de faire. C'est ce qu'on appelle le défi TextVQA.
La Solution : Le "Super-Cerveau" T5
Au lieu de construire un cerveau à partir de zéro, l'équipe a pris un cerveau déjà très intelligent qui sait déjà parler et écrire : le modèle T5. C'est comme si on prenait un étudiant brillant en littérature et qu'on décidait de lui apprendre à devenir un expert en observation visuelle.
Pour que ce cerveau devienne un champion, ils ont utilisé trois étapes magiques :
1. L'École de l'Observation (Le Pré-entraînement)
Avant de lui donner les questions difficiles du concours, ils ont fait étudier à l'IA une bibliothèque gigantesque de 9 millions d'images contenant du texte.
Pour l'entraîner, ils ont utilisé deux jeux de réflexion :
- Le jeu du texte caché (MLM) : On cache un mot dans une phrase et l'IA doit deviner lequel c'est. Cela l'aide à comprendre le sens des mots.
- Le jeu de la carte (RPP) : On lui montre un objet et un texte, et elle doit deviner si le texte est "à côté", "au-dessus" ou "en dessous" de l'objet. C'est comme apprendre à lire une carte routière pour savoir où se trouvent les panneaux.
2. L'Examen Final (Le Fine-tuning)
Une fois que l'IA a "vu" des millions d'images, on lui donne enfin les vraies questions du concours TextVQA. Elle ne fait plus que de l'observation pure, elle apprend maintenant à répondre précisément à des questions humaines.
3. Le Correcteur Orthographique (Le Post-traitement)
Parfois, l'IA est presque parfaite, mais elle fait une petite faute de frappe (elle écrit "Restauarant" au lieu de "Restaurant"). Pour éviter de perdre des points bêtement, ils ont ajouté un petit robot correcteur (appelé fuzzywuzzy) qui vérifie si le mot écrit ressemble beaucoup au mot attendu. C'est comme un correcteur automatique qui sauve la mise à la fin.
Ce qu'il faut retenir (La Recette du Succès)
L'équipe Mia a prouvé que pour créer une IA qui "comprend" le monde, il ne suffit pas de lui montrer des images. Il faut :
- Lui donner énormément de nourriture (données) : Plus elle voit d'images, plus elle est forte.
- Utiliser un cerveau qui sait déjà parler : Partir d'un modèle de langage existant est un gain de temps et d'intelligence énorme.
- Lui apprendre les relations spatiales : Savoir où se trouve le texte par rapport à l'objet est aussi important que de savoir ce que dit le texte.
En résumé : Ils ont transformé un expert des mots en un expert des mots dans le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.