From Pixels to Prompts: Vision-Language Models
Ce livre vise à fournir aux lecteurs une carte mentale claire et une compréhension intuitive des modèles vision-langage, les aidant ainsi à naviguer avec confiance dans ce domaine en évolution rapide plutôt que de s'y perdre dans un flux constant de nouveaux mots à la mode et de variantes de modèles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le pont entre ce que nous voyons et ce que nous disons
Imaginez que vous essayiez de décrire une scène chaotique à un ami qui ne l'a jamais vue. Vous avez l'image dans votre esprit (la partie visuelle), mais vous devez utiliser des mots pour l'expliquer (la partie linguistique). Pendant longtemps, les ordinateurs étaient très mauvais pour cela. Ils possédaient deux cerveaux distincts : l'un qui était excellent pour reconnaître les formes et les couleurs dans une photo, et un autre qui était excellent pour écrire des phrases et répondre à des questions. Mais ces deux cerveaux ne se parlaient pas. Le cerveau de la « vision » pouvait vous dire qu'il y avait un chien, et le cerveau du « langage » pouvait écrire une histoire sur un chien, mais ils ne pouvaient pas travailler ensemble pour dire : « Regarde ce chien spécifique portant un chapeau rouge ! »
Ce livre, From Pixels to Prompts, traite de la construction d'un pont entre ces deux cerveaux. Il explore les Modèles Vision-Langage (VLM), un nouveau type d'intelligence artificielle conçu pour comprendre simultanément les images et le texte. Considérez cela comme l'apprentissage à un ordinateur non seulement à « voir » une image ou simplement à « lire » une phrase, mais à faire les deux simultanément, lui permettant de raisonner sur le monde d'une manière beaucoup plus humaine. Le livre soutient qu'en combinant ces compétences, nous pouvons créer des machines qui ne se contentent pas de traiter des données, mais qui comprennent réellement le contexte, répondent à des questions sur ce qu'elles voient et peuvent même suivre des instructions comme un assistant utile.
La grande idée du livre : Une carte pour le multivers de l'IA
Ce livre n'est pas une expérience scientifique unique avec un seul moment de révélation ; c'est plutôt un guide complet — une carte mentale — conçu pour nous aider à naviguer dans le monde en mutation rapide de l'intelligence multimodale. L'auteur, Vo Hoang Nhat Khang, suggère que le domaine évolue si vite que de nouveaux noms de modèles apparaissent quotidiennement qu'il est facile de s'y perdre dans le jargon. L'objectif principal du livre est de fournir une structure claire et durable pour comprendre comment ces systèmes fonctionnent, plutôt que de simplement mémoriser une liste d'acronymes.
La conclusion centrale du livre est que presque tous les modèles Vision-Langage, aussi complexes soient-ils, font trois choses simples de manière répétée :
- Encodage : Transformer les pixels bruts (l'image) et le texte (les mots) en un langage commun de nombres (vecteurs).
- Raisonnement : Utiliser un « moteur de raisonnement » (généralement un grand modèle de langage) pour réfléchir à ces nombres et comprendre leur signification conjointe.
- Décodage : Transformer ces pensées en une sortie utile, comme une phrase, un dessin ou une réponse spécifique.
Le livre soutient explicitement l'idée que nous n'avons pas besoin de construire un tout nouveau cerveau géant à partir de zéro pour chaque nouvelle tâche. Au lieu de cela, il suggère que la voie la plus efficace consiste à prendre des « cerveaux » préexistants et puissants (comme un modèle de langage qui sait déjà parler et un modèle de vision qui sait déjà voir) et à construire un petit « pont » ingénieux entre eux. Ce pont, souvent appelé adaptateur ou projecteur, permet aux deux experts distincts de communiquer sans avoir besoin de tout réapprendre depuis le début.
Les auteurs sont très convaincus que cette approche « modulaire » — garder les grands cerveaux gelés et n'entraîner que le pont — est une tendance dominante et efficace, comme on peut le voir avec des modèles tels que BLIP-2 et Flamingo. Cependant, ils suggèrent également (plut plutôt qu'ils ne le prouvent comme une loi finale) que cette approche a des limites. Ils soulignent que bien que ces modèles s'améliorent, ils luttent encore contre des phénomènes comme les « hallucinations » (décrire avec assurance des choses qui n'existent pas) et la « généralisation compositionnelle » (avoir du mal à combiner des concepts connus de manières totalement nouvelles, comme compter un nombre spécifique d'objets rares).
Comment le livre dévoile l'histoire
Le livre emmène le lecteur dans un voyage du bas vers le haut. Il commence par expliquer les « Encodeurs Visuels », qui sont les parties du système transformant une image en une liste de jetons (tokens), un peu comme transformer une peinture en une liste d'ingrédients. Il passe ensuite aux « Modèles de Langage », les parties qui gèrent les mots et la logique. La partie la plus passionnante du livre est la section centrale, qui détaille les « Mécanismes de Fusion » — les différentes façons dont les ingénieurs ont trouvé pour coller ces deux parties ensemble.
Une méthode populaire décrite est l'Attention Croisée (Cross-Attention), qui est comme un traducteur qui permet à la partie linguistique du cerveau de jeter un coup d'œil à la partie visuelle dès qu'elle en a besoin. Une autre méthode est le Conditionnement par Préfixe (Prefix Conditioning), où l'image est transformée en un « prompt » spécial qui se place au tout début de la phrase, disant au modèle de langage : « Voici de quoi nous parlons, maintenant écris la suite ». Le livre souligne qu'il n'y a pas une seule façon « correcte » de faire cela ; différents modèles utilisent différents ponts selon qu'ils doivent être rapides, précis ou bons pour suivre des instructions complexes.
Le livre plonge également dans le « carburant » qui alimente ces modèles : les données. Il explique que ces systèmes sont entraînés sur de vastes quantités d'images et de textes provenant d'Internet. Les auteurs notent que si ces données sont énormes, elles sont aussi désordonnées et biaisées, ce qui conduit les modèles à commettre parfois des erreurs ou à apprendre des stéréotypes. Ils expliquent comment les chercheurs tentent de corriger cela en utilisant de meilleurs ensembles de données et l'« ajustement par instruction » (instruction tuning), où l'on enseigne aux modèles à agir comme des assistants utiles en leur donnant des exemples de la manière de répondre aux questions de façon polie et précise.
Enfin, le livre examine l'avenir de cette technologie. Il suggère que l'avenir ne consiste pas seulement à rendre les modèles plus intelligents pour répondre à des questions de culture générale, mais à les rendre plus fiables, honnêtes sur ce qu'ils ne savent pas, et capables de comprendre le monde physique (comme la façon dont les objets bougent ou interagissent). Le livre conclut en nous rappelant que, bien que ces modèles soient puissants, ce sont des outils construits par des humains, et que comprendre leurs forces et leurs faiblesses est une responsabilité que nous partageons tous. Il ne s'agit pas seulement de construire une technologie plus cool ; il s'agit de construire une technologie en laquelle nous pouvons avoir confiance pour nous aider à voir le monde un peu plus clairement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.