← Derniers articles
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

L'article présente INSET, un modèle unifié de génération visuelle qui intègre les images sous forme de tokens de vocabulaire natifs au sein des instructions textuelles et exploite un moteur de données évolutif de 15 millions d'échantillons entrelacés pour surpasser nettement les méthodes existantes en matière de cohérence multi-images et de suivi d'instructions complexes.

Auteurs originaux : Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Publié 2026-05-13
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de donner un ordre très spécifique et complexe à un artiste.

L'Ancienne Méthode (Le Problème de la « Carte d'Index »)
Actuellement, la plupart des générateurs d'images par IA fonctionnent comme un bibliothécaire qui ne comprend que les chiffres. Si vous voulez une image avec un chien spécifique provenant d'une photo, un chapeau spécifique provenant d'une autre, et un arrière-plan spécifique provenant d'une troisième, vous devez dire : « Dessinez une image en utilisant le Chien de l'Image #1, le Chapeau de l'Image #2, et l'Arrière-plan de l'Image #3. »

L'IA doit se souvenir de quel chiffre correspond à quelle image pendant qu'elle essaie de peindre. À mesure que vous ajoutez plus d'images, l'IA se confond. Elle oublie quel chapeau va avec quel chien, ou elle ignore purement et simplement les images supplémentaires. C'est comme essayer de jongler avec cinq balles les yeux bandés ; tôt ou tard, vous les laissez tomber.

La Nouvelle Méthode : « Images dans les Phrases » (Inset)
L'article présente un nouveau modèle appelé Inset (Images dans les Phrases). Au lieu de traiter les images comme des fichiers séparés avec des numéros, Inset traite les images comme des mots dans une phrase.

Imaginez que vous écrivez une histoire, mais au lieu d'écrire le mot « chien », vous collez une petite image parfaite de ce chien spécifique directement dans la phrase.

  • Ancienne méthode : « Mettez le chien de l'Image 1 sur la chaise. »
  • Méthode Inset : « Mettez [Image du Chien] sur la chaise. »

Comme l'image se trouve juste à côté du mot « chaise » dans la phrase, l'IA n'a pas à deviner ou à se souvenir d'un numéro. Le sens est là, bien en évidence. Cela permet à l'IA de gérer des instructions complexes avec de nombreuses images différentes sans se confondre.

Comment Ils Ont Entraîné l'IA (La « Usine à Données »)
Pour enseigner à l'IA à faire cela, les chercheurs ne pouvaient pas simplement trouver assez d'exemples sur Internet car ils sont rares. Alors, ils ont construit un moteur de données évolutif (une usine robotisée pour les données).

  1. Pour les Photos : Ils ont pris des millions de photos et utilisé d'autres IA intelligentes pour les décomposer. Ils ont identifié chaque objet (comme un « vase rouge » ou un « chat bleu »), écrit une phrase à son sujet, puis inséré l'image réelle de cet objet directement dans la phrase à l'endroit où se trouvait la description.
  2. Pour les Vidéos : Ils ont examiné des vidéos pour enseigner à l'IA comment les choses changent. Si une vidéo montre un chat qui saute, ils ont créé des instructions disant : « Prenez le chat du début [Image du chat assis] et faites-le sauter [Image du chat en train de sauter]. » Cela enseigne à l'IA à comprendre le mouvement et la transformation, et pas seulement la copie statique.

Ils ont créé 15 millions de ces « phrases-images » pour entraîner le modèle.

Les Résultats
Ils ont testé ce nouveau modèle sur un défi difficile appelé InterleaveBench, qui consiste à mélanger de nombreuses images différentes dans une seule demande complexe.

  • Le Score : Lorsqu'on lui demandait d'utiliser 2 images, Inset s'en sortait bien. Mais lorsqu'on lui demandait d'utiliser 5 images, les anciens modèles s'effondraient, tandis qu'Inset continuait de s'améliorer. Il était nettement plus précis pour conserver l'apparence des objets par rapport aux originaux et pour suivre les instructions textuelles.
  • Le Bonus : Parce que l'IA a appris à traiter les images comme faisant partie de l'instruction, elle peut également effectuer des modifications. Vous pouvez lui montrer une image d'une chemise spécifique et dire : « Mettez cette chemise sur la personne de la photo », et elle copiera le design exact de cette chemise, plutôt que de simplement deviner à quoi ressemble une « chemise ».

En Résumé
L'article affirme qu'en empêchant l'IA d'utiliser des « numéros » pour référencer les images et en lui permettant de « lire » les images comme si elles étaient des mots, nous pouvons créer des outils beaucoup plus puissants pour générer et modifier des images complexes. Ils l'ont prouvé en construisant une immense bibliothèque d'exemples d'entraînement et en montrant que leur nouveau modèle surpasse tous les concurrents open-source actuels, en particulier lorsque les tâches deviennent compliquées.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →