← Derniers articles
🤖 AI

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

Le document présente Kontinuous Kontext, un modèle d'édition d'images basé sur des instructions qui permet un contrôle fluide et continu de l'intensité de l'édition en entraînant un projecteur léger pour mapper une valeur d'intensité scalaire et une instruction textuelle dans l'espace de modulation du modèle, permettant ainsi aux utilisateurs d'ajuster les éditions, du subtil au pleinement réalisé, à travers diverses opérations sans entraînement spécifique aux attributs.

Auteurs originaux : Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

Publié 2026-07-22
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous tenez une baguette magique capable de transformer des images par la simple force de votre parole. Vous dites : « Fais en sorte que le chien ressemble à un chat », et pouf, le visage du chien se métamorphose en celui d'un félin. C'est le monde de l'édition d'images basée sur des instructions, un superpouvoir construit sur l'IA générative. Ce sont des cerveaux informatiques entraînés sur des milliards de photos et de légendes, apprenant à peindre de nouvelles images à partir de rien ou à ajuster des images existantes selon vos mots. Pendant longtemps, ces sorciers ne pouvaient faire qu'une seule chose : suivre votre commande à la lettre. Si vous demandiez une « veste bleue », ils vous donnaient une veste 100 % bleue. Si vous demandiez de la « neige », toute la scène devenait un blizzard. Mais et si vous vouliez juste un peu de neige ? Ou une veste qui soit majoritairement rouge avec une pointe de bleu ? Jusqu'à présent, la baguette magique était un peu maladroite ; c'était un interrupteur on/off, pas un variateur de lumière.

C'est là que commence l'histoire de Kontinuous Kontext. Les chercheurs voulaient transformer cet interrupteur on/off maladroit en un variateur de lumière fluide. Ils ont posé une question simple : pouvons-nous apprendre à une IA non seulement ce qu'il faut changer, mais aussi à quel point le changer ? Ils ne voulaient pas seulement que l'IA devine la bonne quantité ; ils voulaient qu'un utilisateur puisse faire glisser un curseur et regarder l'image se transformer progressivement, comme si l'on montait le volume d'une chanson ou que l'on ajustait la luminosité d'un écran. Cette publication présente une nouvelle façon de donner à l'IA ce contrôle précis, nous permettant de régler une édition de « rien ne s'est passé » à « complètement transformé » en un seul mouvement fluide.


Le Problème : La Baguette Magique « Tout ou Rien »

Imaginez que vous êtes un chef cuisinier doté d'un livre de recettes magiques. Si vous demandez une « soupe épicée », le livre vous donne un bol si brûlant qu'il vous brûle la langue. Si vous demandez une « soupe douce », il vous donne un bol qui a le goût de l'eau. Vous ne pouvez pas demander « juste un petit coup de piquant ». C'est exactement ainsi que fonctionne l'IA d'édition d'images actuelle. Vous lui donnez une instruction textuelle, comme « transforme la veste en fourrure », et elle ne fait rien du tout ou effectue une transformation totale et duveteuse. Il n'y a pas de juste milieu.

Les tentatives précédentes pour corriger cela revenaient à essayer de construire une nouvelle cuisine pour chaque ingrédient. Certains scientifiques ont essayé d'entraîner des modèles spéciaux uniquement pour changer la couleur des cheveux, d'autres pour changer la météo, et d'autres pour changer la forme des objets. C'était comme avoir un chef différent pour chaque plat. Cela fonctionnait, mais c'était lent, coûteux, et on ne pouvait pas facilement mélanger et assortir les choses. Vous aviez besoin d'un chef unique et universel capable de gérer n'importe quelle requête et de vous laisser contrôler l'intensité de chaque changement.

La Solution : Le « Bouton de Volume » pour l'IA

L'équipe derrière Kontinuous Kontext (un nom ludique mélangeant « Continuous » et « Context ») a construit un système qui agit comme un bouton de volume universel pour les éditions d'images. Au lieu de simplement écouter l'instruction « Rends-le bleu », l'IA écoute désormais l'instruction plus un nombre qui dit « à quel point il est bleu ».

Considérez l'IA comme un musicien jouant une chanson. L'instruction textuelle est la partition, qui dit au musicien quoi jouer. Le nouveau « curseur » est le bouton de volume. Par le passé, le musicien ne pouvait jouer la chanson qu'à plein volume ou dans le silence. Maintenant, avec Kontinuous Kontext, vous pouvez tourner le bouton de zéro à dix. À zéro, la musique est silencieuse (l'image est inchangée). À cinq, la musique est douce et légère (une édition subtile). À dix, c'est un concert de rock (une transformation complète). La magie réside dans le fait que la transition entre zéro et dix est parfaitement fluide, sans sauts soudains ni bugs.

Comment ils ont appris à l'IA à glisser

Vous vous demandez peut-être : « Où ont-ils trouvé les données pour apprendre cela à l'IA ? » Après tout, les gens réels ne prennent généralement pas une photo, l'éditent légèrement, l'éditent un peu plus, puis l'éditent totalement, en sauvegardant chaque étape du processus. Ce genre de données n'existe pas dans la nature.

Les chercheurs sont donc devenus des magiciens des données. Ils ont créé un ensemble de données synthétiques — une bibliothèque d'exemples fausses mais réalistes. Voici comment ils ont procédé :

  1. La Configuration : Ils ont pris 110 000 photos aléatoires.
  2. La Commande : Ils ont utilisé un assistant IA intelligent pour écrire une instruction unique pour chaque photo, comme « Transforme la voiture en vaisseau spatial ».
  3. L'Édition Complète : Ils ont utilisé une IA puissante existante (appelée Flux Kontext) pour réaliser l'édition complète, transformant la voiture en vaisseau spatial.
  4. Le Pont : C'était la partie délicate. Ils devaient montrer à l'IA à quoi ressemblait la voiture à 10 %, 20 %, 50 % et 90 % de son état de « vaisseau spatial ». Ils ont utilisé un outil de « morphing » spécial pour créer ces images intermédiaires, comme une vidéo passant d'une scène à une autre par un fondu.
  5. Le Nettoyage : L'outil de morphing n'était pas parfait. Parfois, il créait des artefacts bizarres, comme une voiture avec une demi-roue ou un vaisseau spatial qui ressemblait à une masse informe. Les chercheurs ont construit un filtre strict pour éliminer tous les « mauvais » exemples où la transition n'était pas fluide ou l'image brisée. Ils ont fini avec 64 000 « trajectoires d'édition » de haute qualité (des chemins fluides du début à la fin).

La Recette Secrète : Le « Projecteur » Traducteur

L'invention centrale est un réseau minuscule et léger qu'ils appellent un projecteur. Considérez le modèle d'IA principal comme un orchestre géant et complexe. L'instruction textuelle dit à l'orchestre quoi jouer. Le nouveau projecteur est un petit traducteur qui se tient entre le curseur et l'orchestre.

Lorsque vous faites glisser le curseur à « 0,5 » (à mi-chemin), le traducteur ne se contente pas de crier « MOITIÉ ! » à l'orchestre. Au lieu de cela, il murmure une instruction très spécifique et calibrée au chef d'orchestre (l'espace de modulation). Il dit : « D'accord, pour cette instruction spécifique concernant une veste bleue, applique cette quantité exacte de bleu. »

Le papier a révélé que s'ils avaient simplement essayé d'injecter le nombre dans les mots du texte (comme ajouter un jeton « moitié »), la musique deviendrait saccadée et étrange. Mais en injectant le nombre dans l'espace de modulation — une couche cachée où l'IA contrôle l'« ambiance » de l'image — ils ont pu rendre les changements fluides et précis. C'est comme réaliser que pour changer le volume, vous ne devriez pas crier sur le chanteur, mais plutôt ajuster directement le gain de l'amplificateur.

Ce qu'ils ont trouvé (et ce qu'ils n'ont pas trouvé)

Les résultats ont été impressionnants. Lorsqu'ils ont testé leur système par rapport à d'autres méthodes, Kontinuous Kontext était le grand vainqueur en termes de fluidité.

  • La Compétition : Les autres méthodes étaient comme un ascenseur en panne. Elles passaient du rez-de-chaussée au 10ème étage, mais parfois elles sautaient complètement le 5ème étage, ou les portes s'ouvraient au mauvais étage. Certaines méthodes tentaient simplement de « morpher » deux images ensemble, ce qui entraînait souvent l'apparition de monstres bizarres et flous lors des étapes intermédiaires.
  • Le Vainqueur : Kontinuous Kontext se déplaçait comme un ascenseur fluide. À mesure que le curseur passait de 0 à 1, l'image changeait de manière graduelle et logique. Une veste ne devenait pas soudainement bleue ; elle gagnait progressivement du bleu. Une scène enneigée n'apparaissait pas brusquement ; les flocons de neige apparaissaient lentement et le sol devenait lentement blanc.

Le papier montre également que cette méthode fonctionne pour tout, pas seulement pour une chose. Que vous changiez la couleur d'une robe, la matière d'un rocher (pour qu'il ressemble à de l'or), la forme d'une voiture ou l'ensemble de la météo d'une scène, le même curseur fonctionne. C'est énorme car cela signifie que vous n'avez pas besoin d'un modèle différent pour chaque type d'édition. Un modèle universel peut tout gérer.

Cependant, les auteurs sont honnêtes quant aux limites. Le système est excellent pour les éditions « continues », comme le changement de couleurs ou de matériaux. Mais si vous demandez un changement géométrique spécifique et difficile — comme faire pivoter une voiture de 90 degrés parfaitement — le système rencontre parfois des difficultés, car l'IA de base sur laquelle il est construit (Flux Kontext) éprouve aussi ces difficultés. De plus, si vous essayez de pousser le curseur au-delà du maximum (comme demander « 120 % de bleu »), le système ne sait pas quoi faire ; il s'arrête à 100 % ou devient confus. C'est un variateur de lumière, pas une machine à remonter le temps.

Pourquoi cela importe

Cette publication suggère que nous dépassons l'ère de l'IA du « oui ou non ». Nous entrons dans l'ère du « à quel point ? ». En donnant aux utilisateurs un curseur, Kontinuous Kontext comble le fossé entre le désir humain de nuance, qui est complexe et créatif, et la nature binaire et rigide du code informatique. Cela transforme l'édition d'images d'un jeu de hasard — où l'on espère que l'IA devine la bonne quantité de changement — en un instrument de précision où l'on peut accorder le résultat exactement selon ses goûts.

Les chercheurs n'ont pas seulement construit un meilleur outil ; ils ont montré que le « bouton » pour contrôler l'intensité est déjà caché à l'intérieur de ces modèles d'IA, attendant d'être trouvé. Ils avaient juste besoin de la bonne clé pour le déverrouiller. Désormais, au lieu de demander à une IA de « faire parfait », vous pouvez enfin lui dire : « Fais presque parfait », et la regarder glisser exactement là où elle doit être.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →