ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text
Ce papier présente ScribbleEdit, un jeu de données synthétique à grande échelle qui combine des instructions en langage naturel avec des gribouillis à main levée pour entraîner et améliorer des modèles d'édition d'images multimodaux, leur permettant d'atteindre un contrôle spatial et sémantique précis que les modèles prêts à l'emploi existants peinent à obtenir.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de donner des instructions à un artiste très talentueux mais légèrement confus. Vous souhaitez modifier une photo, mais vous avez deux façons de lui parler :
- La méthode textuelle : Vous dites « Placez une pomme rouge au milieu ». L'artiste comprend parfaitement « pomme rouge », mais il pourrait la placer à gauche, à droite, ou la rendre gigantesque. Il manque votre vision précise de l'endroit où elle doit aller.
- La méthode gribouillée : Vous prenez un stylo et dessinez un cercle désordonné et tremblotant sur la photo à l'endroit où vous voulez la pomme. L'artiste sait exactement où la placer, mais il ignore si elle doit être rouge, verte, brillante ou duveteuse.
Le problème : Les éditeurs d'images par IA actuels excellent dans l'une ou l'autre de ces approches, mais ils peinent lorsque vous essayez d'utiliser les deux simultanément. Ils sont déstabilisés par le gribouillis désordonné combiné au texte, principalement parce qu'ils n'ont pas été entraînés sur suffisamment d'exemples de cette combinaison spécifique.
La solution : ScribbleEdit
Les auteurs de cet article ont construit une immense « salle d'entraînement » pour l'IA appelée ScribbleEdit. Imaginez-la comme une gigantesque bibliothèque d'exercices pratiques où l'IA apprend à écouter à la fois le texte et le gribouillis simultanément.
Voici comment ils ont construit cette bibliothèque :
- Le dispositif : Ils ont pris des milliers de photos d'objets (comme des pommes, des chats ou des voitures).
- La gomme : Ils ont utilisé un outil « gomme » intelligent pour supprimer l'objet, laissant une zone vide dans l'arrière-plan.
- Le guide : Ils ont pris la photo originale et l'ont associée à un gribouillis désordonné dessiné à la main (comme un dessin d'enfant) qui délimitait grossièrement l'endroit où l'objet devrait se trouver.
- Le script : Ils ont utilisé une autre IA pour rédiger une phrase décrivant l'objet (par exemple : « Placez une pomme rouge brillante ici »).
- Le résultat : Ils ont créé plus de 11 000 exemples où l'IA devait examiner la zone vide, le gribouillis désordonné et la phrase, puis « peindre » l'objet exactement à l'endroit indiqué par le gribouillis, en lui donnant l'apparence décrite par le texte.
L'expérience
Les chercheurs ont soumis deux types différents d'artistes IA à un test :
- L'artiste « prêt à l'emploi » : Ce sont des modèles préentraînés qui n'ont jamais vu ScribbleEdit.
- L'artiste « entraîné » : Ce sont les mêmes modèles, mais après qu'ils aient étudié la bibliothèque ScribbleEdit.
Les résultats
- Avant l'entraînement : Les modèles non entraînés étaient terribles dans cette tâche. Lorsqu'on leur donnait un gribouillis, ils l'ignoraient souvent, dessinaient des formes étranges ressemblant à des gribouillis, ou échouaient simplement à modifier l'image. Ils ne comprenaient pas le « langage » d'une ligne désordonnée.
- Après l'entraînement : Une fois que les modèles ont étudié l'ensemble de données ScribbleEdit, ils se sont nettement améliorés. Ils ont appris à :
- Placer l'objet exactement là où le gribouillis l'indiquait (précision spatiale).
- Faire en sorte que l'objet ressemble à ce que le texte décrivait (précision sémantique).
- Maintenir le reste de la photo dans un aspect naturel.
La conclusion
L'article montre que, bien que l'IA progresse dans la modification de photos, elle peine toujours à comprendre notre façon humaine et désordonnée de dessiner. En créant un ensemble de données synthétique qui enseigne à l'IA comment combiner « dessins grossiers » et « instructions claires », les chercheurs ont prouvé que l'IA peut apprendre à devenir un éditeur beaucoup plus précis et obéissant.
Ce qu'ils n'ont pas fait (limitations importantes)
L'article est très précis sur ce qu'ils n'ont pas fait :
- Ils n'ont pas inventé une nouvelle façon de dessiner ; ils ont utilisé des dessins humains existants provenant d'une base de données appelée « Sketchy ».
- Ils n'ont testé que l'« ajout d'un objet » (ajout d'objet). Ils n'ont pas testé des choses complexes comme modifier le visage d'une personne ou éditer uniquement une toute petite partie d'une chemise.
- Ils n'ont pas prétendu que cela fonctionne pour l'imagerie médicale ou d'autres domaines spécialisés ; il s'agit strictement de la modification générale de photos.
En bref, ScribbleEdit est un nouveau manuel d'entraînement qui apprend à l'IA comment écouter à la fois nos gribouillis désordonnés et nos mots clairs, rendant la modification de photos plus semblable à la conversation avec un assistant humain serviable et moins semblable à la devinette d'une énigme.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.