← Derniers articles
🤖 AI

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn est un nouveau cadre qui fait le pont entre les modèles d'inpainting 2D et le Gaussian Splatting 3D grâce à un pipeline de cohérence multi-étapes, permettant une reconstruction de scène 3D de pointe pour la suppression et l'insertion d'objets avec des entrées de masques flexibles en assurant une cohérence géométrique et photométrique bidirectionnelle.

Auteurs originaux : Hana Kim, Minje Kim, Tae-Kyun Kim

Publié 2026-06-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hana Kim, Minje Kim, Tae-Kyun Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un album photo d'une pièce magnifique, mais que dans chaque image, une pile de linge sale bloque votre vue d'une jolie chaise. Vous voulez « effacer » le linge pour voir la chaise, ou peut-être « ajouter » une nouvelle lampe à la scène. Faire cela dans une seule photo 2D est facile pour un ordinateur. Mais le faire sur toutes les photos de l'album afin que la nouvelle chaise ou la nouvelle lampe paraisse réelle sous tous les angles est incroyablement difficile. Si l'ordinateur se trompe dans une photo, l'objet 3D paraîtra brisé ou flou lorsque vous essaierez de le regarder sous un autre angle.

Ce document présente un nouvel outil appelé CoIn (Comprehensive 2D-3D Inpainting) qui résout ce problème en agissant comme une équipe de construction intelligente en deux étapes.

Le Problème : Le dilemme du « 3D-First » vs « 2D-First »

Les méthodes précédentes essayaient de réparer le monde 3D d'abord (l'approche « 3D-First »). Imaginez que vous essayez de reconstruire une maison en construisant d'abord le squelette 3D invisible, puis en peignant les murs. Le problème ? Pour construire ce squelette correctement, vous avez besoin de plans parfaits (masques) pour chaque photo. Si vos plans sont même légèrement décalés dans une seule image, toute la structure 3D s'effondre, ou vous supprimez accidentellement des parties du mur que vous vouliez garder.

D'autres méthodes essayaient de réparer les photos d'abord (l'approche « 2D-First »). Elles repeignent par-dessus le linge dans chaque photo individuellement. Le problème ici est que l'ordinateur pourrait peindre une chaise dans une photo qui ressemble à une table dans la suivante. Lorsque vous essayez de les combiner en 3D, le résultat est un fouillis flou et incohérent.

La Solution CoIn : Un pipeline « 2D-First » avec un filet de sécurité 3D

CoIn prend le meilleur des deux mondes. Il commence par peindre les photos (2D) mais utilise un « filet de sécurité » 3D pour s'assurer que tout s'aligne parfaitement. Voici comment cela fonctionne, étape par étape :

1. Le Brouillon (Inpainting 2D)

D'abord, CoIn utilise un artiste IA puissant (un modèle de diffusion) pour peindre rapidement sur les zones désordonnées dans toutes les photos. Il ne se soucie pas encore de la cohérence 3D ; il s'assure simplement que les images ont l'air bonnes individuellement.

  • Analogie : C'est comme un dessinateur qui remplit rapidement les espaces vides sur une page de bande dessinée. Le dessin est beau, mais les personnages peuvent paraître légèrement différents d'une page à l'autre.

2. Construction du Squelette de « Référence » (Ref-GS)

Ensuite, CoIn prend ces croquis et construit un modèle 3D temporaire de la scène en utilisant le Gaussian Splatting (une façon moderne et rapide de représenter des scènes 3D via des milliers de petits points 3D flous).

  • L'astuce : Au lieu de traiter toutes les photos de la même manière, CoIn choisit une « Photo de Référence » (le meilleur angle) et dit : « Celle-ci est la patronne ». Il construit le modèle 3D pour correspondre parfaitement à cette photo patronne, tout en ignorant doucement les autres photos si elles ne sont pas d'accord.
  • Analogie : Imaginez un sculpteur qui possède un modèle parfait en argile d'une statue basé sur une seule photo. Si une seconde photo montre la statue sous un angle étrange qui semble incorrect, le sculpteur fait plus confiance au modèle d'argile parfait qu'à la photo étrange.

3. Le « Test de Réalité » (Guidage par perte de cohérence)

Maintenant vient la magie. CoIn prend ce modèle d'argile 3D et le projette à nouveau sur les photos 2D. Il dit à l'artiste IA : « Hé, regarde ce que le modèle 3D dit que cet objet devrait être sous cet angle. Corrige ta peinture pour correspondre à la réalité 3D. »

  • Analogie : C'est comme un réalisateur sur un plateau de tournage. L'acteur (l'artiste IA) improvise une réplique, mais le réalisateur (le modèle 3D) dit : « Non, dans cette scène, le personnage est en fait debout derrière cet arbre. Change ta réplique pour correspondre au décor. » Cela force toutes les photos à s'accorder sur la forme 3D.

4. La Touche Finale (Amélioration de la texture)

Après que l'IA a été corrigée pour correspondre à la réalité 3D, les images peuvent paraître un peu trop lisses ou floues (comme une photo à basse résolution). CoIn utilise un « Discriminateur de Texture » spécial pour rajouter les détails fins, comme le grain du bois ou la texture du tissu, rendant le résultat final net et réel.

  • Analogie : C'est comme un éditeur qui prend une photo légèrement floue et utilise un filtre haut de gamme pour affiner les détails, faisant en sorte que la peau paraisse réelle et le tissu texturé, sans changer la forme de la personne.

Pourquoi cela compte

  • Il gère les masques « désordonnés » : Contrairement aux anciennes méthodes qui nécessitent des contours parfaits, au pixel près, de l'objet à supprimer, CoIn peut travailler avec des masques grossiers, rectangulaires ou même griffonnés. Il est indulgent face à l'erreur humaine.
  • Il fait à la fois la suppression et l'insertion : Vous pouvez l'utiliser pour effacer un objet (comme le linge) ou ajouter un nouvel objet (comme un melon ou une lampe), et cela paraîtra réel sous tous les angles.
  • Il est cohérent : La plus grande victoire est que si vous tournez autour de la scène 3D, l'objet ne se déforme pas et ne bugue pas. Il reste solide et constant.

L'essentiel à retenir

CoIn est un cadre qui comble le fossé entre l'édition d'image 2D et la reconstruction 3D. Il commence par la flexibilité de l'édition 2D, utilise un modèle 3D intelligent pour forcer la cohérence, puis polit le résultat pour qu'il soit photoréaliste. C'est comme avoir une équipe capable de dessiner une nouvelle pièce, de construire un plan 3D pour s'assurer que les murs s'alignent, puis de peindre les détails finaux si parfaitement qu'on ne peut pas deviner que l'objet n'était pas là au départ.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →