← Derniers articles
💻 computer science

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Oxygen-TryOn est un modèle de fondation unifié et natif de la mode qui atteint l'état de l'art en matière d'essai virtuel photoréaliste pour des articles et des scénarios divers en exploitant un moteur de données dédié et un pipeline d'entraînement en trois étapes impliquant l'apprentissage par renforcement, surpassant ainsi les systèmes propriétaires et open-source de pointe.

Auteurs originaux : Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

Publié 2026-07-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où vous pourriez essayer instantanément n'importe quelle tenue que vous voyez dans un magazine, la photo d'un ami ou un cliché pris au hasard dans la rue, sans jamais avoir à mettre les pieds dans une cabine d'essayage. C'est le rêve de l'« essai virtuel », une branche de l'intelligence artificielle qui tente d'habiller numériquement les personnes avec de nouveaux vêtements. Pendant longtemps, ces tailleurs numériques étaient comme des apprentis maladroits : ils ne pouvaient gérer qu'un seul type de chemise à la fois, oubliaient souvent l'apparence de la personne en dessous, et peinaient à rendre le tissu réaliste lorsque la personne bougeait. Ils traitaient la tâche comme un simple jeu de « coloriage par numéros », consistant simplement à remplir un espace vide avec une nouvelle texture. Mais et si l'IA pouvait réellement comprendre la mode ? Et si elle savait qu'un chapeau se pose sur une tête, qu'un sac pend sur une épaule et qu'une veste doit se draper sur un pull, et non simplement s'asseoir par-dessus ? C'est la question que les chercheurs tentent de résoudre : comment construire une IA qui ne se contente pas de coller des images ensemble, mais qui « comprend » véritablement comment les vêtements, les accessoires et les personnes interagissent dans le monde réel.

Voici Oxygen-TryOn, un nouveau modèle de fondation « natif de la mode » créé par l'Oxygen AIGC Group et la Joy Future Academy de JD. Ne voyez pas ce modèle comme un éditeur de photos générique que vous devez duper pour faire du travail de mode, mais plutôt comme un tailleur spécialiste qui est né et a grandi dans le monde du style. Alors que d'autres systèmes d'IA tentent de forcer un éditeur d'images à usage général à faire de l'essai virtuel en lui donnant des instructions vagues (ce qui mène souvent à des hallucinations, comme l'invention de faux boutons ou la perte du visage de la personne), Oxygen-TryOn a été construit de toutes pièces spécifiquement pour habiller les gens. Il traite l'essai non pas comme un simple puzzle de « remplissage de blancs », mais comme une tâche de raisonnement complexe où l'IA doit déterminer ce que chaque article est, où il appartient et à quoi il devrait ressembler lorsqu'il est porté.

Les chercheurs ont découvert qu'en nourrissant ce modèle d'une bibliothèque massive de données de mode spécialement organisées et en l'enseignant via une « recette d'entraînement » en trois étapes, ils pouvaient obtenir des résultats bien plus réalistes et cohérents que les méthodes précédentes. Le modèle peut prendre une seule photo d'une personne et l'habiller avec un seul article, ou il peut jongler avec un mélange chaotique de références — comme une chemise provenant d'une photo, des chaussures d'une autre, un sac d'une troisième et un chapeau d'une quatrième — et les combiner en une tenue unique et cohérente. Il gère tout, des photos de produits nettes aux clichés « pris sur le vif » de personnes portant déjà les articles. Crucialement, il préserve l'identité de la personne (son visage, sa forme corporelle et sa pose) ainsi que les détails fins des vêtements (textures, logos et motifs) avec une grande fidélité.

Dans leurs expérimentations, Oxygen-TryOn ne s'est pas contenté de bien se comporter ; il a surpassé la concurrence. Sur des tests standards, il a atteint des scores de pointe, battant à la fois de puissants modèles open-source et des systèmes propriétaires de haut niveau comme Nano Banana Pro, GPT-Image-2 et Seedream5 Lite. Il brille particulièrement dans les scénarios de « multi-articles », où il parvient à superposer plusieurs éléments sans se tromper ou perdre des détails. L'équipe a également montré que le modèle est assez flexible pour suivre des instructions supplémentaires, comme changer la pose d'une personne ou l'arrière-plan, le tout lors du même passage de génération.

Le secret de ce succès n'était pas seulement l'architecture du modèle, mais le « moteur de données » que l'équipe a construit pour le nourrir. Ils ne se sont pas contentés de parcourir Internet ; ils ont construit un pipeline qui collecte, filtre, annote et fabrique des données d'essai de haute qualité à une échelle massive. Ils ont ensuite entraîné le modèle en trois étapes distinctes : d'abord, un « pré-entraînement continué » pour apprendre les bases de la mode ; deuxièmement, un « ajustement supervisé » pour maîtriser la tâche spécifique de l'habillage ; et enfin, une étape d'« apprentissage par renforcement ». Cette dernière étape est comparable à avoir un critique de mode strict (un système de récompense hybride) qui évalue le travail du modèle, lui apprenant à corriger les erreurs subtiles comme les plis maladroits ou la dérive d'identité. Le résultat est un système capable de gérer divers scénarios, de la tenue complète aux accessoires de mi-corps, et qui fonctionne même sur des sujets non humains comme des personnages d'anime ou des statues, prouvant qu'il a appris les règles générales du fait de porter des choses plutôt que de simplement mémoriser des photos spécifiques.

En résumé, Oxygen-TryOn représente un passage de la « supposition » de l'apparence des vêtements au « raisonnement » sur la façon dont ils s'ajustent. Cela suggère qu'en construisant des modèles spécifiquement pour un domaine et en les entraînant avec des données structurées de haute qualité, nous pouvons créer une IA qui soit non seulement plus précise, mais aussi plus utile pour des applications du monde réel comme le shopping en ligne. Bien que le modèle ait actuellement des limites — comme la gestion de plus de quatre articles de référence à la fois en raison de son architecture sous-jacente — l'article démontre que la voie vers un essai virtuel véritablement universel est ouverte, et que l'avenir de la mode numérique pourrait bien n'être qu'à une seule, et intelligente, génération de distance.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →