Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Oxygen-TryOn es un modelo fundacional unificado y nativo de la moda que logra un probador virtual fotorrealista de vanguardia para diversos artículos y escenarios mediante el aprovechamiento de un motor de datos dedicado y un proceso de entrenamiento de tres etapas que involucra aprendizaje por refuerzo, superando tanto a los sistemas propietarios líderes como a los de código abierto.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde pudieras probarte instantáneamente cualquier atuendo que veas en una revista, en la foto de un amigo o en una captura de una calle al azar, sin tener que pisar jamás un probador. Este es el sueño del "probador virtual", una rama de la inteligencia artificial que intenta vestir digitalmente a las personas con ropa nueva. Durante mucho tiempo, estos sastres digitales fueron como aprendices torpes: solo podían manejar un tipo de camisa a la vez, a menudo olvidaban cómo era la persona debajo y tenían dificultades para hacer que la tela pareciera real cuando la persona se movía. Trataban la tarea como un simple juego de "pintar por números", simplemente rellenando un espacio en blanco con una nueva textura. Pero, ¿y si la IA pudiera realmente entender la moda? ¿Qué pasaría si supiera que un sombrero va en la cabeza, que un bolso cuelga de un hombro y que una chaqueta debe caer sobre un suéter, no solo posarse encima de él? Esta es la pregunta que los investigadores están abordando: cómo construir una IA que no solo pegue imágenes, sino que realmente "entienda" cómo interactúan la ropa, los accesorios y las personas en el mundo real.
Presentamos Oxygen-TryOn, un nuevo modelo fundacional "nativo de la moda" creado por el Grupo Oxygen AIGC y la Academia Joy Future de JD. Piensa en este modelo no como un editor de fotos genérico al que tienes que engañar para que haga trabajo de moda, sino como un sastre especialista que nació y creció en el mundo del estilo. Mientras que otros sistemas de IA intentan forzar a un editor de imágenes de propósito general a realizar un probador virtual dándole instrucciones vagas (lo que a menudo conduce a alucinaciones, como inventar botones falsos o perder el rostro de la persona), Oxygen-TryOn fue construido desde cero específicamente para vestir a personas. Trata el probador no como un simple rompecabezas de "rellenar el hueco", sino como una compleja tarea de razonamiento donde la IA debe determinar qué es cada artículo, dónde pertenece y cómo debería verse al ser usado.
Los investigadores descubrieron que, al alimentar este modelo con una biblioteca masiva y especialmente curada de datos de moda y enseñarle a través de una "receta de entrenamiento" de tres pasos, podían lograr resultados que son mucho más realistas y consistentes que los métodos anteriores. El modelo puede tomar una sola foto de una persona y vestirla con un solo artículo, o puede lidiar con una mezcla caótica de referencias —como una camisa de una foto, zapatos de otra, un bolso de una tercera y un sombrero de una cuarta— y combinarlos en un atuendo único y coherente. Maneja desde fotos de productos limpias hasta instantáneas "en el mundo real" de personas que ya llevan puestos los artículos. Crucialmente, preserva la identidad de la persona (su rostro, forma corporal y pose) y los detalles finos de la ropa (texturas, logotipos y patrones) con alta fidelidad.
En sus experimentos, Oxygen-TryOn no solo se portó bien; superó a la competencia. En pruebas estándar, alcanzó puntuaciones de vanguardia, superando tanto a potentes modelos de código abierto como a sistemas propietarios de primer nivel como Nano Banana Pro, GPT-Image-2 y Seedream5 Lite. Destaca particularmente en escenarios de "múltiples artículos", donde logra superponer varios elementos sin confundirse ni perder detalles. El equipo también demostró que el modelo es lo suficientemente flexible como para seguir instrucciones adicionales, como cambiar la pose de una persona o el fondo, todo en una misma pasada de generación.
El ingrediente secreto detrás de este éxito no fue solo la arquitectura del modelo, sino el "motor de datos" que el equipo construyó para alimentarlo. No se limitaron a rastrear internet; construyeron un flujo de trabajo que recolecta, filtra, anota y fabrica datos de probador virtual de alta calidad a una escala masiva. Luego entrenaron el modelo en tres etapas distintas: primero, un "preentrenamiento continuo" para aprender los conceptos básicos de la moda; segundo, un "ajuste fino supervisado" para dominar la tarea específica de vestir; y finalmente, una etapa de "aprendizaje por refuerzo". Este último paso es como tener a un crítico de moda estricto (un sistema de recompensa híbrido) calificando el trabajo del modelo, enseñándole a corregir errores sutiles como pliegues extraños o la pérdida de la identidad. El resultado es un sistema que puede manejar diversos escenarios, desde atuendos de cuerpo completo hasta accesorios de medio cuerpo, e incluso funciona con sujetos no humanos como personajes de anime o estatuas, demostando que ha aprendido las reglas generales de cómo se usa la ropa en lugar de solo memorizar fotos específicas.
En resumen, Oxygen-TryOn representa un cambio de "adivinar" cómo debería verse la ropa a "razonar" sobre cómo se ajusta. Sugiere que, al construir modelos específicos para un dominio y entrenarlos con datos estructurados de alta calidad, podemos crear una IA que no solo sea más precisa, sino también más útil para aplicaciones del mundo real como las compras en línea. Aunque el modelo tiene actualmente limitaciones —como el manejo de más de cuatro artículos de referencia a la vez debido a su arquitectura subyacente—, el artículo demuestra que el camino hacia un probador virtual verdaderamente universal está abierto, y que el futuro de la moda digital podría estar a tan solo una generación inteligente de distancia.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.