← नवीनतम पेपर
💻 computer science

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

ऑक्सीजन-ट्राय-ऑन (Oxygen-TryOn) एक एकीकृत, फैशन-नेटिव फाउंडेशन मॉडल है जो एक समर्पित डेटा इंजन और सुदृढीकरण शिक्षण (reinforcement learning) से जुड़े तीन-चरणीय प्रशिक्षण पाइपलाइन का लाभ उठाकर विविध वस्तुओं और परिदृश्यों के लिए अत्याधुनिक फोटो-यथार्थवादी वर्चुअल ट्राई-ऑन प्राप्त करता है, जो अग्रणी प्रोप्राइटरी और ओपन-सोर्स दोनों प्रणालियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आप किसी पत्रिका में देखे गए, किसी मित्र की फोटो में दिखे या सड़क पर चलते हुए देखे गए किसी भी पहनावे को तुरंत पहन सकें, बिना कभी ड्रेसिंग रूम में कदम रखे। यह "वर्चुअल ट्राई-ऑन" का सपना है, जो आर्टिफिशियल इंटेलिजेंस की एक ऐसी शाखा है जो लोगों को नए कपड़ों में डिजिटल रूप से सजाने का प्रयास करती है। लंबे समय तक, ये डिजिटल दर्जी अनाड़ी प्रशिक्षुओं की तरह थे: वे एक बार में केवल एक ही प्रकार की शर्ट को संभाल सकते थे, वे अक्सर भूल जाते थे कि व्यक्ति के नीचे क्या था, और जब व्यक्ति हिलता था तो कपड़े को वास्तविक दिखाने में उन्हें संघर्ष करना पड़ता था। वे इस कार्य को एक साधारण "पेंट-बाय-नंबर्स" खेल की तरह मानते थे, बस एक खाली जगह को नए टेक्सचर से भर देना। लेकिन क्या होगा अगर AI वास्तव में फैशन को समझ सके? क्या होगा अगर उसे पता हो कि टोपी सिर पर लगती है, बैग कंधे पर लटकता है, और एक जैकेट को स्वेटर के ऊपर बस बैठने के बजाय उस पर ढलना चाहिए? यह वह प्रश्न है जिसे शोधकर्ता हल करने की कोशिश कर रहे हैं: एक ऐसा AI कैसे बनाया जाए जो केवल छवियों को आपस में चिपकाए नहीं, बल्कि वास्तव में यह "समझ" सके कि कपड़े, सहायक उपकरण (accessories) और लोग वास्तविक दुनिया में एक-दूसरे के साथ कैसे क्रिया करते हैं।

यहाँ आता है Oxygen-TryOn, एक नया "फैशन-नेटिव" फाउंडेशन मॉडल जिसे ऑक्सीजन एआईजीसी (Oxygen AIGC) ग्रुप और जेडी (JD) के जॉय फ्यूचर एकेडमी द्वारा बनाया गया है। इस मॉडल को एक सामान्य फोटो एडिटर के रूप में न देखें जिसे आपको फैशन का काम करने के लिए मजबूर करना पड़ता है, बल्कि इसे एक विशेषज्ञ दर्जी के रूप में देखें जो स्टाइल की दुनिया में पैदा हुआ और पला-बढ़ा है। जबकि अन्य AI सिस्टम एक सामान्य-उद्देश्य वाले इमेज एडिटर को अस्पष्ट निर्देशों के माध्यम से वर्चुअल ट्राई-ऑन करने के लिए मजबूर करने की कोशिश करते हैं (जिससे अक्सर भ्रम या 'हैलुसिनेशन' पैदा होता है, जैसे कि नकली बटन बना देना या व्यक्ति का चेहरा खो देना), Oxygen-TryOn को विशेष रूप से लोगों को कपड़े पहनाने के लिए शुरू से बनाया गया है। यह ट्राई-ऑन को एक साधारण "खाली स्थान भरने" वाली पहेली के रूप में नहीं, बल्कि एक जटिल तर्क कार्य (reasoning task) के रूप में देखता है जहाँ AI को यह समझना होगा कि प्रत्येक वस्तु क्या है, वह कहाँ होनी चाहिए, और पहने जाने पर वह कैसी दिखनी चाहिए।

शोधकर्ताओं ने पाया कि इस मॉडल को एक विशाल, विशेष रूप से क्यूरेटेड फैशन डेटा लाइब्रेरी खिलाकर और इसे तीन चरणों वाली "प्रशिक्षण रेसिपी" के माध्यम से सिखाकर, वे पिछले तरीकों की तुलना में कहीं अधिक यथार्थवादी और सुसंगत परिणाम प्राप्त कर सकते हैं। यह मॉडल किसी व्यक्ति की एक तस्वीर लेकर उसे एक एकल वस्तु पहना सकता है, या यह संदर्भों के एक अराजक मिश्रण को भी संभाल सकता है—जैसे कि एक तस्वीर से शर्ट, दूसरी से जूते, तीसरी से बैग और चौथी से टोपी, और उन्हें एक एकल, सुसंगत पोशाक में मिला सकता है। यह साफ उत्पाद फोटोग्राफ से लेकर पहले से ही वे चीजें पहने हुए लोगों के "इन-द-वाइल्ड" स्नैपशॉट तक सब कुछ संभाल सकता है। महत्वपूर्ण रूप से, यह व्यक्ति की पहचान (उनका चेहरा, शरीर का आकार और मुद्रा) और कपड़ों के सूक्ष्म विवरणों (टेक्सचर, लोगो और पैटर्न) को उच्च सटीकता के साथ सुरक्षित रखता है।

अपने प्रयोगों में, Oxygen-TryOn ने न केवल अच्छा प्रदर्शन किया; बल्कि इसने प्रतिस्पर्धा को पीछे छोड़ दिया। मानक परीक्षणों पर, इसने स्टेट-ऑफ-द-आर्ट स्कोर हासिल किया, और नैनो बनाना प्रो (Nano Banana Pro), जीपीटी-इमेज-2 (GPT-Image-2), और सीड्रीम5 लाइट (Seedream5 Lite) जैसे शक्तिशाली ओपन-सोर्स और शीर्ष-स्तरीय प्रोप्राइटरी सिस्टम को भी मात दी। यह विशेष रूप से "मल्टी-आइटम" परिदृश्यों में चमकता है, जहाँ यह बिना भ्रमित हुए या विवरण खोए कई वस्तुओं को एक के ऊपर एक (layering) सफलतापूर्वक व्यवस्थित करता है। टीम ने यह भी दिखाया कि मॉडल इतना लचीला है कि वह अतिरिक्त निर्देशों का पालन कर सकता है, जैसे कि एक ही जनरेशन पास में व्यक्ति की मुद्रा या बैकग्राउंड बदलना।

इस सफलता के पीछे का असली मंत्र केवल मॉडल का आर्किटेक्चर नहीं था, बल्कि वह "डेटा इंजन" था जिसे टीम ने इसे खिलाने के लिए बनाया था। उन्होंने केवल इंटरनेट से डेटा नहीं निकाला; उन्होंने एक पाइपलाइन बनाई जो बड़े पैमाने पर उच्च गुणवत्ता वाला ट्राई-ऑन डेटा एकत्र, फ़िल्टर, एनोटेट और निर्मित करती है। फिर उन्होंने मॉडल को तीन अलग-अलग चरणों में प्रशिक्षित किया: पहले, फैशन की बुनियादी बातें सीखने के लिए "कंटीन्यूड प्री-ट्रेनिंग"; दूसरा, पहनने के विशिष्ट कार्य में महारत हासिल करने के लिए "सुपरवाइज्ड फाइन-ट्यूनिंग"; और अंत में, एक "रीइन्फोर्समेंट लर्निंग" चरण। यह अंतिम चरण एक सख्त फैशन आलोचक (एक हाइब्रिड रिवॉर्ड सिस्टम) की तरह है जो मॉडल के काम को ग्रेड देता है, जिससे उसे अजीब सिलवटों या पहचान बदलने जैसी सूक्ष्म गलतियों को ठीक करना सिखाया जाता है। परिणाम एक ऐसा सिस्टम है जो विविध परिदृश्यों को संभाल सकता है, जैसे कि फुल-बॉडी आउटफिट से लेकर हाफ-बॉडी एक्सेसरीज तक, और यह एनीमे पात्रों या मूर्तियों जैसे गैर-मानवीय विषयों पर भी काम करता है, जो यह साबित करता है कि इसने केवल विशिष्ट तस्वीरों को याद करने के बजाय पहनने के सामान्य नियमों को सीख लिया है।

संक्षेप में, Oxygen-TryOn "अनुमान लगाने" से बदलकर यह समझने की ओर एक बदलाव है कि कपड़े कैसे फिट होते हैं। यह सुझाव देता है कि किसी विशिष्ट डोमेन के लिए मॉडल बनाकर और उन्हें उच्च गुणवत्ता वाले, संरचित डेटा के साथ प्रशिक्षित करके, हम ऐसा AI बना सकते हैं जो न केवल अधिक सटीक है बल्कि ऑनलाइन शॉपिंग जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए अधिक उपयोगी भी है। हालाँकि मॉडल की वर्तमान में कुछ सीमाएँ हैं—जैसे कि अपने अंतर्निहित आर्किटेक्चर के कारण एक साथ चार से अधिक संदर्भ वस्तुओं को संभालना—यह पेपर यह प्रदर्शित करता है कि वास्तव में सार्वभौमिक वर्चुअल ट्राई-ऑन का मार्ग खुला है, और डिजिटल फैशन का भविष्य बस एक स्मार्ट जनरेशन की दूरी पर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →