← नवीनतम पेपर
💻 computer science

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

यह शोध पत्र Dress-ED को प्रस्तुत करता है, जो 146k से अधिक निर्देश-संचालित नमूनों के साथ वर्चुअल ट्राई-ऑन (Virtual Try-On), वर्चुअल ट्राई-ऑफ (Virtual Try-Off) और टेक्स्ट-गाइडेड गारमेंट एडिटिंग को एकीकृत करने वाला पहला बड़े पैमाने का डेटासेट है, और साथ ही एक एकीकृत मल्टीमॉडल डिफ्यूजन फ्रेमवर्क प्रदान करता है ताकि नियंत्रणीय और संवादात्मक फैशन जनरेशन को सक्षम बनाया जा सके।

मूल लेखक: Fulvio Sanguigni, Davide Lobba, Bin Ren, Marcella Cornia, Nicu Sebe, Rita Cucchiara

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fulvio Sanguigni, Davide Lobba, Bin Ren, Marcella Cornia, Nicu Sebe, Rita Cucchiara

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके लिविंग रूम में एक जादुई वार्डरोब है। आप एक ड्रेस चुनते हैं, उसे पहनते हैं, और तुरंत, आप उसका रंग बदल सकते हैं, उसे लेदर में बदल सकते हैं, एक पॉकेट जोड़ सकते हैं, या आस्तीन को छोटा कर सकते हैं—यह सब सिर्फ उससे बात करके। यह "वर्चुअल ट्राई-ऑन" (VTON) का सपना है। लेकिन अब तक, यह जादू थोड़ा अनाड़ी सा था। आप एक ड्रेस पहन तो सकते थे, लेकिन आप इसे विशिष्ट निर्देशों के साथ आसानी से एडिट नहीं कर सकते थे जैसे "आस्तीन लंबी कर दो" या "कैमफ्लाज पैटर्न जोड़ दो।"

यह पेपर Dress-ED पेश करता है, जो एक विशाल नया प्रोजेक्ट है जो इस तरह के फैशन जादू में महारत हासिल करने के लिए AI के लिए एक "प्रशिक्षण स्कूल" के रूप में कार्य करता है। यहाँ इसका सरल शब्दों में विवरण दिया गया है:

1. समस्या: "स्थिर पुतला" (The Static Mannequin)

पिछले फैशन AI डेटासेट्स को पुतलों की एक लाइब्रेरी की तरह समझें। आप एक पुतले की शर्ट को दूसरी शर्ट से बदल सकते थे, लेकिन आप पुतले से यह नहीं कह सकते थे, "हे, उस नीली शर्ट को लाल लेदर जैकेट और ज़िप के साथ बदल दो।" AI के पास उदाहरणों की इतनी बड़ी लाइब्रेरी नहीं थी जो यह दिखा सके कि कैसे उन विशिष्ट परिवर्तनों को किया जाए जबकि व्यक्ति को वैसा ही रखा जाए जैसा वह खुद है।

2. समाधान: "फैशन शेफ" (Dress-ED)

लेखकों ने Dress-ED बनाया है, जो 1,46,000 से अधिक रेसिपी वाली एक विशाल कुकबुक है।

  • सामग्री (Ingredients): प्रत्येक "रेसिपी" (या डेटा सैंपल) के चार भाग हैं:

    1. एक व्यक्ति की मूल फोटो जिसने एक गारमेंट पहना हुआ है।
    2. गारमेंट की मूल फोटो अकेले (जैसे कि एक कैटलॉग पिक्चर)।
    3. गारमेंट का संशोधित (Edited) संस्करण (जैसे, अब यह पीला लेदर है)।
    4. उस नए गारमेंट को पहने हुए व्यक्ति की संशोधित फोटो।
    5. निर्देश (Instruction): एक टेक्स्ट नोट जो बताता है कि वास्तव में क्या बदला गया है (जैसे, "रंग बदलकर पीला कर दो")।
  • जादुई ट्रिक (उन्होंने इसे कैसे बनाया): उन्होंने मनुष्यों से 1,46,000 तस्वीरें बनाने के लिए नहीं कहा (इसमें बहुत समय लगता)। इसके बजाय, उन्होंने एक स्वचालित असेंबली लाइन बनाई:

    1. एनालिस्ट (Qwen3-VL): एक सुपर-स्मार्ट AI एक फोटो को देखता है और कपड़ों का विस्तृत विवरण लिखता है (जैसे, "नीली सूती शर्ट, छोटी आस्तीन")।
    2. शेफ (FLUX.2): एक दूसरा AI उस विवरण को लेता है और एक कमांड का पालन करता है जैसे "इसे पीला बनाओ" और शर्ट की एक नई, एडिटेड फोटो बनाता है।
    3. टेलर (FitDiT): एक तीसरा AI उस नई पीली शर्ट को लेता है और उसे फोटो में मौजूद व्यक्ति पर "सी देता है"।
    4. इंस्पेक्टर (GPT-5 और InternVL): एक अंतिम AI एक सख्त गुणवत्ता नियंत्रण प्रबंधक के रूप में कार्य करता है। वह जाँच करता है: "क्या शर्ट वास्तव में पीली हो गई? क्या व्यक्ति का चेहरा वही रहा? क्या ज़िप सही जगह पर है?" यदि उत्तर 'नहीं' है, तो सैंपल को कचरे में फेंक दिया जाता है। यदि 'हाँ', तो इसे डेटासेट में शामिल किया जाता है।

3. दो मुख्य खेल

इस नए डेटासेट के साथ, उन्होंने AI मॉडल्स को हल करने के लिए दो चुनौतियाँ निर्धारित की हैं:

  • वर्चुअल ट्राई-ऑन (द फिटिंग रूम): आप AI को एक व्यक्ति और एक कमांड देते हैं ("ड्रेस को लाल बनाओ")। AI आपको वह व्यक्ति लाल ड्रेस पहने हुए दिखाता है।
  • वर्चुअल ट्राई-ऑफ (द कैटलॉग): आप AI को एक ड्रेस पहने हुए व्यक्ति देते हैं और एक कमांड देते ("बेल्ट हटा दो")। AI को केवल बिना बेल्ट वाली ड्रेस की एक साफ फोटो दिखानी होती है, जैसे कि स्टोर के लिए कोई प्रोडक्ट फोटो हो।

4. नया सितारा: Dress-EM

लेखकों ने न केवल यह डेटासेट बनाया; उन्होंने Dress-EM नामक एक नया AI मॉडल भी बनाया जो इन खेलों को खेल सके।

  • Dress-EM को एक द्विभाषी फैशन डिजाइनर के रूप में समझें। यह आपके अंग्रेजी निर्देशों ("एक पॉकेट जोड़ो") को पढ़ सकता है और साथ ही कपड़ों के विजुअल सुरागों को भी देख सकता है।
  • यह भाषा और छवियों के बीच के अंतर को पाटने के लिए एक "कनेक्टर" का उपयोग करता है, जिससे यह सुनिश्चित होता है कि जब आप किसी बदलाव के लिए कहते हैं, तो वह ठीक वहीं होता है जहाँ आप चाहते हैं, बिना बाकी आउटफिट को खराब किए।

5. यह क्यों महत्वपूर्ण है

इससे पहले, यदि आप किसी फोटो में कपड़े एडिट करना चाहते थे, तो आपको फोटोशॉप का उपयोग करना पड़ता था या उम्मीद करनी पड़ती थी कि एक जेनेरिक AI आपके मतलब को समझ जाएगा।

  • Dress-ED AI को स्पष्ट निर्देशों के साथ "पहले और बाद के" उदाहरणों की एक विशाल, संरचित लाइब्रेरी देता है।
  • Dress-EM यह साबित करता है कि AI अब जटिल फैशन कमांड को समझ सकता है, जैसे कि कपड़े के मटेरियल को कॉटन से लेदर में बदलना या एक विशिष्ट पैटर्न जोड़ना, जबकि व्यक्ति के चेहरे और पोज़ को पूरी तरह से स्वाभाविक बनाए रखना।

संक्षेप में: लेखकों ने एक विशाल, स्वचालित "फैशन स्कूल" बनाया है जहाँ AI आपकी आवाज़ सुनने और लोगों पर तुरंत कपड़ों को फिर से डिजाइन करने में महारत हासिल करता है। उन्होंने पाठ्यक्रम (डेटासेट) और शीर्ष छात्र (मॉडल) दोनों का निर्माण किया है ताकि यह दिखाया जा सके कि ऑनलाइन शॉपिंग का भविष्य जल्द ही आपको यह कहने की अनुमति दे सकता है, "मुझे यह ड्रेस हरे मखमली कपड़े में लंबी आस्तीन के साथ चाहिए," और इसे होते हुए तुरंत देखना संभव होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →