← नवीनतम पेपर
💻 computer science

DOS: Directional Object Separation in Text Embeddings for Multi-Object Image Generation

यह शोध पत्र DOS (डायरेक्शनल ऑब्जेक्ट सेपरेशन) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मल्टी-ऑब्जेक्ट टेक्स्ट-टू-इमेज जनरेशन में ऑब्जेक्ट नेग्लेक्ट (वस्तु की उपेक्षा) और मिक्सिंग (मिश्रण) को प्रभावी ढंग से कम करने के लिए CLIP टेक्स्ट एम्बेडिंग्स को संशोधित करती है, और कई बेंचमार्क पर मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Dongnam Byun, Jungwon Park, Jungmin Ko, Changin Choi, Wonjong Rhee

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongnam Byun, Jungwon Park, Jungmin Ko, Changin Choi, Wonjong Rhee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (AI) हैं जो एक रेसिपी कार्ड के आधार पर एकल व्यंजन बनाने में अविश्वसनीय रूप से प्रतिभाशाली हैं। यदि आप "एक बर्गर" मांगते हैं, तो आपको एक परफेक्ट बर्गर मिलता है। यदि आप "एक पिज्जा" मांगते हैं, तो आपको एक परफेक्ट पिज्जा मिलता है।

लेकिन, यदि आप "एक बर्गर और एक पिज्जा" मांगते हैं, तो शेफ भ्रमित हो जाता है। कभी-कभी, वह पिज्जा को पूरी तरह भूल जाता है और बस एक विशाल बर्गर बना देता है। अन्य बार, वह इतना उलझ जाता है कि वह एक अजीब "बर्गीज़ा" (burgizza) बना देता है जहाँ चीज़ बन (bun) पर होती है और पैटी क्रस्ट (crust) पर होती है।

यही वह समस्या है जिसे DOS (Directional Object Separation) हल करने की कोशिश कर रहा है। यह एक नई तकनीक है जो AI इमेज जनरेटरों (जैसे DALL-E या Stable Diffusion) को कई वस्तुओं वाली रिक्वेस्ट को बिना खोए या आपस में मिले संभालने में मदद करती है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करके:

1. समस्या: "भ्रमित शेफ" (The "Confused Chef")

पेपर पहचानता है कि चार विशिष्ट स्थितियाँ हैं जहाँ शेफ (AI) गलती करने लगता है:

  • समान आकार (Similar Shapes): "एक सिक्का और एक बटन" मांगना। चूंकि वे दोनों गोल और चपटे हैं, AI शायद केवल एक बड़ी गोल चीज़ बना देता है।
  • समान बनावट (Similar Textures): "एक ज़ेबरा और एक तेंदुआ" मांगना। चूंकि दोनों में धारियां/धब्बे होते हैं, AI उन पैटर्नों को एक ही जानवर में मिला सकता है।
  • असमान बैकग्राउंड (Dissimilar Backgrounds): "एक ध्रुवीय भालू और एक कैक्टस" मांगना। AI जानता है कि ध्रुवीय भालू बर्फ में रहते हैं और कैक्टस रेगिस्तान में, इसलिए वह भ्रमित हो जाता है कि उन्हें कहाँ रखना है, जिससे अक्सर एक गायब हो जाता है या गलत जगह पर चला जाता है।
  • कई वस्तुएं (Many Objects): "एक बिल्ली, एक कुत्ता, एक घोड़ा और एक पक्षी" जैसी चीजें मांगना। आप जितनी अधिक चीजें जोड़ेंगे, AI के भूलने या उन्हें आपस में मिलाने की संभावना उतनी ही अधिक होगी।

2. गुप्त नुस्खा: "डायरेक्शनल वेक्टर्स" (The "Secret Sauce: Directional Vectors")

लेखकों ने महसूस किया कि AI शब्दों को "देखता" नहीं है; वह उन्हें गणितीय निर्देशांकों (mathematical coordinates) के रूप में देखता है (सोचिए कि वे एक विशाल मानचित्र पर स्थान हैं)।

  • पुराना तरीका: जब आप "बिल्ली और कुत्ता" टाइप करते हैं, तो AI "बिल्ली" के लिए मानचित्र और "कुत्ते" के लिए मानचित्र देखता है। लेकिन क्योंकि AI शब्दों को एक के बाद एक पढ़ता है (एक वाक्य की तरह), "कुत्ते" वाले हिस्से में गलती से "बिल्ली" की कुछ जानकारी मिल जाती है, और इसके विपरीत भी। यह एक साथ दो लोगों की बातें सुनने जैसा है; उनकी आवाज़ें एक-दूसरे में मिल जाती हैं।
  • DOS समाधान: लेखकों ने इस मानचित्र पर तीर (arrows) खींचने का एक तरीका बनाया है।
    • वे "बिल्ली" और "कुत्ता" के बीच के अंतर की गणना करते हैं।
    • वे एक तीर बनाते हैं जो कहता है, "बिल्ली होने के लिए इस दिशा में जाओ, और कुत्ता होने के लिए उस दिशा में जाओ।"
    • वे फिर "बिल्ली" के निर्देश को "बिल्ली" की दिशा में और अधिक आगे बढ़ाते हैं और "कुत्ते" के निर्देश को "कुत्ते" की दिशा में और अधिक आगे बढ़ाते हैं।

उपमा: कल्पना कीजिए कि एलिस और बॉब, एक भीड़ भरे कमरे (AI का दिमाग) में खड़े हैं। वे इतने करीब हैं कि वे एक-दूसरे से टकरा रहे हैं।

  • DOS के बिना: वे एक-दूसरे में दब गए हैं, और आप पहचान नहीं सकते कि कौन कौन है।
  • DOS के साथ: लेखक एलिस को धीरे से बाईं ओर और बॉब को दाईं ओर धकेल देते हैं, जिससे उन्हें अपना व्यक्तिगत स्थान मिल जाता है ताकि वे एक-दूसरे के कपड़े या आवाज़ न मिला सकें।

3. यह कैसे काम करता है (द "स्मार्ट पुश")

यह विधि केवल एक रैंडम धक्का नहीं है; यह एक स्मार्ट, एडेप्टिव पुश है।

  • यदि आप "एक बिल्ली और एक कुत्ता" मांगते हैं, तो AI जानता है कि ये बहुत अलग हैं, इसलिए यह उन्हें धीरे से अलग करता है।
  • यदि आप "एक सिक्का और एक बटन" (जो बहुत समान दिखते हैं) मांगते हैं, तो AI समझ जाता है कि यह एक कठिन मामला है। यह सुनिश्चित करने के लिए कि वे आपस में न मिलें, यह एक मजबूत धक्का (stronger push) लगाता है।
  • यह बैकग्राउंड की भी जांच करता है। यदि आप "एक मछली और एक पक्षी" मांगते हैं, तो यह जानता है कि मछली पानी में और पक्षी आकाश में होना चाहिए, इसलिए यह उन्हें उनके प्राकृतिक वातावरण की ओर धकेलता है।

4. यह क्यों एक बड़ी बात है

पिछले तरीकों ने इसे चित्र को बार-बार फिर से बनाने की कोशिश करके ठीक करने का प्रयास किया (जैसे एक चित्रकार कैनवास से मिटाकर फिर से पेंट करता है)। यह धीमा और महंगा है।

DOS अलग है: यह खाना शुरू करने से पहले ही रेसिपी कार्ड को ठीक कर देता है।

  • गति: क्योंकि यह केवल खाना शुरू करने से पहले निर्देशों में बदलाव करता है, यह पुराने तरीकों की तुलना में 4 गुना तेज़ है।
  • गुणवत्ता: परीक्षणों में, यह वस्तुओं को अलग रखने में बहुत बेहतर था। मानव वोटिंग में, लोगों ने अन्य तरीकों की तुलना में DOS छवियों को काफी अधिक पसंद किया।

सारांश

DOS को AI की कल्पना के लिए एक ट्रैफिक कंट्रोलर के रूप में समझें। जब AI कई चीजों के साथ एक दृश्य की कल्पना करने की कोशिश करता है, तो ट्रैफिक कंट्रोलर हस्तक्षेप करता है, जमीन पर तीर खींचता है, और कहता है, "तुम बाईं ओर जाओ, तुम दाईं ओर जाओ, और तुम आकाश में रहो।" यह सुनिश्चित करता है कि जब अंतिम चित्र बनाया जाता है, तो हर वस्तु अपनी जगह पर, स्पष्ट और अलग होती है, बिना भीड़ में खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →