← नवीनतम पेपर
🤖 AI

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

यह शोध पत्र DAVE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो शुरुआती ट्रांसफार्मर फीचर्स में तेजी से अभिसरण करने वाले शून्य-आवृत्ति (DC) घटक को कम करके टेक्स्ट-टू-इमेज जनरेशन की विविधता को बढ़ाती है, जिससे इमेज की गुणवत्ता या सैंपलिंग दक्षता से समझौता किए बिना ट्रैजेक्टरी लॉक-इन को तोड़ा जा सकता है।

मूल लेखक: Dahee Kwon, Haeun Lee, Jaesik Choi

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dahee Kwon, Haeun Lee, Jaesik Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "कुकी कटर" प्रभाव (The "Cookie Cutter" Effect)

कल्पना कीजिए कि आपके पास एक जादुई मशीन है जो आपके विवरण के आधार पर चित्र बनाती है। आप उसे कहते हैं, "कालीन पर बैठी एक बिल्ली का चित्र बनाओ," और वह बना देती है। आप बिल्कुल उसी विवरण के साथ एक और चित्र मांगते हैं, और वह पहली वाली बिल्ली के लगभग समान ही दूसरा चित्र बनाती है। आप तीसरा पूछते हैं, और वह अभी भी वही बिल्ली और वही मुद्रा (pose) दिखाती है।

वर्तमान AI इमेज जनरेटर उच्च गुणवत्ता वाले चित्र बनाने में अद्भुत हैं, लेकिन वे "डाइवर्सिटी कोलैप्स" (विविधता का पतन) नामक समस्या से जूझ रहे हैं। भले ही आप उन्हें अलग-अलग शुरुआती बिंदु (जैसे अलग-अलग पासे फेंकना) दें, वे सभी एक ही रास्ते का अनुसरण करते हुए लगभग एक जैसे परिणाम देते हैं। वे विचार के एक ही उबाऊ संस्करण में "लॉक इन" हो जाते हैं।

जांच: "लॉक" की खोज करना

शोधकर्ता यह जानना चाहते थे कि ऐसा क्यों होता है। उन्होंने चित्र बनाते समय AI के "मस्तिष्क" (इसके आंतरिक स्तरों) के अंदर झाँका।

उन्होंने AI की सोचने की प्रक्रिया के एक विशिष्ट हिस्से की खोज की जो एक भारी लंगर (heavy anchor) की तरह काम करता है।

  • उपमा: कल्पना कीजिए कि AI एक जहाज है जो चित्रों के विशाल महासागर की खोज करने की कोशिश कर रहा है। यात्रा की शुरुआत में ही, जहाज एक विशाल, भारी लंगर (जिसे "DC component" कहा जाता है) डाल देता है जो महासागर के ठीक केंद्र से बंधा होता है।
  • खोज: चाहे जहाज कोई भी शुरुआती बिंदु चुने, यह लंगर हर एक जहाज को तुरंत एक ही स्थान पर खींच लाता है। क्योंकि सभी जहाज एक ही शुरुआती बिंदु पर फंस जाते हैं, वे अलग-अलग रास्तों की खोज नहीं कर पाते। वे सभी अंततः एक ही गंतव्य पर पहुँचते हैं।

शोधकर्ताओं ने पाया कि यह "लंगर" चित्र का औसत रंग और चमक (जीरो-फ्रीक्वेंसी कंपोनेंट) है। AI इस औसत की गणना इतनी तेज़ी से और इतनी मजबूती से करता है कि यह हर चित्र को विवरण जैसे कि फर, पत्तियाँ या बादल जोड़ने से पहले ही एक जैसा दिखने के लिए मजबूर कर देता है।

समाधान: DAVE (लंगर काटने वाला)

लेखकों ने DAVE (डाइवर्सिटी एन्हांसमेंट के लिए DC एटेन्यूएशन - DC Attenuation for diVersity Enhancement) नामक एक नई विधि प्रस्तावित की है।

  • यह कैसे काम करता है: AI को फिर से प्रशिक्षित (retrain) करने या इसे धीमा करने के बजाय, DAVE एक कैंची की तरह काम करता है जो यात्रा शुरू होते ही लंगर को पकड़े हुए रस्सी को काट देती है।
  • क्रिया: जनरेशन के शुरुआती समय के एक बहुत छोटे हिस्से के लिए, DAVE उस भारी "औसत" सिग्नल को धीरे से कमजोर कर देता है। यह AI को बताता है, "अभी उस एक विशिष्ट औसत पर लॉक मत हो। शुरुआती यादृच्छिक बिंदुओं (पासे के उछाल) को वास्तव में प्रभावी होने दो।"
  • परिणाम: क्योंकि लंगर कट गया है, जहाज (चित्र) तुरंत अलग-अलग दिशाओं में बहने के लिए स्वतंत्र हैं। एक जहाज लाल कालीन पर बिल्ली बनाने के लिए बाईं ओर जा सकता है; दूसरा नीले कालीन पर बिल्ली बनाने के लिए दाईं ओर जा सकता है। वे अभी भी आपके निर्देश ("एक बिल्ली बनाओ") का पालन करते हैं, लेकिन वे अलग-अलग लेआउट, शैलियों और संरचनाओं की खोज करते हैं।

यह विशेष क्यों है

अन्य अधिकांश तरीके इस समस्या को हल करने की कोशिश करते हैं:

  1. मशीन को कई बार चलाना (जिसमें बहुत समय लगता है और बहुत अधिक कंप्यूटर शक्ति की आवश्यकता होती है)।
  2. AI को अनुमान लगाने और जाँचने (guess and check) के लिए कहना (जो धीमा और जटिल है)।

DAVE अलग है क्योंकि:

  • यह मुफ्त है: इसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • यह तेज़ है: यह बहुत कम अतिरिक्त समय या कंप्यूटर मेमोरी लेता है। यह इंजन को फिर से बनाने के बजाय स्टीयरिंग व्हील में एक छोटे से समायोजन की तरह है।
  • यह सटीक है: यह केवल AI के मस्तिष्क के उस विशिष्ट हिस्से को छूता है जो समस्या का कारण बनता है, जिससे इसकी उच्च-गुणवत्ता वाली ड्राइंग क्षमता अप्रभावित रहती है।

परिणाम

जब शोधकर्ताओं ने DAVE का परीक्षण किया, तो उन्होंने पाया कि:

  • AI एक ही प्रॉम्प्ट (जैसे, "कालीन पर बिल्ली" के 10 अलग-अलग संस्करण) के कई अनूठे और विविध संस्करण बना सकता है।
  • चित्र अभी भी उच्च गुणवत्ता वाले थे और टेक्स्ट विवरण से पूरी तरह मेल खाते थे।
  • इसने कई अलग-अलग प्रकार के आधुनिक AI मॉडल (जैसे Stable Diffusion 3.5 और Flux) पर काम किया।

संक्षेप में: पेपर ने पाया कि AI इमेज जनरेटर इसलिए फंस जाते हैं क्योंकि वे बहुत जल्दी एक "ग्लोबल एवरेज" (वैश्विक औसत) पर लॉक हो जाते हैं। DAVE एक सरल, मुफ्त और तेज़ तरीका है जो उस लॉक को काट देता है, जिससे AI अपनी अच्छी तस्वीरें बनाने की क्षमता खोए बिना रचनात्मक संभावनाओं की एक बहुत व्यापक दुनिया की खोज कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →