← नवीनतम पेपर
💻 computer science

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

यह शोध पत्र एडेप्टिव ऑक्जिलरी प्रॉम्प्ट ब्लेंडिंग (AAPB) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो टवीडी की पहचान (Tweedie's identity) पर आधारित एक क्लोज्ड-फॉर्म एडेप्टिव गुणांक का उपयोग करता है ताकि ऑक्जिलरी एंकर प्रॉम्प्ट्स और टारगेट प्रॉम्प्ट्स के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे डिफ्यूजन मॉडल्स में दुर्लभ अवधारणाओं और संपादन कार्यों के लिए अर्थपूर्ण रूप से सटीक और संरचनात्मक रूप से निष्ठावान छवि निर्माण सुनिश्चित किया जा सके।

मूल लेखक: Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास डिफ्यूजन (Diffusion) नाम का एक सुपर-स्मार्ट कलाकार है। इस कलाकार ने लाखों चित्रों और उनके विवरणों का वर्षों तक अध्ययन किया है। वे "एक बिल्ली," "एक समुद्र तट," या "एक कार" जैसी सामान्य चीजों को बनाने में माहिर हैं।

लेकिन, यदि आप उन्हें कुछ दुर्लभ या अजीब चीज़ बनाने के लिए कहते हैं, जैसे कि "एक बालों वाला मेंढक" या "एक बाघ की धारियों वाला डलमेशन," तो वे भ्रमित हो जाते हैं। क्योंकि उन्होंने बहुत सारे सामान्य मेंढक और सामान्य डलमेशन देखे हैं, उनका दिमाग सबसे आम संस्करण पर ही वापस चला जाता है। वे आपके विशिष्ट अनुरोध से भटक जाते हैं और एक सामान्य मेंढक बना देते हैं या आपके विशिष्ट मिश्रण के बजाय एक जेनेरिक कुत्ता बना देते हैं। वे अपने सबसे अच्छे ज्ञान की ओर वापस लौट जाते हैं।

यह पेपर इस समस्या को ठीक करने के लिए AAPB (Adaptive Auxiliary Prompt Blending) नामक एक नई तकनीक पेश करता है। यह कैसे काम करता है, इसके लिए कुछ रोजमर्रा के उदाहरणों का उपयोग किया गया है:

समस्या: "भटकता हुआ जहाज" (The Drifting Ship)

AI की निर्माण प्रक्रिया को एक जहाज की तरह समझें जो एक विशिष्ट, छिपे हुए द्वीप (आपका दुर्लभ विचार, जैसे, "बालों वाला मेंढक") की ओर जाने की कोशिश कर रहा है।

  • महासागर: AI का प्रशिक्षण डेटा महासागर है। अधिकांश महासागर "सामान्य द्वीपों" (सामान्य मेंढक) से भरा है।
  • भटकाव (The Drift): क्योंकि "बालों वाला मेंढक" द्वीप बहुत दुर्लभ है, जहाज का दिशा-सूचक यंत्र (AI का आंतरिक तर्क) वहां कमजोर हो जाता है। जहाज स्वाभाविक रूप से निकटतम, सबसे भीड़भाड़ वाले द्वीप (सामान्य मेंढक) की ओर बह जाता है क्योंकि वहां पानी गहरा और सुरक्षित है।

पुराना समाधान: "कठोर लाइफ जैकेट" (The Rigid Life Vest)

पिछले तरीकों ने जहाज को एक लाइफ जैकेट (एक "एंकर" प्रॉम्प्ट) देकर इसे ठीक करने की कोशिश की।

  • यदि आप एक "बालों वाले मेंढक" को चाहते हैं, तो लाइफ जैकेट "बालों वाला जानवर" है।
  • दोष: पुराने तरीकों में एक निश्चित (fixed) लाइफ जैकेट का उपयोग किया जाता था। उन्होंने कहा, "इस लाइफ जैकेट को 50% समय पकड़ कर रखें।"
    • यदि वे इसे बहुत कसकर पकड़ते हैं, तो जहाज "बालों वाले जानवर" के द्वीप पर फंस जाता है और कभी "मेंढक" वाले हिस्से तक नहीं पहुँच पाता।
    • यदि वे इसे बहुत ढीला छोड़ देते हैं, तो जहाज वापस "सामान्य मेंढक" के द्वीप की ओर बह जाता है।
    • समस्या यह है कि जहाज को अलग-अलग समय पर अलग-अलग मदद की आवश्यकता होती है। कभी-कभी उसे मजबूत पकड़ की आवश्यकता होती है; कभी-कभी उसे छोड़ना पड़ता है और खुद स्टीयरिंग संभालनी पड़ती है।

नया समाधान: "स्मार्ट, अनुकूलनीय मार्गदर्शक" (The Smart, Adaptive Guide)

लेखकों की विधि, AAPB, एक कठोर लाइफ जैकेट के बजाय जहाज को एक स्मार्ट, अनुकूलनीय मार्गदर्शक देने जैसा है।

  1. दो प्रॉम्प्ट्स:

    • टारगेट प्रॉम्प्ट (Target Prompt): "बालों वाला मेंढक" (गंतव्य)।
    • एंकर प्रॉम्प्ट (Anchor Prompt): "बालों वाला जानवर" (सुरक्षा जाल)।
  2. जादुई फॉर्मूला (The "Adaptive Coefficient"):
    एक निश्चित 50/50 के विभाजन के बजाय, AI ड्राइंग प्रक्रिया के हर एक चरण में एक परफेक्ट, बदलता हुआ संतुलन की गणना करता है।

    • प्रक्रिया की शुरुआत में: जहाज द्वीप से दूर है और बहुत भ्रमित है। मार्गदर्शक कहता है, "ताकि हम भटक न जाएं, 'बालों वाले जानवर' की अवधारणा को मजबूती से पकड़ लो!" (एंकर पर उच्च निर्भरता)।
    • प्रक्रिया के अंत में: जहाज "मेंढक" के आकार के करीब पहुँच रहा है। मार्गदर्शक कहता है, "ठीक है, अब तुम स्थिर हो। 'जानवर' वाले हिस्से को छोड़ दो और पूरी तरह से 'मेंढक' बनाने पर ध्यान केंद्रित करो!" (एंकर पर कम निर्भरता)।
  3. "Tweedie's Identity" का गुप्त नुस्खा:
    यह पेपर यह पता लगाने के लिए कि किसी भी क्षण में एंकर पर कितना सहारा लेना है, एक गणितीय ट्रिक (Tweedie's identity) का उपयोग करता है। यह एक GPS की तरह है जो हवा और लहरों के आधार पर लगातार रास्ता फिर से कैलकुलेट करता है, जिससे यह सुनिश्चित होता है कि जहाज "सामान्य मेंढक" से टकराए बिना "बालों वाले मेंढक" के सटीक पथ पर बना रहे।

यह बेहतर क्यों है?

  • कोई री-ट्रेनिंग नहीं: आपको AI को एक नई भाषा सिखाने की आवश्यकता नहीं है। आप बस यह बदलते हैं कि वह चित्र बनाते समय कैसे सोचता है।
  • एडिटिंग के लिए उपयोगी: यह फोटो बदलने के लिए भी काम करता है। यदि आप एक "धूसर (gray) बिल्ली" को "शेर" में बदलना चाहते हैं, तो AI बिल्ली के आकार को बनाए रखने के लिए मूल फोटो का उपयोग "एंकर" के रूप में करता है, जबकि "शेर" प्रॉम्प्ट फर और चेहरे को बदल देता है। अनुकूलनीय मार्गदर्शक जानता है कि कब बिल्ली के आकार को बनाए रखना है और कब शेर के लक्षणों को हावी होने देना है।

परिणाम

परीक्षणों में, यह विधि कलाकार को एक सुपरपावर देने के समान थी।

  • दुर्लभ अवधारणाएं: इसने सफलतापूर्वक "बालों वाले मेंढक," "केले के आकार की कार," और "बाघ की धारियों वाले डलमेशन" को बनाया जो वास्तव में प्रॉम्प्ट की तरह दिखे, न कि केवल सामान्य संस्करण की तरह।
  • संरचना (Structure): फोटो एडिट करते समय, इसने मूल संरचना (जैसे चेहरे या इमारत का आकार) को बनाए रखा और साथ ही नए बदलावों को पूरी तरह से लागू किया।

संक्षेप में: AAPB, AI को आलसी होने और सामान्य विचारों पर डिफ़ॉल्ट होने से रोकता है। यह एक गतिशील कोच की तरह कार्य करता है, जो लगातार यह समायोजित करता है कि आपके विशिष्ट, अजीब और अद्भुत विचारों के प्रति सच्चे रहने के लिए AI को कितनी मदद की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →