← नवीनतम पेपर
💻 computer science

Consistent text-to-image generation via scene de-contextualization

यह शोध पत्र सीन डी-कॉन्टेक्स्टुअलाइजेशन (SDeC) को प्रस्तुत करता है, जो एक नवीन, प्रशिक्षण-मुक्त विधि है जो प्रॉम्प्ट एम्बेडिंग के भीतर लेटेंट सीन-कॉन्टेक्स्ट सहसंबंधों को अनुकूल रूप से दबाकर टेक्स्ट-टू-इमेज जनरेशन में आइडेंटिटी शिफ्ट को कम करती है, जिससे लक्षित वातावरण के पूर्व ज्ञान की आवश्यकता के बिना विविध दृश्यों में सुसंगत विषय संरक्षण सक्षम होता है।

मूल लेखक: Song Tang, Peihao Gong, Kunyu Li, Kai Guo, Boyu Wang, Mao Ye, Jianwei Zhang, Xiatian Zhu

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Song Tang, Peihao Gong, Kunyu Li, Kai Guo, Boyu Wang, Mao Ye, Jianwei Zhang, Xiatian Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशिष्ट पात्र, जिसे हम "बॉब" कह सकते हैं, के बारे में एक फिल्म बना रहे हैं, जिसके लिए आप एक निर्देशक हैं। आप चाहते हैं कि बॉब हर दृश्य में बिल्कुल एक जैसा दिखे: वही चेहरा, वही कद-काठी, वही अनूठी शैली। हालाँकि, आप चाहते हैं कि वह एक दृश्य में रसोई में हो, अगले में जंगल में हो, और तीसरे में एक अंतरिक्ष यान (spaceship) में हो।

जब आप वर्तमान AI आर्ट जनरेटरों (जैसे स्टेबल डिफ्यूजन) का उपयोग करते हैं, तो कुछ अजीब होता है। जब आप "रसोई में बॉब" के लिए पूछते हैं, तो आपको एक आदमी मिलता है जो बॉब जैसा दिखता है। लेकिन जब आप "जंगल में बॉब" के लिए पूछते हैं, तो AI अचानक बॉब के चेहरे, उसके बालों या उसके कपड़ों को बदल देता है ताकि वे "जंगल के माहौल" (vibe) से मेल खा सकें। AI बॉब को भूल जाता है। यह ऐसा है जैसे अभिनेता ने अपने संवाद भुला दिए हों और केवल परिवेश बदलने के कारण एक अलग पात्र निभाने लगा हो।

यह शोध पत्र, जिसका शीर्षक "कंसिस्टेंट टेक्स्ट-टू-इमेज जनरेशन वाया सीन डी-कॉन्टेक्स्टुअलाइजेशन" (SDeC) है, इस समस्या को हल करता है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "कॉन्टेक्स्ट ट्रैप" (संदर्भ का जाल)

लेखकों ने खोजा कि यह क्यों होता है। वे इसे "सीन कॉन्टेक्स्टुअलाइजेशन" कहते हैं।

AI मॉडल को एक ऐसे छात्र की तरह समझें जिसने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। इस छात्र ने एक नियम सीखा है: "यदि आप 'रसोई' देखते हैं, तो आप आमतौर पर 'एप्रन' और 'चूल्हा' देखते हैं। यदि आप 'जंगल' देखते हैं, तो आप आमतौर पर 'सफारी टोपी' और 'कीचड़' देखते हैं।"

जब आप AI को "जंगल में बॉब" बनाने के लिए कहते हैं, तो AI "जंगल" शब्द को लेकर इतना उत्साहित हो जाता है कि वह गलती से बॉब के चेहरे में "सफारी टोपी" और "कीचड़" को भी खींच लाता है। AI दृश्य (scene) को पात्र (person) से जोड़ने में इतना कुशल है कि वह व्यक्ति की पहचान को दृश्य की अपेक्षाओं के साथ ओवरराइट कर देता है।

उपमा: कल्पना कीजिए कि आपने एक बहुत ही विशिष्ट, अनूठा मुखौटा (अपनी पहचान) पहना हुआ है। आप पार्टी की सजावटों से भरे कमरे में जाते हैं (दृश्य)। AI पार्टी की सजावट के प्रति इतना जुनूनी है कि वह आपकी सजावट को आपके मुखौटे पर पेंट करने की कोशिश करता है, जिससे आपका चेहरा पार्टी के अनुरूप बदल जाता है।

2. पुराना तरीका बनाम नया तरीका

पुराना तरीका ("ऑल-सीइंग" विधि):
पिछले तरीकों ने इसे ठीक करने की कोशिश की कि बॉब भविष्य में किन-किन दृश्यों में होगा, उन्हें शुरू करने से पहले AI को हर एक दृश्य दिखाया जाए। वे कहते थे, "यहाँ रसोई में बॉब है, यहाँ जंगल में बॉब है, यहाँ अंतरिक्ष में बॉब है। अब, बॉब को सीखो।"

  • दोष: वास्तविक जीवन में (जैसे फिल्म या कॉमिक बनाने में), आप अक्सर पहले से नहीं जानते कि सभी दृश्य क्या होंगे। आप कल एक नया दृश्य लिख सकते हैं। आप चित्र बनाना शुरू करने से पहले AI को पूरी स्क्रिप्ट दिखाने का इंतज़ार नहीं कर सकते।

नया तरीका (SDeC - "सीन डी-कॉन्टेक्स्टुअलाइजेशन" विधि):
लेखक एक चतुर तकनीक प्रस्तावित करते हैं जो एक समय में एक दृश्य पर काम करती है। आपको भविष्य जानने की आवश्यकता नहीं है। आपको बस AI को बताना है, "जंगल में बॉब को बनाओ," और यह विधि इसे तुरंत ठीक कर देती है।

3. SDeC कैसे काम करता है: "गणितीय फ़िल्टर"

लेखकों ने महसूस किया कि AI का "मस्तिष्क" (इसका आंतरिक गणित) "बॉब" के निर्देशों और "जंगल" के निर्देशों को मिलाने का एक विशिष्ट तरीका रखता है। उन्होंने AI को फिर से प्रशिक्षित किए बिना उन्हें अलग करने का एक तरीका खोजा।

यहाँ रूपक का उपयोग करते हुए चरण-दर-चरण प्रक्रिया दी गई है:

  • चरण 1: "फॉरवर्ड और बैकवर्ड" नृत्य।
    कल्पना कीजिए कि "बॉब" के लिए AI के निर्देश एक गाना हैं। "जंगल" के निर्देश एक अलग गाना हैं। AI दोनों को एक साथ बजाने की कोशिश करता है, लेकिन जंगल का गाना बॉब के गाने को दबा रहा है।
    SDeC एक छोटा प्रयोग करता है: यह अस्थायी रूप से "बॉब" के गाने को बिल्कुल "जंगल" के गाने जैसा सुनने के लिए मजबूर करता है (फॉरवर्ड), और फिर इसे वापस वैसा ही करने की कोशिश करता है जैसा बॉब मूल रूप से था (बैकवर्ड)।

  • क्यों? यह देखकर कि गाना कैसे बदलता है और फिर सामान्य होने की कोशिश करता है, सिस्टम यह पहचान सकता है कि कौन से नोट्स (गणितीय दिशाएं) "जंगल" के हैं और कौन से "बॉब" के हैं।

  • चरण 2: "वॉल्यूम नॉब" (आइजनवैल्यू वेटिंग)।
    एक बार जब उन्हें पता चल जाता है कि कौन से नोट्स "जंगल का शोर" हैं जो बॉब के चेहरे को बिगाड़ रहे हैं, तो वे उन विशिष्ट नोट्स की आवाज़ कम कर देते हैं। वे उन नोट्स की आवाज़ को ऊपर रखते हैं जो बॉब को बॉब जैसा दिखाते हैं।

  • परिणाम: वे एक "साफ" (cleaned) निर्देश बनाते हैं जो "बॉब" कहता है लेकिन उन आकस्मिक "जंगल" निर्देशों को हटा देता है जो उसके चेहरे को बदलने की कोशिश कर रहे थे।

  • चरण 3: अंतिम चित्र।
    AI इस साफ किए गए निर्देश को लेता है और चित्र बनाता है। अब, बॉब जंगल में है, सफारी टोपी पहने हुए (क्योंकि दृश्य ने इसकी मांग की थी), लेकिन उसका चेहरा अभी भी 100% बॉब है।

4. यह एक बड़ी बात क्यों है

  • कोई प्रशिक्षण आवश्यक नहीं: आपको AI को कुछ भी नया सिखाने की आवश्यकता नहीं है। यह AI को चश्मा देने जैसा है जो उसे तुरंत "दृश्य" और "विषय" के बीच अंतर देखने में मदद करता है।
  • लचीलापन: आप कहानी को एक-एक दृश्य करके बना सकते हैं। आपको पूरी स्क्रिप्ट तैयार रखने की आवश्यकता नहीं है।
  • बेहतर गुणवत्ता: परीक्षणों में, इस पद्धति ने पात्रों को बहुत बेहतर तरीके से सुसंगत बनाए रखा, जिससे दृश्य उबाऊ या दोहराव वाले नहीं लगे।

सारांश

SDeC को AI आर्ट के लिए एक स्मार्ट एडिटर के रूप में समझें। जब AI पृष्ठभूमि (दृश्य) को मुख्य पात्र (पहचान) को खराब करने की कोशिश करता है, तो SDeC हस्तक्षेप करता है, कहता है, "रुको, थोड़ा ठहर जाओ," और धीरे से दोनों को अलग कर देता है। यह सुनिश्चित करता है कि वह चाहे कहीं भी जाए, वह हमेशा स्वयं ही रहे।

यह "आइडेंटिटी शिफ्ट" (पहचान परिवर्तन) की समस्या को पात्र के चेहरे पर दृश्य के प्रभाव को गणितीय रूप से हटाकर हल करता है, जिससे किसी भी कहानी में, कभी भी, सुसंगत पात्रों को बनाना संभव होता है, बिना पूरी कहानी को पहले से जाने।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →