← नवीनतम पेपर
💻 computer science

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट जनरेशन (LCG) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो लंबे दृश्य आख्यानों (विजुअल नैरेटिव्स) के लिए सुसंगत, स्केलेबल मल्टी-इमेज सिंथेसिस प्राप्त करने हेतु स्पार्स रिलेशनल अटेंशन और एक रूटिंग कंसिस्टेंसी कंस्ट्रेंट का उपयोग करता है, जिसे एक नए बड़े पैमाने के डेटासेट द्वारा मान्य किया गया है और चरित्र एवं अर्थ संबंधी निरंतरता में बेसलाइन्स पर बेहतर प्रदर्शन के साथ सिद्ध किया गया है।

मूल लेखक: Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार हैं जो एक कॉमिक बुक बनाने की कोशिश कर रहे हैं। आपके पास 20 अलग-अलग दृश्यों की एक स्क्रिप्ट है। चुनौती केवल एक सुंदर चित्र बनाने की नहीं है; बल्कि एक के बाद एक 20 चित्र बनाने की है जहाँ मुख्य पात्र हर पैनल में बिल्कुल एक जैसा दिखता हो, भले ही उसने अलग-अलग कपड़े पहने हों, वह अलग-अलग जगहों पर खड़ा हो, या अलग-अलग काम कर रहा हो।

वर्तमान AI आर्ट टूल्स उन प्रतिभाशाली कलाकारों की तरह हैं जो एक एकल शानदार पोर्ट्रेट बना सकते हैं। लेकिन यदि आप उनसे पूरी कहानी बनाने के लिए कहते हैं, तो वे "ड्रिफ्ट" (भटक) जाते हैं। पैनल 1 में, नायक की नीली आँखें और एक निशान है। पैनल 10 तक, नायक अचानक हरी आँखों वाला और बिना निशान के हो सकता है, या खलनायक नायक जैसा दिख सकता है। यह पेपर, LCG, इस समस्या को ठीक करने का एक नया तरीका पेश करता है।

यहाँ इस पेपर के समाधान का विवरण सरल अवधारणाओं में दिया गया है:

1. समस्या: "मेमोरी ओवरलोड" (स्मृति का बोझ)

20 छवियों में एक पात्र को सुसंगत रखने के लिए, AI को उस पात्र के रूप में दिखने के लिए सभी 20 छवियों को एक ही समय में देखना होगा।

  • पुराना तरीका: कल्पना कीजिए कि आप एक साथ 20 लोगों से बातचीत करने की कोशिश कर रहे हैं, जहाँ हर कोई एक-दूसरे पर चिल्ला रहा है। जैसे-जैसे समूह बड़ा होता जाता है, शोर को प्रबंधित करना असंभव हो जाता है, और आपका मस्तिष्क (कंप्यूटर की मेमोरी) क्रैश हो जाता है। ऐसा तब होता है जब AI सभी छवियों को "डेंसली" (हर छवि के हर पिक्सेल को दूसरे के साथ जोड़कर) देखने की कोशिश करता है।
  • परिणाम: AI भ्रमित हो जाता है, पात्र का स्वरूप बदल जाता है, या कंप्यूटर की मेमोरी खत्म हो जाती है।

2. समाधान: "स्पार्स रिलेशनल अटेंशन" (SRA)

लेखकों ने एक नया तंत्र बनाया है जिसे स्पार्स रिलेशनल अटेंशन (SRA) कहा जाता है। इसे एक फ्लडलाइट के बजाय AI को एक स्मार्ट हाइलाइटर देने के रूप में समझें।

  • यह कैसे काम करता है: AI द्वारा इमेज A के हर हिस्से को इमेज B के हर हिस्से से जोड़ने के बजाय, यह पूछता है: "इमेज B में सबसे महत्वपूर्ण चीज़ क्या है जिसे मुझे इमेज A को सुसंगत बनाए रखने के लिए देखने की आवश्यकता है?"
  • उपमा: कल्पना कीजिए कि आप एक किताब का सीक्वल लिख रहे हैं। नायक का नाम याद रखने के लिए आपको 1,000 किताबों के पूरे पुस्तकालय को फिर से पढ़ने की आवश्यकता नहीं है। आपको बस उस विशिष्ट चरित्र इंडेक्स कार्ड को देखने की आवश्यकता है। SRA उसी इंडेक्स कार्ड की तरह कार्य करता है। यह अन्य छवियों से केवल "मुख्य विशेषताओं" (जैसे नायक का चेहरा या एक विशिष्ट पोशाक) को चुनता है और बाकी को अनदेखा कर देता है। यह कंप्यूटर को तेज़ रखता है और इसे अभिभूत होने से बचाता है, भले ही कहानियाँ लंबी हों।

3. सुरक्षा जाल: "रूटिंग कंसिस्टेंसी कंस्ट्रेंट" (RCC)

स्मार्ट हाइलाइटर के साथ भी, AI अभी भी भ्रमित हो सकता है। उदाहरण के लिए, यदि दो पात्र दोनों लाल कोट पहने हुए हैं, तो AI गलती से उनके चेहरे बदल सकता है।

इसे रोकने के लिए, लेखकों ने एक नियम जोड़ा है जिसे रूटिंग कंसिस्टेंसी कंस्ट्रेंट (RCC) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक सख्त संपादक है जिसके पास कहानी के हर व्यक्ति के लिए एक "चरित्र शीट" (मास्क) है। संपादक AI को बताता है: "जब आप पैनल 5 में नायक को चित्रित करें, तो आपको पैनल 1 में नायक के चेहरे को देखना चाहिए, न कि खलनायक के चेहरे को, भले ही वे एक ही रंग के कपड़े पहने हों।"
  • यह कैसे काम करता है: सिस्टम इन "मास्क" का उपयोग करके AI को जानकारी को सही ढंग से रूट करने के लिए मजबूर करता है। यदि AI गलत व्यक्ति की विशेषताओं को कॉपी करने की कोशिश करता है, तो सिस्टम कहता है, "नहीं, यह गलत रास्ता है," और उसे सुधारता है। यह सुनिश्चित करता है कि भीड़भाड़ वाले दृश्यों में भी नायक, नायक ही रहे और खलनायक, खलनायक ही रहे।

4. प्रशिक्षण मैदान: LCCD डेटासेट

AI को यह सिखाने के लिए कि यह कैसे किया जाए, शोधकर्ताओं को इंटरनेट से यादृच्छिक (random) तस्वीरें नहीं मिल सकती थीं (गोपनीयता और कॉपीराइट मुद्दों के कारण)। इसके बजाय, उन्होंने एक विशाल, कस्टम-मेड ट्रेनिंग सेट बनाया जिसे LCCD (लॉन्ग-कॉन्टेक्स्ट कंसिस्टेंसी डेटासेट) कहा जाता है।

  • पैमाना: उन्होंने 6,00,000 नकली कहानी अनुक्रम (sequences) बनाए। प्रत्येक अनुक्रम में 6 से 20 छवियां हैं।
  • विविधता: कुछ कहानियों में एक पात्र है, दूसरों में कई। उन्होंने इन छवियों को उत्पन्न करने के लिए AI का उपयोग किया और फिर एक अन्य AI का उपयोग यह जांचने के लिए किया: "क्या पात्र हर तस्वीर में एक जैसा दिखता है?" यदि पात्र बहुत अधिक बदल गया, तो उस कहानी को बाहर कर दिया गया। इससे उन्हें प्रशिक्षित करने के लिए एक "परफेक्ट" डेटासेट मिला।

5. परिणाम

जब उन्होंने अपने नए सिस्टम (LCG) का अन्य तरीकों के मुकाबले परीक्षण किया:

  • बेहतर निरंतरता (Consistency): लंबी अनुक्रमों (20 छवियों तक) में पात्र बहुत अधिक सुसंगत दिखे।
  • बेहतर कहानी सुनाना: AI ने प्रत्येक दृश्य के लिए विशिष्ट निर्देशों (जैसे, "बेंच पर बैठना" बनाम "लाइब्रेरी में खड़ा होना") का पालन किया, बिना पात्र की पहचान खोए।
  • दक्षता (Efficiency): "स्मार्ट हाइलाइटर" (SRA) के कारण, सिस्टम लंबी कहानियों को बिना कंप्यूटर की मेमोरी क्रैश किए संभाल सकता था, जबकि पुराने तरीके विफल हो जाते थे जब कहानी बहुत लंबी हो जाती थी।

संक्षेप में: यह पेपर एक नया फ्रेमवर्क प्रस्तुत करता है जो AI को लंबी, सुसंगत दृश्य कहानियाँ (जैसे कॉमिक्स या स्टोरीबोर्ड) उत्पन्न करने की अनुमति देता है। यह केवल महत्वपूर्ण विवरणों पर ध्यान केंद्रित करने के लिए एक "स्मार्ट हाइलाइटर" और पात्रों को आपस में मिलने से रोकने के लिए एक "सख्त संपादक" का उपयोग करता है, और यह सब कंप्यूटर को कुशलतापूर्वक चलाने के साथ किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →