← नवीनतम पेपर
💻 computer science

Context Forcing: Consistent Autoregressive Video Generation with Long Context

यह शोध पत्र "कॉन्टेक्स्ट फोर्सिंग" (Context Forcing) का प्रस्ताव करता है, जो एक लॉन्ग-कॉन्टेक्स्ट टीचर और एक स्लो-फास्ट मेमोरी आर्किटेक्चर का उपयोग करके लंबे वीडियो निर्माण में स्टूडेंट-टीचर मिसमैच को हल करने वाला एक नवीन ढांचा है, ताकि 20 सेकंड से अधिक की कॉन्टेक्स्ट लंबाई के साथ सुसंगत, वास्तविक समय में वीडियो निर्माण सक्षम किया जा सके।

मूल लेखक: Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त के साथ बारी-बारी से एक लंबी, निरंतर कहानी लिखने की कोशिश कर रहे हैं। आप एक पैराग्राफ लिखते हैं, फिर आपका दोस्त आपके द्वारा लिखे गए अगले पैराग्राफ के आधार पर अगला पैराग्राफ लिखता है, और इसी तरह आगे बढ़ता रहता है।

वर्तमान AI वीडियो जनरेटर के साथ समस्या यह है कि वे बहुत कम अल्पकालिक स्मृति (short-term memory) वाले दोस्त की तरह हैं। वे केवल आपके द्वारा लिखे गए पिछले कुछ वाक्यों (या वीडियो के कुछ सेकंड) को ही याद रख सकते हैं। जैसे-जैसे कहानी लंबी होती जाती है, वे भूल जाते हैं कि मुख्य पात्र कौन है, सेटिंग कैसी दिखती थी, या उन्होंने जो कथानक शुरू किया था वह क्या था। कहानी भटकने लगती है, और पात्र अचानक अपना चेहरा बदल सकते हैं या बैकग्राउंड किसी और चीज़ में बदल सकता है।

यह पेपर, "कॉन्टेक्स्ट फोर्सिंग" (Context Forcing), इसे एक लंबी अवधि की स्मृति (long-term memory) और एक स्मार्ट शिक्षक देकर हल करता है।

यह यहाँ कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "भुलक्कड़ शिक्षक" (The "Amnesiac Teacher")

वर्तमान में, अधिकांश AI वीडियो मॉडल एक "छात्र-शिक्षक" सेटअप का उपयोग करके प्रशिक्षित किए जाते हैं।

  • छात्र: वह AI जो लंबी वीडियो बनाने सीखने की कोशिश कर रहा है।
  • शिक्षक: एक मॉडल जो छात्र का मार्गदर्शन करता है।

समस्या यह है कि शिक्षक की केवल 5 सेकंड की स्मृति होती है। वह छात्र को क्या करना है यह बताने के लिए केवल वीडियो के पिछले 5 सेकंड को देख सकता है।

  • परिणाम: छात्र अतीत को भूलना सीख जाता है। यदि वीडियो 30 सेकंड तक चलता है, तो छात्र को पता ही नहीं होता कि 25 सेकंड पहले क्या हुआ था क्योंकि शिक्षक ने उसे कभी देखा ही नहीं। इसके कारण वीडियो "भटकने" लगता है या निरंतरता खो देता है।

2. समाधान: "सर्वज्ञ शिक्षक" (The "All-Knowing Teacher")

लेखकों ने कॉन्टेक्स्ट फोर्सिंग नामक एक नई विधि बनाई है।

  • नया शिक्षक: उन्होंने एक ऐसा शिक्षक प्रशिक्षित किया है जो वीडियो के पूरे इतिहास (20+ सेकंड या अधिक) को देख सकता है।
  • पाठ: अब, जब छात्र अगला फ्रेम जनरेट करने की कोशिश करता है, तो शिक्षक कहता है, "याद रखो, 20 सेकंड पहले, पात्र ने लाल टोपी पहनी थी और बाईं ओर चल रहा था। इसे ध्यान में रखो।"
  • समाधान: क्योंकि शिक्षक को पूरी कहानी पता है, इसलिए वह छात्र को लंबे समय तक पात्र और बैकग्राउंड को सुसंगत बनाए रखने के लिए मार्गदर्शन कर सकता है।

3. चुनौती: "ओवरलोडेड बैकपैक" (The "Overloaded Backpack")

यदि आप 20 सेकंड के वीडियो के हर विवरण (हर पिक्सेल, हर हलचल) को याद रखने की कोशिश करते हैं, तो आपका मस्तिष्क (या कंप्यूटर) अभिभूत हो जाएगा और क्रैश हो जाएगा। यह एक इमारत के पास से गुजरते समय वहां की हर एक ईंट को अपने बैग में भरने जैसा है; यह बहुत भारी होगा।

इसे हल करने के लिए, लेखकों ने एक स्मार्ट मेमोरी सिस्टम बनाया है (जिसे "स्लो-फास्ट मेमोरी" आर्किटेक्चर कहा जाता है):

  • फास्ट मेमोरी (Fast Memory): यह तत्काल अतीत (पिछले कुछ सेकंड) को रखती है। यह आपकी वर्किंग मेमोरी की तरह है, जो इस बात को थामे रहती है कि अभी ठीक अभी क्या हुआ।
  • स्लो मेमोरी (Slow Memory): यह "हाइलाइट रील" है। AI लगातार वीडियो की जांच करता है और पूछता है: "क्या यह नया फ्रेम पिछले वाले से इतना अलग है कि इसे महत्वपूर्ण माना जाए?"
    • यदि दृश्य स्थिर है (एक व्यक्ति स्थिर खड़ा है), तो यह अतिरिक्त फ्रेमों को अनदेखा कर देता है (स्पेस बचाने के लिए)।
    • यदि कुछ महत्वपूर्ण होता है (एक कार मोड़ लेती है, एक चेहरा घूमता है), तो यह उस "कीफ्रेम" (keyframe) को स्लो मेमोरी में सहेज लेता है।
  • सिंक (The Sink): एक छोटा, निश्चित क्षेत्र जो हमेशा वीडियो की शुरुआत को याद रखता है ताकि कहानी का आधार बना रहे।

यह सिस्टम AI को एक ऐसा "बैकपैक" ले जाने की अनुमति देता है जो चलाने के लिए पर्याप्त हल्का है, लेकिन 20+ सेकंड के वीडियो के महत्वपूर्ण कथानक बिंदुओं को याद रखने के लिए पर्याप्त भारी है।

4. परिणाम: एक सुसंगत फिल्म (A Consistent Movie)

इस सेटअप के साथ, AI अब ऐसे वीडियो जनरेट कर सकता है जो पिछले अत्याधुनिक मॉडलों की तुलना में 2 से 10 गुना लंबे होते हैं, बिना अपना नियंत्रण खोए।

  • पहले: एक वीडियो 5 सेकंड के लिए शानदार दिख सकता है, लेकिन 10वें सेकंड तक, पात्र का चेहरा बदल सकता है, या बैकग्राउंड के रंग बदल सकते हैं।
  • अब: वीडियो सुसंगत रहता है। पात्र का चेहरा वैसा ही रहता है, कपड़े समान रहते हैं, और बैकग्राउंड 20 सेकंड से अधिक समय (और संभावित रूप से एक मिनट तक) के लिए स्थिर रहता है।

सारांश उपमा (Summary Analogy)

एक लंबी वीडियो बनाना एक नाटक निर्देशित करने जैसा है:

  • पुरानी विधि: निर्देशक (शिक्षक) केवल मंच के पिछले 5 सेकंड देखता है। जब तक नाटक 30 मिनट तक चलता है, निर्देशक शुरुआती दृश्य को भूल जाता है, जिससे अभिनेता बेतरतीब ढंग से अभिनय करने लगते हैं।
  • कॉन्टेक्ट फोर्सिंग: निर्देशक के पास एक स्क्रिप्ट है और पूरे नाटक की स्मृति है। वे अभिनेताओं को बता सकते हैं, "याद रखो, पहले अंक में, तुम एक नीले कप को पकड़े हुए थे, इसलिए तीसरे अंक में भी उसे पकड़े रहो।"
  • मेमोरी सिस्टम: निर्देशक अभिनेताओं की हर एक सांस को याद नहीं करता (जो बहुत अधिक डेटा होगा)। इसके बजाय, वे केवल महत्वपूर्ण क्रियाओं और परिवर्तनों को याद करते हैं, बाकी को तत्काल संदर्भ के लिए "फास्ट बफर" में रखते हैं।

पेपर का दावा है कि यह विधि सफलतापूर्वक उस "भूलने" और "भटकने" को रोकती है जो आमतौर पर लंबी AI वीडियो को खराब कर देती है, जिससे मूल प्रॉम्प्ट के प्रति वफादार रहने वाली मिनट-भर की सुसंगत जनरेशन संभव होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →