← नवीनतम पेपर
💻 computer science

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

MemRoPE एक प्रशिक्षण-मुक्त ढांचा है जो गतिशील संदर्भ संपीड़न के लिए विकसित होते मेमोरी टोकन और स्थितिगत संघर्षों को हल करने के लिए ऑनलाइन RoPE इंडेक्सिंग को पेश करके उच्च-सटीक, अनंत वीडियो निर्माण को सक्षम बनाता है, जिससे मौजूदा ऑटोरेग्रेसिव डिफ्यूजन विधियों में अंतर्निहित पहचान विचलन (identity drift) और गति ठहराव (motion stagnation) पर विजय प्राप्त होती है।

मूल लेखक: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी कहानी सुनाने की कोशिश कर रहे हैं जो एक घंटे तक चलती है। आपके पास एक बहुत ही प्रतिभाशाली कहानीकार (AI) है, लेकिन उसकी याददाश्त बहुत खराब है। हर बार जब वह एक नया वाक्य बोलता है, तो वह पिछले वाक्य को भूल जाता है, या वह पात्रों के नाम भी आपस में मिला देता है। जब तक वह कहानी के अंत तक पहुँचता है, नायक एक खलनायक में बदल चुका होता है, परिवेश जंगल से बदलकर रेगिस्तान हो जाता है, और कथानक का कोई अर्थ नहीं रह जाता।

यह बिल्कुल वर्तमान AI वीडियो जनरेटरों की समस्या है। वे 5 सेकंड के छोटे क्लिप बनाने में बेहतरीन हैं, लेकिन जब आप उनसे 1 घंटे का वीडियो बनाने के लिए कहते हैं, तो गुणवत्ता बिखर जाती है। पात्र बदलने लगते हैं, बैकग्राउंड ग्लिच होने लगता है, और मोशन अटक जाता है।

MemRoPE एक नया "ट्रेनिंग-फ्री" समाधान है (इसका मतलब है कि इसे कुछ भी नया सीखने की आवश्यकता नहीं है) जो इस मेमोरी समस्या को ठीक करता है। यह कैसे काम करता है, इसके लिए यहाँ कुछ सरल उपमाएँ दी गई हैं:

1. समस्या: "स्लाइडिंग विंडो" बनाम "ब्लैक होल"

अधिकांश वर्तमान AI वीडियो निर्माता एक स्लाइडिंग विंडो (Sliding Window) का उपयोग करते हैं। कल्पना कीजिए कि आप एक संकीली नली के माध्यम से देख रहे हैं। आप केवल वीडियो के पिछले 10 सेकंड ही देख सकते हैं। जैसे-जैसे नए सेकंड आते हैं, पुराने वाले पीछे से गिर जाते हैं और हमेशा के लिए एक ब्लैक होल में फेंक दिए जाते हैं।

  • परिणाम: AI भूल जाता है कि 20 मिनट पहले मुख्य पात्र कौन था। यह एक "स्टैटिक एंकर" (जैसे कि पहले फ्रेम की एक फोटो) को भी बनाए रखने की कोशिश करता है (शुरुआत को याद रखने के लिए), लेकिन वह फोटो कभी अपडेट नहीं होती है, इसलिए वह उन चीजों में मदद नहीं करती जो समय के साथ बदलती रहती हैं।

2. समाधान: "स्मार्ट लाइब्रेरियन" (मेमोरी टोकन)

MemRoPE एक स्मार्ट लाइब्रेरियन (Smart Librarian) पेश करता है जो किताबों को फेंकता नहीं है। इसके बजाय, लाइब्रेरियन उनका सारांश (summarize) बनाता है।

  • दोहरी-धारा प्रणाली (The Dual-Stream System): AI दो विशेष "मेमोरी बाकेट्स" बनाए रखता है:
    • लॉन्ग-टर्म बाकेट (विश्वकोश/Encyclopedia): यह बाकेट अब तक के पूरे वीडियो के बारे में जानकारी को धीरे-धीरे सोख लेती है। यह मुख्य पात्र का चेहरा, कमरे की सामान्य शैली और मूल कहानी को याद रखती है। यह बहुत धीरे-धीरे अपडेट होती है, ताकि यह हर छोटी हलचल से भ्रमित न हो।
    • शॉर्ट-टर्म बाकेट (स्टिकी नोट/Sticky Note): यह बाकेट हालिया एक्शन को थामे रखती है। यह याद रखती है कि पिछले कुछ सेकंड में क्या हुआ था ताकि वीडियो स्थिर या झटकेदार न लगे।
  • यह कैसे काम करता है: जैसे-जैसे वीडियो चलता है, AI उन पुराने फ्रेम्स को लेता है जिन्हें भुला दिया जाने वाला होता है, उन्हें एक सारांश में संकुचित (compress) करता है, और इन दोनों बाकेट्स को अपडेट करता है। यह पूरी फिल्म की एक फोटो खींचकर अपनी जेब में रखने जैसा है, बजाय इसके कि हर एक सेकंड को याद रखने की कोशिश की जाए।

3. सीक्रेट सॉस: "अनलेबल बॉक्स" (ऑनलाइन RoPE इंडेक्सिंग)

यह तकनीकी रूप से जादुई हिस्सा है, लेकिन यहाँ इसका सरल संस्करण है।

AI में, हर जानकारी के पास एक "लेबल" होता है जो बताता है कि वह समय में कहाँ है (जैसे "फ्रेम 1," "फ्रेम 2," आदि)। आमतौर पर, ये लेबल जानकारी के साथ स्थायी रूप से चिपके होते हैं। यदि आप फ्रेम 1 और फ्रेम 100 की जानकारी को एक साथ मिलाने की कोशिश करते हैं, तो लेबल भ्रमित हो जाते हैं और गणित बिगड़ जाता है।

MemRoPE एक ट्रिक का उपयोग करता है जिसे ऑनलाइन RoPE इंडेक्सिंग (Online RoPE Indexing) कहा जाता है:

  • उपमा: कल्पना कीजिए कि आपके पास लेगो ब्रिक्स (Lego bricks) का एक डिब्बा है। आमतौर पर, ब्रिक्स पर "हाउस A का हिस्सा" या "हाउस B का हिस्सा" लिखा होता है। यदि आप उन्हें जोड़ने की कोशिश करते हैं, तो वे फिट नहीं बैठते।
  • MemRoPE का कदम: यह ब्रिक्स (वीडियो डेटा) को लेता है और उन्हें बिना किसी स्टैम्प (लेबल) के एक बॉक्स में रखता है। यह स्टैम्प केवल तब लगाता है जब ब्रिक्स को मिला दिया जाता है, ठीक उससे पहले जब AI उन्हें देखता है।
  • परिणाम: अब AI बिना गणित को भ्रमित किए "लॉन्ग-टर्म मेमोरी" को "न्यू फ्रेम" के साथ सुरक्षित रूप से मिला सकता है। यह AI को पूरे एक घंटे के वीडियो को एक निरंतर, सुसंगत कहानी के रूप में देखने की अनुमति देता है, भले ही वह एक समय में केवल एक छोटा सा हिस्सा ही देख रहा हो।

यह एक बड़ी बात क्यों है?

  • कोई री-ट्रेनिंग नहीं: आपको AI को नया तरीका सिखाने की आवश्यकता नहीं है। आप बस इस "स्मार्ट लाइब्रेरियन" सिस्टम को मौजूदा मॉडल्स में प्लग कर सकते हैं, और वे तुरंत लंबे वीडियो बनाने में बेहतर हो जाते हैं।
  • असीमित लंबाई: क्योंकि मेमोरी बाकेट्स का आकार समान रहता है (वे केवल स्मार्ट सारांश बनाते हैं), आप एक वीडियो बना सकते हैं जो 1 घंटा, 10 घंटे, या उससे भी लंबा हो सकता है, बिना कंप्यूटर की मेमोरी खत्म हुए।
  • परफेक्ट कंसिस्टेंसी (पूर्ण निरंतरता): पेपर के उदाहरणों में, MemRoPE ने टोक्यो में एक महिला के चलने का 1 घंटे का वीडियो बनाया। महिला का चेहरा, कपड़े और नियॉन लाइट्स पूरे समय सुसंगत रहे। अन्य तरीकों ने उसके चेहरे को राक्षस में बदलते हुए या लाइटों को स्थिर (static) होते हुए दिखाया।

संक्षेप में

MemRoPE को एक ऐसा फोटोग्राफिक मेमोरी देने के रूप में सोचें जो खुद को अपडेट करता है। अतीत को भूलने या वर्तमान को स्थिर करने के बजाय, यह वीडियो के इतिहास का लगातार सारांश बनाता रहता है और हालिया एक्शन को स्पष्ट रखता है। यह AI को एक सुसंगत, उच्च-गुणवत्ता वाली कहानी बताने की अनुमति देता है जो कुछ सेकंड के बजाय घंटों तक चल सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →