← नवीनतम पेपर
💻 computer science

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

यह शोध पत्र \infty-RoPE का परिचय देता है, जो एक प्रशिक्षण-मुक्त (training-free) इन्फरेंस फ्रेमवर्क है जो Block-Relativistic RoPE, KV Flush और RoPE Cut के माध्यम से 3D-RoPE की अस्थायी सीमाओं को पार करके अनंत-क्षितिज (infinite-horizon), एक्शन-नियंत्रणीय (action-controllable) और सिनेमाई वीडियो जनरेशन को सक्षम बनाता है।

मूल लेखक: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई मूवी कैमरा है जो आपके द्वारा वर्णित किसी भी चीज़ को फिल्मा सकता है। लेकिन इसमें एक पेंच है: इस कैमरे की याददाश्त बहुत कम है। यह केवल 5 सेकंड के आसपास की क्रिया को फिल्मा सकता है, जिसके बाद यह भ्रमित होने लगता है, पात्रों को भूल जाता है, या दृश्य को फ्रीज कर देता है।

यही वर्तमान AI वीडियो जनरेटरों के साथ समस्या है। वे छोटे क्लिप बनाने में बेहतरीन हैं लेकिन लंबे, निरंतर वीडियो बनाने में संघर्ष करते हैं।

यह पेपर ∞-RoPE (इन्फिनिटी-RoPE) का परिचय देता है, जो एक चतुर "सॉफ्टवेयर अपडेट" है जो इस कम याददाश्त वाले कैमरे को एक ऐसे कैमरे में बदल देता है जो बिना कभी मेमोरी खत्म हुए या कहानी भूले अनंत फिल्में फिल्मा सकता है। यह इसे बिना कैमरे को फिर से प्रशिक्षित किए या उसे नई चीजें सिखाए करता है; यह बस इस बात को बदल देता है कि कैमरा समय के बारे में कैसे सोचता है।

यह तीन सरल उपमाओं (analogies) का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. चलती हुई ट्रेन (Block-Relativistic RoPE)

समस्या: कल्पना कीजिए कि कैमरा एक ट्रेन है जो केवल 100 ट्रैक आगे देख सकती है। यदि आप 1,000 मील की यात्रा फिल्माने की कोशिश करते हैं, तो ट्रेन दुर्घटनाग्रस्त हो जाती है क्योंकि वह इतनी दूर तक "देख" नहीं सकती। गणित जिसका उपयोग यह समय गिनने के लिए करता है, विफल हो जाता है।

समाधान: ∞-RoPE नियम बदल देता है। एक निश्चित शुरुआती बिंदु (जैसे "ट्रैक #1") से ट्रैक गिनने के बजाय, यह समय को एक चलती हुई ट्रेन कार की तरह मानता है।

  • जैसे-जैसे कैमरा नए दृश्य फिल्माता है, यह अपनी "व्यूइंग विंडो" (देखने की खिड़की) को स्थानांतरित करता है।
  • यह वर्तमान दृश्य और ठीक उससे पहले वाले दृश्य के बीच की सापेक्ष दूरी को बनाए रखता है, लेकिन यह उन दृश्यों के सटीक "माइल मार्कर" को भूल जाता है जो बहुत समय पहले हुए थे।
  • उपमा: इसे एक लंबे गलियारे में चलते हुए व्यक्ति की तरह समझें। वे ठीक से याद रखते हैं कि वे अभी जिस दीवार के पास से गुजरे हैं उसके सापेक्ष वे कहाँ हैं, लेकिन उन्हें उस दरवाजे का सटीक नंबर याद रखने की आवश्यकता नहीं है जिससे वे 10 मिनट पहले गुजरे थे। यह कैमरे को चक्कर खाए बिना या क्रैश हुए बिना हमेशा चलते रहने की अनुमति देता है।

2. क्रियाओं के लिए "रीसेट बटन" (KV Flush)

समस्या: कल्पना कीजिए कि आप एक फिल्म फिल्मा रहे हैं जहाँ अभिनेता स्थिर खड़ा है। अचानक, आप चाहते हैं कि वे नाचना शुरू कर दें। पुराने AI मॉडलों में, कैमरा "खड़े रहने" की स्मृति के प्रति इतना जुनूनी होता है कि उसे "नाचने" में स्विच करने में बहुत समय लगता है, या अभिनेता दोनों का एक अजीब मिश्रण करते हुए फंस जाता है।

समाधान: ∞-RoPE एक ट्रिक का उपयोग करता है जिसे KV Flush कहा जाता है।

  • उपमा: कल्पना कीजिए कि कैमरे के पास एक व्हाइटबोर्ड है जहाँ वह वह सब कुछ लिखता है जो उसने देखा है। जब आप कहते हैं, "अब नाचो!", तो कैमरा बोर्ड को पूरी तरह से नहीं मिटाता (जिससे वीडियो ग्लिच हो जाएगा)। इसके बजाय, वह केवल दो चीजें रखता है:
    1. "ग्लोबल एंकर" (मुख्य पात्र का चेहरा/पहचान)।
    2. बिल्कुल अंतिम फ्रेम (गति को सुचारू रखने के लिए)।
    • यह बाकी सब कुछ तुरंत मिटा देता है।
  • परिणाम: अभिनेता बिना किसी लैग के तुरंत खड़े होने से नाचने में बदल जाता है, जबकि वह अभी भी वही व्यक्ति दिखता है।

3. "सीन कट" स्विच (RoPE Cut)

समस्या: वास्तविक फिल्मों में, निर्देशक रसोई के दृश्य से समुद्र तट के दृश्य में कट लगाते हैं। पुराने AI मॉडल रसोई को धीरे-धीरे समुद्र तट में बदलने की कोशिश करते हैं, जो अजीब और स्वप्न जैसा दिखता है। वे एक हार्ड कट (एकदम से बदलाव) नहीं कर सकते।

समाधान: ∞-RoPE, RoPE Cut पेश करता है।

  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं। आमतौर पर, आप एक-एक करके पन्ने पलटते हैं। लेकिन कभी-कभी, आप अध्याय 1 से अध्याय 100 पर कूदना चाहते हैं।
  • यह फीचर कैमरे को समय счет (counter) को "कूदने" की अनुमति देता है। यह AI को बताता है: "समय गिनना सामान्य रूप से बंद करो। मान लो कि हमने अभी 50 सेकंड का समय छोड़ दिया है।"
  • परिणाम: आपको एक साफ, सिनेमाई कट मिलता है। बैकग्राउंड तुरंत रसोई से बदलकर समुद्र तट हो जाता है, लेकिन मुख्य पात्र वही रहता है, और वीडियो ग्लिच नहीं होता है। यह एक असली मूवी एडिट जैसा महसूस होता है।

यह एक बड़ी बात क्यों है?

इससे पहले, AI के साथ 5 मिनट का वीडियो बनाना जेन्गा (Jenga) ब्लॉक्स से गगनचुंबी इमारत बनाने की तरह था जो गिरते रहते हैं। आपको AI को विशाल डेटासेट्स पर फिर से प्रशिक्षित करना पड़ता था, जो महंगा और धीमा था।

∞-RoPE बिल्डर को निर्देशों का एक नया सेट देने जैसा है जो कहता है, "आपको नींव को फिर से बनाने की ज़रूरत नहीं है; बस ब्लॉकों को जोड़ने का तरीका बदल दें।"

  • यह मुफ्त है: किसी नए प्रशिक्षण डेटा की आवश्यकता नहीं है।
  • यह तेज़ है: यह तुरंत काम करता है।
  • यह नियंत्रणीय है: आप जब चाहें क्रिया बदल सकते हैं या दृश्य को काट सकते हैं।

यह पेपर सिद्ध करता है कि इन तीन ट्रिक्स के साथ, केवल 5-सेकंड के क्लिप पर प्रशिक्षित AI अचानक उच्च गुणवत्ता वाले, 10-मिनट (या उससे अधिक) के वीडियो बना सकता है जो सुसंगत दिखते हैं, सुचारू रूप से चलते हैं और आपके निर्देशों का पूरी तरह से पालन करते हैं। यह AI को अपनी अनंत फिल्में लिखने और निर्देशित करने में सक्षम बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →