← नवीनतम पेपर
🤖 AI

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

TokenTrim एक इन्फरेंस-टाइम विधि पेश करके ऑटोरेग्रेसिव लॉन्ग वीडियो जनरेशन में टेम्पोरल ड्रिफ्ट (temporal drift) को संबोधित करता है, जो अस्थिर लेटेंट टोकन (latent tokens) की पहचान करता है और उन्हें दोबारा कंडीशनिंग के लिए उपयोग करने से पहले हटा देता है, जिससे मॉडल आर्किटेक्चर या ट्रेनिंग प्रक्रिया में बदलाव किए बिना लॉन्ग-होरिज़न कंसिस्टेंसी (long-horizon consistency) में सुधार होता है।

मूल लेखक: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को एक बहुत लंबी कहानी सुनाने की कोशिश कर रहे हैं, लेकिन आप एक बार में केवल एक ही वाक्य बोल सकते हैं। कहानी को आगे बढ़ाने के लिए, आपको यह याद रखना होगा कि आपने अभी क्या कहा है ताकि अगला वाक्य समझ में आने योग्य हो।

समस्या: "खराब याददाश्त" का प्रभाव (The "Bad Memory" Effect)
AI वीडियो जनरेशन की दुनिया में, कंप्यूटर कुछ ऐसा ही करता है। यह छोटे क्लिप्स (जैसे वाक्यों) में वीडियो बनाता है और फिर अगला क्लिप बनाने के लिए उसी का उपयोग करता है जो उसने अभी बनाया है। इसे "ऑटोरिग्र्रेसिव" (autoregressive) जनरेशन कहा जाता है।

यह शोध पत्र इस प्रक्रिया में एक बड़ी खामी की पहचान करता है जिसे टेम्पोरल ड्रिफ्ट (temporal drift) कहा जाता है। कल्पना कीजिए कि आप एक सफेद ट्रक के बारे में कहानी सुना रहे हैं।

  1. आप कहते हैं, "एक सफेद ट्रक चल रहा है।"
  2. AI दूसरे क्लिप में एक छोटी सी गलती करता है, शायद ट्रक थोड़ा ग्रे (धूसर) दिखने लगता है।
  3. तीसरे क्लिप में, AI उस "ग्रे ट्रक" को संदर्भ (reference) के रूप में उपयोग करता है, इसलिए वह ट्रक को और भी गहरा बना देता है।
  4. दसवें क्लिप तक, ट्रक काला हो जाता है। बीसवें क्लिप तक, वह शायद एक गाय में बदल सकता है।

AI अपनी सोचने की शक्ति नहीं खो रहा है; यह बस अपनी गलतियों का पुन: उपयोग कर रहा है। हर बार जब AI एक नया क्लिप बनाता है, तो वह पिछले क्लिप्स से संदर्भ लेने के लिए पीछे देखता है। यदि उन पिछले क्लिप्स में "भ्रष्ट" (corrupted) जानकारी है (जैसे ग्रे ट्रक), तो AI उस भ्रष्टाचार को सत्य मान लेता है और उसे आगे बढ़ाता रहता है, जिससे त्रुटि और भी खराब होती जाती है और अंततः वीडियो बिखर जाता है।

समाधान: टोकनट्रिम (TokenTrim - "द एडिटर")
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे TokenTrim कहा जाता है। AI द्वारा उपयोग किए जाने वाले वीडियो डेटा को स्टिकी नोट्स (जिन्हें "टोकन" कहा जाता है) के ढेर के रूप में समझें। कुछ नोट्स में अच्छी जानकारी है, और कुछ में "भ्रष्ट" या अस्थिर जानकारी है।

TokenTrim एक स्मार्ट संपादक (editor) की तरह काम करता है जो अगले चरण के लिए AI द्वारा उपयोग किए जाने से पहले इन स्टिकी नोट्स की जांच करता है। यह सरल शब्दों में इस प्रकार काम करता है:

  1. जांच (The Check): AI अगला क्लिप बनाना शुरू करने से पहले, TokenTrim उस नए क्लिप के "सारांश" (summary) की तुलना उस क्लिप के सारांश से करता है जिसे उसने अभी पूरा किया है।
  2. अलार्म (The Alarm): यदि वीडियो का कोई विशिष्ट हिस्सा (एक विशिष्ट "टोकन" या स्टिकी नोट) पिछले हिस्से की तुलना में बहुत अलग या अस्थिर दिखता है, तो सिस्टम उसे फ्लैग (चिह्नित) कर देता है। यह ऐसा ही है जैसे यह नोटिस करना कि "सफेद ट्रक" वाला नोट अचानक "बैंगनी हाथी" बन गया है।
  3. छंटाई (The Pruning): उस खराब नोट का उपयोग करने के बजाय, TokenTrim उसे फेंक देता है (प्रूनिंग)। यह AI की मेमोरी बैंक से भ्रष्ट जानकारी को हटा देता है।
  4. पुनः प्रयास (The Retry): AI को फिर से उस खराब नोट के बिना नया क्लिप बनाने के लिए मजबूर किया जाता है। उसे आगे क्या करना है, यह समझने के लिए शेष, स्थिर नोट्स पर निर्भर रहना पड़ता है।

परिणाम
अगले चरण को जहरीला बनाने से पहले सक्रिय रूप से "खराब यादों" (अस्थिर टोकन) को हटाकर, वीडियो सुसंगत बना रहता है। ट्रक सफेद ही रहता है, व्यक्ति का चेहरा पिघलता नहीं है, और बैकग्राउंड बिगड़ता नहीं है, भले ही वीडियो लंबे समय तक चल रहा हो।

शोध पत्र के मुख्य बिंदु (Key Takeaways):

  • पुनः प्रशिक्षण की आवश्यकता नहीं (No Retraining Needed): यह AI को नया तरीका सिखाने के बारे में नहीं है। यह एक "प्लग-एंड-प्ले" टूल है जो AI के चलते समय ही काम करता है। आपको मॉडल को फिर से प्रशिक्षित करने या उसका कोड बदलने की आवश्यकता नहीं है।
  • यह तेज़ है (It's Fast): यह वीडियो बनाने में लगभग कोई अतिरिक्त समय नहीं जोड़ता है। यह एक त्वरित जांच और एक त्वरित डिलीट प्रक्रिया है।
  • यह मौजूदा तकनीक के साथ काम करता है (It Works with Existing Tech): शोध पत्र ने इसका परीक्षण दो लोकप्रिय वीडियो जनरेशन विधियों (Rolling Forcing और Self Forcing) पर किया और दिखाया कि TokenTrim जोड़ने से वीडियो बहुत बेहतर दिखते हैं और बिना बिगड़े लंबे समय तक चलते हैं।
  • "पहला क्लिप" ट्रिक (The "First Clip" Trick): लेखकों ने यह भी पाया कि केवल पहले क्लिप के लिए एक विशेष तकनीक का उपयोग करने से एक स्थिर आधार तैयार करने में मदद मिलती है, जिससे पूरी प्रक्रिया और भी सुचारू हो जाती है।

संक्षेप में
लंबे वीडियो जनरेशन आमतौर पर इसलिए विफल होते हैं क्योंकि AI अपनी गलतियों को बार-बार दोहराता रहता है। TokenTrim इसे एक क्वालिटी कंट्रोल फिल्टर के रूप में काम करके ठीक करता है: यह AI की मेमोरी में त्रुटियों को पहचानता है, उन्हें हटा देता है, और AI को साफ डेटा के साथ नए सिरे से शुरू करने के लिए मजबूर करता है। यह गलतियों के "स्नोबॉल प्रभाव" (बढ़ती हुई गलतियों के प्रभाव) को रोकता है और वीडियो को लंबे समय तक वास्तविक और सुसंगत बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →