← नवीनतम पेपर
💻 computer science

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

यह शोध पत्र TS-Attn का प्रस्ताव करता है, जो एक नवीन प्रशिक्षण-मुक्त (training-free) अटेंशन मैकेनिज्म है जो टेम्पोरल मिसअलाइनमेंट और संघर्षपूर्ण अटेंशन कपलिंग को हल करने के लिए अटेंशन डिस्ट्रीब्यूशन को गतिशील रूप से पुनर्व्यवस्थित करता है, जिससे न्यूनतम इन्फरेंस ओवरहेड के साथ प्री-ट्रेंड मॉडल्स में मल्टी-इवेंट वीडियो जनरेशन की गुणवत्ता और निरंतरता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

प्रकाशित 2026-04-22
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक निर्देशक हैं जो एक लघु फिल्म बनाने की कोशिश कर रहे हैं जिसका स्क्रिप्ट कुछ इस तरह है: "एक बिल्ली कमरे में आती है, मेज पर कूदती है, एक फूलदान गिरा देती है, और फिर दरवाजे से बाहर भाग जाती है।"

वर्तमान AI वीडियो जनरेटर प्रतिभाशाली लेकिन थोड़े भ्रमित अभिनेताओं की तरह हैं। यदि आप उन्हें एक साथ यह पूरा स्क्रिप्ट दे देते हैं, तो वे अभिभूत हो सकते हैं। वे शायद बिल्ली को मेज पर कूदने से पहले ही दरवाजे से बाहर भागते हुए दिखा सकते हैं, या वे फूलदान को पूरी तरह से भूल सकते हैं। वे सब कुछ एक साथ करने की कोशिश करते हैं, और परिणाम एक अराजक गड़बड़ी जैसा होता है जहाँ टाइमलाइन का कोई अर्थ नहीं निकलता।

वैकल्पिक रूप से, यदि आप प्रत्येक क्रिया को अलग-अलग फिल्माने और फिर क्लिप्स को आपस में जोड़ने की कोशिश करते हैं, तो बिल्ली हर क्लिप में अलग दिख सकती है, या बैकग्राउंड बदल सकता है। यह अलग-अलग घरों की ईंटों को आपस में चिपकाकर एक घर बनाने की कोशिश करने जैसा है; संरचना बिखर जाती है।

पेश है TS-Attn (टेम्पोरल-वाइज सेपरेबल अटेंशन)।

TS-Attn को एक सुपर-स्मार्ट फिल्म एडिटर और स्क्रिप्ट सुपरवाइजर के रूप में सोचें जो AI के दिमाग के अंदर बैठा है। इसका काम यह सुनिश्चित करना है कि AI सही समय पर स्क्रिप्ट के सही हिस्से पर ध्यान दे।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

1. समस्या: "कैफेटेरिया का शोर"

कल्पना कीजिए कि AI एक शोर भरे कैफेटेरिया में है। स्क्रिप्ट (टेक्स्ट प्रॉम्प्ट) अलग-अलग लोगों के निर्देशों की एक लंबी सूची है।

  • व्यक्ति A कहता है: "चलो!"
  • व्यक्ति B कहता है: "कूद!"
  • व्यक्ति C कहता है: "गिराओ!"

TS-Attn के बिना, AI इन सभी आवाजों को एक साथ सुनता है। वह एक ही समय में चलने, कूदने और गिराने की कोशिश करता है, या वह भ्रमित होकर कुछ आवाजों को अनदेखा कर देता है। परिणाम एक ऐसा वीडियो होता है जहाँ बिल्ली एक ही समय में सब कुछ कर रही होती है या कुछ भी नहीं कर रही होती।

2. समाधान: "टाइम-ट्रैवलिंग स्पॉटलाइट"

TS-Attा रहा मंच पर घूमती हुई एक स्पॉटलाइट की तरह काम करता है। यह AI को बताता है:

  • समय 1: "हे AI, बाकी सब को अनदेखा करो। बस उस व्यक्ति की बात सुनो जो कह रहा है 'चलो'। अपनी पूरी ऊर्जा बिल्ली को चलाने पर केंद्रित करो।"
  • समय 2: "ठीक है, अब चलना हो गया। 'चलो' वाली लाइट बंद कर दो। अब, केवल उस व्यक्ति पर ध्यान केंद्रित करो जो कह रहा है 'कूद'।"
  • समय 3: "अब, 'गिराओ' पर ध्यान केंद्रित करो।"

यह अनिवार्य रूप से निर्देशों की गांठ को सुलझा देता है। यह सुनिश्चित करता है कि दृश्य क्रिया (बिल्ली का हिलना) स्क्रिप्ट के उस विशिष्ट शब्द के साथ पूरी तरह से सिंक हो जिसने उसे प्रेरित किया।

3. "मोशन डिटेक्टिव" (गति का जासूस)

AI को कैसे पता चलता है कि कहाँ देखना है?
TS-Attn के अंदर एक छोटा सा जासूस है। वह वीडियो को देखता है और कहता है, "ठीक है, अभी बिल्ली ही हिल रही है।" वह बिल्ली पर एक डिजिटल स्टिकी नोट लगा देता है। फिर, वह AI को बताता है: "'कूद' वाले निर्देश को केवल बिल्ली से ही बात करने दें। 'कूद' वाले निर्देश को बैकग्राउंड या मेज को हिलाने की कोशिश न करने दें।"

यह रोकता है कि AI इस बारे में भ्रमित न हो जाए कि छवि का कौन सा हिस्सा बदलना चाहिए।

यह एक बड़ी बात क्यों है?

  • कोई री-ट्रेनिंग नहीं: आमतौर पर, किसी टूटे हुए AI को ठीक करने के लिए, आपको उसे फिर से शुरू से सिखाना पड़ता है (जैसे किसी छात्र को चार साल के लिए वापस स्कूल भेजना)। TS-Attा एक चीट शीट या नया चश्मा देने जैसा है। आप इसे मौजूदा AI मॉडल्स (जैसे Wan या CogVideoX) में प्लग कर सकते हैं और वे तुरंत स्मार्ट हो जाते हैं।
  • गति: यह प्रक्रिया को बहुत धीमा नहीं करता है। यह कार में GPS जोड़ने जैसा है; कार उतनी ही तेज़ चलती है, लेकिन वह रास्ता नहीं भटकती।
  • निरंतरता (Consistency): बिल्ली शुरुआत से अंत तक एक ही बिल्ली दिखती है, और कहानी तार्किक रूप से आगे बढ़ती है।

परिणाम

TS-Attा के साथ, AI अंततः जटिल कहानियों को संभाल सकता है। यह एक ऐसा वीडियो बना सकता है जहाँ एक रोबोटिक हाथ कप उठाता है, पानी डालता है, और उसे नीचे रख देता है, और यह सब एक ही सुचारू, निरंतर शॉट में होता है बिना कप के गायब हुए या पानी के आग में बदलने के।

संक्षेप में, TS-Attा AI को पूरी कहानी को एक साथ सुनने के बजाय, कहानी को क्रमवार सुनने की शिक्षा देता है। यह निर्देशों के एक अराजक ढेर को एक स्पष्ट, चरण-दर-चरण फिल्म में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →