← नवीनतम पेपर
🤖 machine learning

TRecViT: A Recurrent Video Transformer

यह शोधपत्र TRecViT को प्रस्तुत करता है, जो एक नवीन कॉज़ल वीडियो ट्रांसफार्मर है जो मौजूदा नॉन-कॉज़ल और कॉज़ल मॉडलों की तुलना में कंप्यूटेशनल लागत और मेमोरी फुटप्रिंट को काफी कम करते हुए, वीडियो बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए रिकरेंट यूनिट्स, सेल्फ-अटेंशन और MLPs के साथ टाइम-स्पेस-चैनल फैक्टराइजेशन का उपयोग करता है।

मूल लेखक: Viorica Pătrăucean, Xu Owen He, Joseph Heyward, Chuhan Zhang, Mehdi S. M. Sajjadi, George-Cristian Muraru, Artem Zholus, Mahdi Karami, Ross Goroshin, Yutian Chen, Simon Osindero, João Carreira, Razvan
प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Viorica Pătrăucean, Xu Owen He, Joseph Heyward, Chuhan Zhang, Mehdi S. M. Sajjadi, George-Cristian Muraru, Artem Zholus, Mahdi Karami, Ross Goroshin, Yutian Chen, Simon Osindero, João Carreira, Razvan Pascanu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फिल्म समझना सिखाने की कोशिश कर रहे हैं। रोबोट को फिल्म देखनी होगी, यह समझना होगा कि क्या हो रहा है, और फिर यह अनुमान लगाना होगा कि आगे क्या होने वाला है, और यह सब उसे रियल-टाइम में करना होगा (जैसे कि एक सुरक्षा कैमरा या खुद चलने वाली कार)।

लंबे समय तक, इसे करने का सबसे अच्छा तरीका एक सुपर-इंटेलिजेंट एडिटर को काम पर रखने जैसा था जो कोई भी निर्णय लेने से पहले पूरी फिल्म को शुरू से अंत तक देखता है। यह एडिटर (जिसे "ट्रांसफॉर्मर" कहा जाता है) अविश्वसनीय रूप से स्मार्ट है और यह देखता है कि फिल्म की शुरुआत कैसे अंत से जुड़ी हुई है। लेकिन इसमें एक समस्या है: ऐसा करने के लिए, एडिटर को एक विशाल लाइब्रेरी की आवश्यकता होती है जहाँ वह हर उस फ्रेम को स्टोर कर सके जो उसने अब तक देखा है। यदि फिल्म लंबी है, तो लाइब्रेरी इतनी बड़ी हो जाएगी कि वह रोबोट के दिमाग में फिट न हो सके, और रोबोट रियल-टाइम में प्रतिक्रिया देने के लिए बहुत धीमा हो जाएगा।

मिलिए TRecViT से: "स्मार्ट स्ट्रीमर"

लेखक इस नए आर्किटेक्चर को TRecViT कहते हैं। एक सुपर-एडिटर को काम पर रखने के बजाय, जो पूरी फिल्म को एक साथ देखना चाहता है, उन्होंने एक स्मार्ट, कुशल स्ट्रीमर बनाया जो फिल्म को फ्रेम-दर-फ्रेम देखता है, और कहानी को समझने के लिए बस उतना ही याद रखता है जितना आवश्यक है।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से बताया गया है:

1. तीन-सदस्यीय टीम

TRecViT मॉडल एक तीन-सदस्यीय टीम की तरह है जो वीडियो को समझने के लिए मिलकर काम करती है। वे काम को वीडियो के तीन आयामों (dimensions) के आधार पर विभाजित करते हैं: समय (Time), स्थान (Space), और रंग/विवरण (Color/Detail)

  • द टाइम ट्रैवलर (LRU):
    • काम: यह टीम का सदस्य समय के लिए जिम्मेदार है। वे वीडियो को सेकंड-दर-सेकंड आगे बढ़ते हुए देखते हैं।
    • जादू: पुराने "सुपर-एडिटर" के विपरीत, जो एक साथ सब कुछ याद रखने की कोशिश करता है, यह सदस्य एक विशेष "मेमोरी ट्रिक" (जिसे गेटेड लीनियर रिकरेंट यूनिट कहा जाता है) का उपयोग करता है। इसे एक स्लाइडिंग विंडो वाले नोटबुक की तरह समझें। जैसे-जैसे नए दृश्य आते हैं, वे उन्हें लिखते जाते हैं, लेकिन उनके पास एक "भूलने की प्रक्रिया" (forgetting mechanism) भी है जो उन विवरणों को धुंधला कर देती है जो अब महत्वपूर्ण नहीं रह गए हैं। यह उन्हें बिना नोटबुक के पन्ने खत्म किए अनंत काल तक फिल्म देखने की अनुमति देता है। वे केवल अतीत को देखते हैं, भविष्य को कभी नहीं (जिसे "कॉज़ल" कहा जाता है और यह रियल-टाइम रोबोट्स के लिए अत्यंत महत्वपूर्ण है)।
  • द फोटोग्राफर (सेल्फ-अटेंशन):
    • काम: यह सदस्य स्थान (स्वयं इमेज) को संभालता है। जब एक सिंगल फ्रेम आता है, तो वे दृश्य को समझने के लिए सभी पिक्सेल को एक साथ देखते हैं (जैसे, "वह सोफे पर एक बिल्ली है")।
    • जादू: वे उसी शक्तिशाली "सुपर-एडिटर" तकनीक (सेल्फ-अटेंशन) का उपयोग करते हैं जिसका पुराने मॉडल्स ने उपयोग किया था, लेकिन वे इसे केवल एक समय में एक फ्रेम के लिए उपयोग करते हैं। यह बहुत तेज़ है क्योंकि उन्हें वर्तमान फ्रेम के प्रत्येक पिक्सेल की तुलना पूरे पिछले मूवी के प्रत्येक पिक्सेल से नहीं करनी पड़ती।
  • द ट्रांसलेटर (MLP):
    • काम: यह सदस्य चैनलों (विवरण और रंगों) को संभालता है। वे पूरे चित्र को समझने के लिए 'टाइम ट्रैवलर' और 'फोटोग्राफर' से मिली जानकारी को आपस में मिलाते हैं।

2. यह बड़ी बात क्यों है?

यह पेपर वर्तमान चैंपियन, ViViT की तुलना में TRecViT को परखता है, जो उस "सुपर-एडिटर" की तरह है जिसे पूरी फिल्म देखने की आवश्यकता होती है।

  • मेमोरी: ViViT को पूरी फिल्म स्टोर करने के लिए एक गोदाम की आवश्यकता होती है। TRecViT को बस एक छोटे बैकपैक की आवश्यकता है। पेपर कहता है कि TRecVIt 12 गुना कम मेमोरी का उपयोग करता है।
  • गति: क्योंकि ViViT को पूरी फिल्म देखनी पड़ती है, इसलिए जैसे-जैसे फिल्म लंबी होती जाती है, यह धीमा होता जाता है। TRecViT एक स्थिर गति से चलता है, लगभग 300 फ्रेम्स प्रति सेकंड प्रोसेस करता है। यह इतना तेज़ है कि एक रोबोट अपनी ओर आती गेंद पर तुरंत प्रतिक्रिया दे सके।
  • समझ (Smarts): छोटा और तेज़ होने के बावजूद, TRecViT जटिल क्रियाओं को समझने में उतना ही स्मार्ट (या उससे भी अधिक स्मार्ट) है, जैसे कि "पानी डालना" बनाम "पानी डालने का नाटक करना।"

3. "समय का तीर" (The Arrow of Time)

सबसे महत्वपूर्ण अवधारणा कॉज़ैलिटी (Causality) है।

  • पुराने मॉडल्स (नॉन-कॉज़ल): कल्पना कीजिए कि आप एक ऐसी फिल्म देख रहे हैं जिसका अंत पहले ही पता चल चुका है। आप जानते हैं कि आगे क्या होने वाला है, इसलिए आप कहानी का आसानी से अनुमान लगा सकते हैं। लेकिन एक रोबोट ऐसा नहीं कर सकता; वह भविष्य नहीं देख सकता।
  • TRecViT (कॉज़ल): यह मॉडल "समय के तीर" का सम्मान करता है। यह केवल वही जानता है जो अब तक हो चुका है। यह केवल अतीत के आधार पर भविष्य की भविष्यवाणी करना सीखता है। यह इसे वास्तविक दुनिया के अनुप्रयोगों के लिए आदर्श बनाता है जैसे कि सेल्फ-ड्राइविंग कार, रोबोटिक्स और ऑगमेंटेड रियलिटी, जहाँ आप दुनिया को आगे देखने के लिए रोक नहीं सकते।

निष्कर्ष

लेखकों ने एक ऐसा वीडियो AI बनाया है जो वर्तमान दिग्गजों की तुलना में हल्का, तेज़ और अधिक कुशल है। यह दो दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है:

  1. पुराने स्कूल के "रिकरेंट" मॉडल्स की मेमोरी दक्षता (जो इंसानों की तरह याद रखते हैं)।
  2. आधुनिक "ट्रांसफॉर्मर" मॉडल्स की विजुअल शक्ति (जो पैटर्न देखने में माहिर हैं)।

वे इसे TRecViT (टेम्पोरल रिकरेंट वीडियो ट्रांसफॉर्मर) कहते हैं। यह एक भारी, धीमी गति से चलने वाले टैंक से एक स्लीक, हाई-स्पीड मोटरसाइकिल में अपग्रेड करने जैसा है जो बिना रुके अनंत काल तक जा सकती है, जबकि सड़क को उतनी ही स्पष्टता से देख सकती है।

संक्षेप में: उन्होंने यह पता लगाया है कि एक ऐसा वीडियो AI कैसे बनाया जाए जो रियल-टाइम में फिल्म देख सके, महत्वपूर्ण हिस्सों को याद रख सके, और बाकी को भूल सके, और यह सब पिछले मॉडल्स की तुलना में बहुत कम कंप्यूटर पावर का उपयोग करके किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →