← नवीनतम पेपर
💻 computer science

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT एक एडेप्टिव फास्ट वेट्स और एक हाइब्रिड सेलेक्टर के साथ एक कॉज़ल टेस्ट-टाइम ट्रेनिंग रीसैंपलर पेश करता है जो महत्वपूर्ण टेम्पोरल साक्ष्य को संरक्षित करते हुए लंबी वीडियो अनुक्रमों को प्रभावी ढंग से संकुचित करता है, जिससे कई वीडियो अंडरस्टैंडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

प्रकाशित 2026-08-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक कृत्रिम बुद्धिमत्ता (AI) के साथ एक लंबा वीडियो देखना वैसा ही है जैसे किसी व्यक्ति से दो घंटे की फिल्म के हर एक सेकंड को याद रखने के लिए कहना और साथ ही साथ उसके बारे में एक विशिष्ट प्रश्न का उत्तर देने के लिए कहना। वीडियो को समझने वाले वर्तमान AI सिस्टम एक ऐसे आधार पर बने होते हैं जहाँ कैमरा-नुमा घटक प्रत्येक फ्रेम को स्कैन करता है और एक विवरण 'भाषा मस्तिष्क' (language brain) को भेजता है। समस्या यह है कि जैसे-जैसे वीडियो लंबा होता जाता है, सूचना की मात्रा इतनी बड़ी हो जाती है कि भाषा मस्तिष्क उसे अपनी अल्पकालिक स्मृति (short-term memory) में समाहित नहीं कर पाता। इससे निपटने के लिए, इंजीनियरों ने कुछ प्रतिनिधि फ्रेम चुनकर या समान क्षणों को मिलाकर वीडियो का सारांश बनाने का प्रयास किया है, लेकिन ये विधियाँ अक्सर उन विवरणों को छीन लेती हैं जो यह समझने के लिए आवश्यक होते हैं कि एक दृश्य समय के साथ कैसे बदलता है। मुख्य चुनौती बनी हुई है: एक AI वीडियो के सैकड़ों फ्रेमों को बिना कहानी खोए कैसे प्रोसेस कर सकता है, जबकि जानकारी को एक सीमित मेमोरी स्पेस में भी फिट करना हो?

शोधकर्ताओं के एक दल ने इस बाधा को दूर करने के लिए LongVU-TTT नामक एक नया दृष्टिकोण विकसित किया है। भाषा मस्तिष्क को समय को ट्रैक करने का सारा भारी काम करने के लिए मजबूर करने के बजाय, उन्होंने कैमरा और मस्तिष्क के बीच एक विशेष प्रसंस्करण परत (processing layer) डाली है। यह परत एक गतिशील फिल्टर के रूप में कार्य करती है जो वीडियो के चलने के दौरान उसे देखती है और लगातार अपनी आंतरिक समझ को अपडेट करती रहती है। प्रत्येक फ्रेम को एक स्थिर छवि के रूप में मानने के बजाय, यह प्रणाली यह पहचानना सीखती है कि दृश्य सामग्री कब बदलती है। यह स्ट्रीम को प्रोसेस करते समय अपने स्वयं के आंतरिक कनेक्शनों को वास्तविक समय में समायोजित करके ऐसा करती है, जिससे प्रभावी रूप से वीडियो के इतिहास का एक चलता-फिरता सारांश (running summary) तैयार होता है। जब कोई महत्वपूर्ण परिवर्तन होता है, जैसे कि किसी पात्र का कमरे में प्रवेश करना या कार का मोड़ लेना, तो सिस्टम उस क्षण को महत्वपूर्ण मानकर चिह्नित कर देता है।

शोधकर्ताओं ने पाया कि निरंतर, ऑन-द-फ्लाई समायोजन की यह विधि पिछले उन तकनीकों की तुलना में बेहतर काम करती है जो निश्चित पैटर्न या सरल औसत पर निर्भर थीं। एक ऐसी संरचना का उपयोग करके जो एक छवि के द्वि-आयामी (two-dimensional) लेआउट का सम्मान करती है—ठीक वैसे ही जैसे हमारी आँखें केवल पिक्सेल की एक सपाट सूची के बजाय आकृतियों और किनारों को महसूस करती हैं—यह प्रणाली उन स्थानीय विवरणों को पकड़ लेती है जिन्हें अन्य विधियाँ छोड़ देती हैं। महत्वपूर्ण रूप से, टीम ने पाया कि यह आंतरिक 'रनिंग सारांश' अतीत का एक पूर्ण संग्रह नहीं है। यह घटनाओं के सामान्य प्रवाह और हाल के परिवर्तनों को याद रखने वाले एक कुशल पर्यवेक्षक की तरह कार्य करता है, लेकिन लंबे वीडियो की शुरुआत के हर विशिष्ट विवरण को याद नहीं रख सकता। इस कारण से, सिस्टम अपनी गतिशील समझ को एक स्मार्ट चयन प्रक्रिया के साथ जोड़ता है। यह उन फ्रेमों को सुरक्षित रखता है जहाँ सबसे महत्वपूर्ण परिवर्तन हुए थे और शेष मेमोरी को समयरेखा (timeline) को कवर करने के लिए समान रूप से अंतराल वाले नमूनों (evenly spaced samples) से भर देता है।

अपने परीक्षणों में, शोधकर्ताओं ने 512 फ्रेम तक के वीडियो को प्रोसेस किया, उन्हें भाषा मस्तिष्क द्वारा पढ़े जाने के लिए केवल 128 फ्रेमों में संकुचित किया। इस भारी कमी के बावजूद, सिस्टम ने वीडियो समझने के लिए डिज़ाइन किए गए पांच अलग-अलग बेंचमार्क पर मौजूदा मॉडलों से बेहतर प्रदर्शन किया। इसने समय के साथ परिवर्तनों को ट्रैक करने वाले कार्यों में विशेष ताकत दिखाई, और मापने योग्य अंतर के साथ अन्य उन्नत तरीकों से बेहतर प्रदर्शन किया। अध्ययन ने एक महत्वपूर्ण सीमा को भी स्पष्ट किया: जबकि सिस्टम की आंतरिक स्थिति संबंधित क्षणों को समूहित करने और बदलावों को उजागर करने में उत्कृष्ट है, यह दूर की घटनाओं के वास्तविक दृश्य साक्ष्य को रखने की आवश्यकता को प्रतिस्थापित नहीं कर सकती। सर्वोत्तम परिणाम तब आए जब सिस्टम ने अपने आंतरिक ज्ञान का उपयोग फ्रेमों के चयन के लिए मार्गदर्शन करने हेतु किया, जिससे यह सुनिश्चित हुआ कि अंतिम उत्तर के लिए सबसे महत्वपूर्ण दृश्य प्रमाण सुरक्षित रहे।

इसे मानक कंप्यूटर हार्डवेयर पर संभव बनाने के लिए, टीम ने लंबे वीडियो पर प्रशिक्षण के दौरान भारी मेमोरी मांगों को संभालने का एक तरीका भी विकसित किया। उन्होंने एक ऐसी विधि विकसित की जो प्रसंस्करण को छोटे, प्रबंधनीय टुकड़ों में विभाजित करती है और डेटा को कंप्यूटर की मुख्य मेमोरी और इसके प्रोसेसर के बीच इस तरह से स्थानांतरित करती है जिससे सिस्टम बिना धीमा हुए सुचारू रूप से चलता रहे। इसने उन्हें मानक ग्राफिक्स कार्ड का उपयोग करके लंबे अनुक्रमों (sequences) पर मॉडल को प्रशिक्षित करने की अनुमति दी, जो व्यापक रूप से उपलब्ध हैं, न कि विशेष, महंगे सुपरकंप्यूटिंग क्लस्टर्स की आवश्यकता पड़ी। परिणाम स्वरूप, एक ऐसा सिस्टम प्राप्त हुआ जो अधिक सटीकता और दक्षता के साथ लंबे वीडियो को समझ सकता है, जो यह सिद्ध करता है कि लंबे अनुक्रमों को संभालने की कुंजी केवल अधिक मेमोरी होने में नहीं, बल्कि यह जानने में है कि किन क्षणों को याद रखना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →