InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
InternVideo-Next एक नवीन दो-चरणीय प्रीट्रेनिंग फ्रेमवर्क पेश करता है जो पिक्सेल-स्तरीय पुनर्निर्माण और शॉर्टकट लर्निंग की सीमाओं को दूर करने के लिए एनकोडर-डिकोडर डिज़ाइन को एक कंडिशनल डिफ्यूजन डिकोडर के साथ एनकोडर-प्रेडिक्टर-डिकोडर संरचना में अलग करता है, जिससे शोर युक्त वीडियो-टेक्स्ट पर्यवेक्षण पर निर्भर रहे बिना सामान्य वीडियो प्रतिनिधित्व शिक्षण में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबट को यह सिखाना चाहते हैं कि वह केवल वीडियो देखकर दुनिया को कैसे समझता है, बिना किसी के उसे शब्दों में बताए कि क्या हो रहा है। यह वह चुनौती है जिसे InternVideo-Next पेपर हल करता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं का उपयोग करते हुए।
समस्या: सीखने के दो बुरे तरीके
पहले, शोधकर्ता रोबोट को वीडियो देखना सिखाने के लिए दो मुख्य तरीकों का उपयोग करते थे, लेकिन दोनों में खामियां थीं:
"सबटाइटल पाठक" (Text-Supervised):
कल्पना कीजिए कि आप एक छात्र को सबटाइटल के साथ एक फिल्म दिखाकर पढ़ा रहे हैं। वे बेहतरीन शब्दावली सीख जाते हैं और आपको बता सकते हैं कि कौन क्या कर रहा है (जैसे, "एक आदमी गेंद को लात मार रहा है")। लेकिन, क्योंकि वे केवल सबटाइटल पढ़ रहे हैं, वे सूक्ष्म भौतिकी (physics) को चूक जाते हैं। वे वास्तव में यह नहीं समझ पाते कि गेंद कैसे घूमती है, कमरे की 3D गहराई क्या है, या गुरुत्वाकर्षण उसे नीचे कैसे खींच रहा है। वे "कहानी" में अच्छे हैं लेकिन "वास्तविकता" में खराब हैं।"पिक्सेल पेंटर" (Masked Video Modeling):
कल्पना कीजिए कि एक खेल है जहाँ आप वीडियो के एक हिस्से को ढक देते हैं और छात्र से गायब हिस्से को बनाने के लिए कहते हैं। यह उन्हें कच्चे पिक्सेल (raw pixels) को देखने के लिए मजबूर करता है। वे सटीक रंगों और आकृतियों को बनाने में बहुत अच्छे हो जाते हैं। लेकिन, वे अक्सर "आलसी" हो जाते हैं। दृश्य की भौतिकी को समझने के बजाय, वे बस अनुमान लगाते हैं, "ओह, आकाश आमतौर पर नीला होता है, इसलिए मैं नीला बना दूँगा।" वे वस्तुओं के हिलने-डुलने और आपस में जुड़ने के गहरे तर्क को मिस कर देते हैं।
अंतराल (The Gap): "सबटाइटल पाठक" शब्दों को जानता है लेकिन भौतिकी को नहीं। "पिक्सेल पेंटर" रंगों को जानता है लेकिन अर्थ को नहीं। हमें एक ऐसे छात्र की आवश्यकता थी जो दोनों को समझ सके।
समाधान: "वास्तुकार, भविष्यवक्ता और निर्माता"
लेखकों ने महसूस किया कि इन AI दिमागों को बनाने का पुराना तरीका बहुत अव्यवस्थित था। उन्होंने इस प्रक्रिया को तीन विशिष्ट भूमिकाओं में विभाजित किया, जैसे कि एक निर्माण दल (construction crew):
- वास्तुकार (Encoder): वीडियो को देखता है और बड़ी तस्वीर को समझता है।
- भविष्यवक्ता (The "World Model"): यह मुख्य सितारा है। यह अनुमान लगाने की कोशिश करता है कि भौतिकी के नियमों और तर्क के आधार पर वीडियो के गायब हिस्से कैसे दिखने चाहिए।
- निर्माता (Decoder): भविष्यवक्ता के अनुमान को लेता है और उसे वापस एक वास्तविक वीडियो फ्रेम में बदलने की कोशिश करता है।
InternVideo-Next का जादू इस बात में है कि उन्होंने इस टीम को दो विशिष्ट चरणों में कैसे प्रशिक्षित किया।
चरण 1: वास्तविकता की "शब्दावली" सीखना
पहले चरण में, वे चाहते थे कि भविष्यवक्ता बड़े विचारों (semantics) और सूक्ष्म विवरणों (pixels) दोनों को समझे।
- पुराना तरीका: उन्होंने एक साधारण "निर्माता" (एक लीनियर डिकोडर) का उपयोग किया जिसने भविष्यवक्ता को बहुत सरल होने के लिए मजबूर किया। यह एक प्रतिभाशाली वास्तुकार को केवल एक स्टिक फिगर (stick figure) का उपयोग करके ब्लूप्रिंट बनाने के लिए कहने जैसा था। यह जटिल विवरणों को कैप्चर नहीं कर सका।
- नया तरीका (Diffusion Decoder): उन्होंने साधारण निर्माता को बदलकर एक डिफ्यूजन डिकोडर (Diffusion Decoder) लगा दिया। इसे एक मास्टर कलाकार की तरह समझें जो एक रफ स्केच ले सकता है और धीरे-धीरे उसे एक फोटोरियलिस्टिक पेंटिंग में बदल सकता है, शोर (noise) जोड़कर और फिर एक आदर्श छवि खोजने के लिए उसे हटाकर।
- सीक्रेट सॉस (The Secret Sauce): उन्होंने भविष्यवक्ता को एक सुपर-स्मार्ट इमेज मॉडल (SigLIP) से एक "चीट शीट" भी दी। इस चीट शीट ने भविष्यवक्ता को बताया, "हे, वह कुत्ता है, बिल्ली नहीं," जिससे यह सुनिश्चित हुआ कि AI ने वस्तुओं के अर्थ को सीखते हुए भी उनके फर और पूंछ को कैसे बनाना है, यह सीखा।
परिणाम: अब भविष्यवक्ता के पास एक "लेटेंट स्पेस" (मानसिक मानचित्र) है जो समृद्ध अर्थ और तीखे विवरणों से भरा है।
चरण 2: दुनिया की "भौतिकी" सीखना
अब जब भविष्यवक्ता के पास एक बेहतरीन मानसिक मानचित्र है, तो चरण 2 दुनिया के हिलने-डुलने के तरीके को सीखने के बारे में है।
- खेल: वे वीडियो के बड़े हिस्सों (जैसे कि एक्शन का एक पूरा सेकंड) को छिपा देते हैं और भविष्यवक्ता से पूछते हैं कि उस अंतराल में क्या हुआ होगा।
- ट्रिक: वे "शिक्षक" (चरण 1 वाला मॉडल) को फ्रीज कर देते हैं ताकि वह बदले नहीं। "छात्र" को शिक्षक के उत्तर की भविष्यवाणी करनी होती है।
- यह क्यों काम करता है: क्योंकि शिक्षक के उत्तर इतने विस्तृत और अर्थपूर्ण हैं (चरण 1 के कारण), छात्र बेईमानी नहीं कर सकता। वह केवल "नीला आकाश" या "स्थिर पृष्ठभूमि" का अनुमान नहीं लगा सकता। उसे वास्तव में कारण-प्रभाव (causality) (यदि मैं कप को धक्का देता हूँ, तो वह गिर जाता है) और 3D ज्यामिति (वह कार दूर जा रही है, इसलिए वह छोटी होती जा रही है) को समझना होगा।
परिणाम: एक "सुपर-स्टूडेंट"
जब उन्होंने इस नए मॉडल का परीक्षण किया, तो यह गेम-चेंजर साबित हुआ:
- यह कहानी जानता है: यह क्रियाओं (जैसे "एक व्यक्ति नाच रहा है") को पहचानने में बहुत अच्छा है।
- यह भौतिकी जानता है: यह गहराई (चीजें कितनी दूर हैं) और 3D स्थान में चलती वस्तुओं को ट्रैक करने में आश्चर्यजनक रूप से अच्छा है, भले ही इसे इसके लिए स्पष्ट रूप से नहीं सिखाया गया था।
- यह कुशल है: इसने यह सब केवल सार्वजनिक, बिना लेबल वाले वीडियो का उपयोग करके सीखा। इसे महंगे मानव-लिखित कैप्शन की आवश्यकता नहीं पड़ी।
बड़ी तस्वीर
InternVideo-Next को एक ऐसे AI के रूप में देखें जिसने केवल एक स्क्रिप्ट को रटा नहीं या केवल पिक्सेल को कॉपी-पेस्ट नहीं किया। इसने वास्तव में दुनिया को देखा, भौतिकी के नियमों और कारण-प्रभाव को समझा, और अपने दिमाग के अंदर एक "वर्ल्ड मॉडल" बनाया।
यह एक ऐसे AI को बनाने की दिशा में एक बड़ा कदम है जो वास्तव में हमारी भौतिक दुनिया को समझ सके, जो सेल्फ-ड्राइविंग कारों, घरों में मदद करने वाले रोबोट और भविष्य के ऐसे AI के लिए आवश्यक है जो देखी गई चीजों के बारे में गहरी बातचीत कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।