OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
यह शोध पत्र OneVision-Encoder प्रस्तुत करता है, जो एक मल्टीमॉडल आर्किटेक्चर है जो वीडियो कोडेक सिद्धांतों के साथ संरेखित होता है, क्योंकि यह समान पिक्सेल ग्रिड के बजाय विरल (sparse), उच्च-एन्ट्रॉपी वाले क्षेत्रों पर गणना केंद्रित करता है, जिससे इमेज, वीडियो और डॉक्यूमेंट समझ के बेंचमार्क में बेहतर दक्षता और सटीकता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक 2 घंटे की फिल्म देखना चाहते हैं, लेकिन आपके पास केवल स्क्रिप्ट के 10 पन्ने पढ़ने जितनी ऊर्जा बची है।
पुराना तरीका (वर्तमान AI):
अधिकांश वर्तमान AI मॉडल स्क्रिप्ट के हर एक शब्द को पढ़ने की कोशिश करते हैं, शुरुआती क्रेडिट से लेकर अंतिम फेड-आउट तक। वे पेड़ों, बादलों, दीवारों और सन्नाटे के विवरण को भी उतनी ही एकाग्रता से पढ़ते हैं जितना कि उस हिस्से को जहाँ नायक खलनायक को मुक्का मारता है। वे अपनी सीमित ऊर्जा उबाऊ, स्थिर हिस्सों पर बर्बाद कर देते हैं, जिससे वे तब थका हुआ और भ्रमित महसूस करते हैं जब रोमांचक एक्शन आखिरकार शुरू होता है। वे वीडियो के हर पल को समान रूप से महत्वपूर्ण मानते हैं।
नया तरीका (OneVision-Encoder):
OneVision-Encoder के पीछे के शोधकर्ताओं ने महसूस किया कि मानव मस्तिष्क (और वीडियो कंप्रेशन तकनीक) इस तरह काम नहीं करते हैं। हम बैकग्राउंड को याद नहीं रखते; हमें बदलाव याद रहते हैं।
उन्होंने एक ऐसा AI बनाया है जो एक स्मार्ट मूवी एडिटर या दिमाग वाले निगरानी कैमरे की तरह काम करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:
1. "कोडेक" का रहस्य (जादुई ट्रिक)
सोचिए कि आपका फोन स्पेस बचाने के लिए वीडियो को कैसे कंप्रेस करता है। यह हर एक फ्रेम को पूरी तरह से सेव नहीं करता है।
- I-Frames (एक स्नैपशॉट): यह पूरे दृश्य की एक पूर्ण, स्पष्ट तस्वीर सेव करता है (जैसे एक फोटो)।
- P-Frames (अपडेट्स): अगले 30 सेकंड के लिए, यह पूरी तस्वीर फिर से सेव नहीं करता है। यह केवल एक छोटा सा नोट सेव करता है: "लाल शर्ट वाला आदमी 2 इंच बाईं ओर खिसका है।"
वर्तमान AI इन "छोटे नोट्स" को अनदेखा करता है और हर बार पूरी तस्वीर को फिर से पढ़ने की कोशिश करता है। OneVision-Encoder पहला ऐसा है जो कहता है: "हे, चलो बस उन छोटे नोट्स को पढ़ते हैं! असली कहानी वहीं हो रही है।"
2. "मोशन डिटेक्टिव" (एक्शन को पहचानना)
पूरी स्क्रीन को देखने के बजाय, यह AI एक मोशन डिटेक्टिव (गति का जासूस) की तरह काम करता है।
- यदि हवा में एक पेड़ झूम रहा है, तो AI उसे अनदेखा कर देता है (क्योंकि वह अनुमानित है)।
- यदि अचानक एक पक्षी स्क्रीन के सामने से उड़ जाता है, तो AI उस पक्षी पर ज़ूम करता है।
- यदि कोई कार दुर्घटनाग्रस्त होती है, तो AI पूरी तरह से उस दुर्घटना पर ध्यान केंद्रित करता है।
यह केवल वीडियो के उस 3% से 25% हिस्से पर ध्यान देता है जो वास्तव में बदल रहा है या आश्चर्यजनक है। यह उबाऊ, स्थिर बैकग्राउंड को अनदेखा कर देता है। यह एक किताब पढ़ने जैसा है लेकिन केवल उन वाक्यों को हाइलाइट करना जहाँ प्लॉट में मोड़ आता है, और फर्नीचर के विवरणों को छोड़ देना।
3. "स्मार्ट टोकन" बजट
कल्पना कीजिए कि आपके पास 2,000 LEGO ब्रिक्स (ये वे "टोकन" हैं जिनका उपयोग AI वीडियो को समझने के लिए करता है) की एक बाल्टी है।
- पुराना AI: एक स्थिर दीवार (बैकग्राउंड) बनाने के लिए 1,000 ब्रिक्स का उपयोग करता है और एक छोटे, धुंधले एक्शन सीन को बनाने के लिए 1,000 ब्रिक्स का उपयोग करता है। परिणाम एक अस्त-व्यस्त, अक्षम मॉडल है।
- OneVision-Encoder: दीवार बनाने के लिए 200 ब्रिक्स का उपयोग करता है (इतना कि यह पता चल सके कि आप कहाँ हैं) और शेष 1,800 ब्रिक्स एक विस्तृत, हाई-स्पीड एक्शन सीन बनाने में लगा देता है।
क्योंकि यह अपने "LEGO ब्रिक्स" को केवल महत्वपूर्ण हिस्सों पर केंद्रित करता है, इसलिए यह कम संसाधनों के बावजूद वीडियो को बेहतर और तेजी से समझ लेता है।
4. "क्लस्टर" शिक्षक (समूहीकरण द्वारा सीखना)
AI को कैसे पता चलता है कि क्या महत्वपूर्ण है? यह केवल अनुमान नहीं लगाता।
कल्पना कीजिए कि एक शिक्षक के पास एक विशाल व्हाइटबोर्ड है जिसमें 1 मिलियन श्रेणियां (जैसे "कूदना," "खाना बनाना," "गिरना," "मुस्कुराना") हैं।
केवल यह कहने के बजाय कि "यह एक कुत्ता है," AI समान क्रियाओं को एक साथ समूहबद्ध करना सीखता है। यह सीखता है कि "एक कुत्ते का कूदना" और "एक बिल्ली का कूदना" एक ही "कूदने" के क्लस्टर में आते हैं, जबकि "एक कुत्ते का सोना" एक अलग क्लस्टर में आता है। यह इसे गति के अर्थ को समझने में मदद करता है, न कि केवल पिक्सेल को।
परिणाम: यह क्यों मायने रखता है?
पेपर दिखाता है कि यह नया AI एक सुपरस्टार है:
- यह स्मार्ट है: यह बहुत कम डेटा पर प्रशिक्षित होने के बावजूद, वीडियो समझने के परीक्षणों में अन्य शीर्ष मॉडलों (जैसे Qwen3 और SigLIP) को मात देता है।
- यह कुशल है: यह बहुत कम पिक्सेल को देखते हुए बेहतर परिणाम प्राप्त करता है।
- यह सार्वभौमिक है: यह सिंगल इमेज, छोटे क्लिप और लंबी फिल्मों पर भी बेहतरीन काम करता है।
संक्षेप में:
OneVision-Encoder पूरी फिल्म को फ्रेम-दर-फ्रेम याद करने की कोशिश करना बंद कर देता है। इसके बजाय, यह एक इंसान की तरह फिल्म देखना सीखता है: उबाऊ बैकग्राउंड को अनदेखा करना और पूरी तरह से एक्शन, गति और आश्चर्यों पर ध्यान केंद्रित करना। अपने दिमाग को वीडियो तकनीक (कोडेक) के साथ संरेखित करके, इसने मशीनों के "देखने" का एक बहुत अधिक कुशल और बुद्धिमान तरीका बना लिया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।