← नवीनतम पेपर
💻 computer science

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

यह शोध पत्र OneVision-Encoder प्रस्तुत करता है, जो एक मल्टीमॉडल आर्किटेक्चर है जो वीडियो कोडेक सिद्धांतों के साथ संरेखित होता है, क्योंकि यह समान पिक्सेल ग्रिड के बजाय विरल (sparse), उच्च-एन्ट्रॉपी वाले क्षेत्रों पर गणना केंद्रित करता है, जिससे इमेज, वीडियो और डॉक्यूमेंट समझ के बेंचमार्क में बेहतर दक्षता और सटीकता प्राप्त होती है।

मूल लेखक: Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei L
प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 2 घंटे की फिल्म देखना चाहते हैं, लेकिन आपके पास केवल स्क्रिप्ट के 10 पन्ने पढ़ने जितनी ऊर्जा बची है।

पुराना तरीका (वर्तमान AI):
अधिकांश वर्तमान AI मॉडल स्क्रिप्ट के हर एक शब्द को पढ़ने की कोशिश करते हैं, शुरुआती क्रेडिट से लेकर अंतिम फेड-आउट तक। वे पेड़ों, बादलों, दीवारों और सन्नाटे के विवरण को भी उतनी ही एकाग्रता से पढ़ते हैं जितना कि उस हिस्से को जहाँ नायक खलनायक को मुक्का मारता है। वे अपनी सीमित ऊर्जा उबाऊ, स्थिर हिस्सों पर बर्बाद कर देते हैं, जिससे वे तब थका हुआ और भ्रमित महसूस करते हैं जब रोमांचक एक्शन आखिरकार शुरू होता है। वे वीडियो के हर पल को समान रूप से महत्वपूर्ण मानते हैं।

नया तरीका (OneVision-Encoder):
OneVision-Encoder के पीछे के शोधकर्ताओं ने महसूस किया कि मानव मस्तिष्क (और वीडियो कंप्रेशन तकनीक) इस तरह काम नहीं करते हैं। हम बैकग्राउंड को याद नहीं रखते; हमें बदलाव याद रहते हैं।

उन्होंने एक ऐसा AI बनाया है जो एक स्मार्ट मूवी एडिटर या दिमाग वाले निगरानी कैमरे की तरह काम करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:

1. "कोडेक" का रहस्य (जादुई ट्रिक)

सोचिए कि आपका फोन स्पेस बचाने के लिए वीडियो को कैसे कंप्रेस करता है। यह हर एक फ्रेम को पूरी तरह से सेव नहीं करता है।

  • I-Frames (एक स्नैपशॉट): यह पूरे दृश्य की एक पूर्ण, स्पष्ट तस्वीर सेव करता है (जैसे एक फोटो)।
  • P-Frames (अपडेट्स): अगले 30 सेकंड के लिए, यह पूरी तस्वीर फिर से सेव नहीं करता है। यह केवल एक छोटा सा नोट सेव करता है: "लाल शर्ट वाला आदमी 2 इंच बाईं ओर खिसका है।"

वर्तमान AI इन "छोटे नोट्स" को अनदेखा करता है और हर बार पूरी तस्वीर को फिर से पढ़ने की कोशिश करता है। OneVision-Encoder पहला ऐसा है जो कहता है: "हे, चलो बस उन छोटे नोट्स को पढ़ते हैं! असली कहानी वहीं हो रही है।"

2. "मोशन डिटेक्टिव" (एक्शन को पहचानना)

पूरी स्क्रीन को देखने के बजाय, यह AI एक मोशन डिटेक्टिव (गति का जासूस) की तरह काम करता है।

  • यदि हवा में एक पेड़ झूम रहा है, तो AI उसे अनदेखा कर देता है (क्योंकि वह अनुमानित है)।
  • यदि अचानक एक पक्षी स्क्रीन के सामने से उड़ जाता है, तो AI उस पक्षी पर ज़ूम करता है।
  • यदि कोई कार दुर्घटनाग्रस्त होती है, तो AI पूरी तरह से उस दुर्घटना पर ध्यान केंद्रित करता है।

यह केवल वीडियो के उस 3% से 25% हिस्से पर ध्यान देता है जो वास्तव में बदल रहा है या आश्चर्यजनक है। यह उबाऊ, स्थिर बैकग्राउंड को अनदेखा कर देता है। यह एक किताब पढ़ने जैसा है लेकिन केवल उन वाक्यों को हाइलाइट करना जहाँ प्लॉट में मोड़ आता है, और फर्नीचर के विवरणों को छोड़ देना।

3. "स्मार्ट टोकन" बजट

कल्पना कीजिए कि आपके पास 2,000 LEGO ब्रिक्स (ये वे "टोकन" हैं जिनका उपयोग AI वीडियो को समझने के लिए करता है) की एक बाल्टी है।

  • पुराना AI: एक स्थिर दीवार (बैकग्राउंड) बनाने के लिए 1,000 ब्रिक्स का उपयोग करता है और एक छोटे, धुंधले एक्शन सीन को बनाने के लिए 1,000 ब्रिक्स का उपयोग करता है। परिणाम एक अस्त-व्यस्त, अक्षम मॉडल है।
  • OneVision-Encoder: दीवार बनाने के लिए 200 ब्रिक्स का उपयोग करता है (इतना कि यह पता चल सके कि आप कहाँ हैं) और शेष 1,800 ब्रिक्स एक विस्तृत, हाई-स्पीड एक्शन सीन बनाने में लगा देता है।

क्योंकि यह अपने "LEGO ब्रिक्स" को केवल महत्वपूर्ण हिस्सों पर केंद्रित करता है, इसलिए यह कम संसाधनों के बावजूद वीडियो को बेहतर और तेजी से समझ लेता है।

4. "क्लस्टर" शिक्षक (समूहीकरण द्वारा सीखना)

AI को कैसे पता चलता है कि क्या महत्वपूर्ण है? यह केवल अनुमान नहीं लगाता।
कल्पना कीजिए कि एक शिक्षक के पास एक विशाल व्हाइटबोर्ड है जिसमें 1 मिलियन श्रेणियां (जैसे "कूदना," "खाना बनाना," "गिरना," "मुस्कुराना") हैं।
केवल यह कहने के बजाय कि "यह एक कुत्ता है," AI समान क्रियाओं को एक साथ समूहबद्ध करना सीखता है। यह सीखता है कि "एक कुत्ते का कूदना" और "एक बिल्ली का कूदना" एक ही "कूदने" के क्लस्टर में आते हैं, जबकि "एक कुत्ते का सोना" एक अलग क्लस्टर में आता है। यह इसे गति के अर्थ को समझने में मदद करता है, न कि केवल पिक्सेल को।

परिणाम: यह क्यों मायने रखता है?

पेपर दिखाता है कि यह नया AI एक सुपरस्टार है:

  • यह स्मार्ट है: यह बहुत कम डेटा पर प्रशिक्षित होने के बावजूद, वीडियो समझने के परीक्षणों में अन्य शीर्ष मॉडलों (जैसे Qwen3 और SigLIP) को मात देता है।
  • यह कुशल है: यह बहुत कम पिक्सेल को देखते हुए बेहतर परिणाम प्राप्त करता है।
  • यह सार्वभौमिक है: यह सिंगल इमेज, छोटे क्लिप और लंबी फिल्मों पर भी बेहतरीन काम करता है।

संक्षेप में:
OneVision-Encoder पूरी फिल्म को फ्रेम-दर-फ्रेम याद करने की कोशिश करना बंद कर देता है। इसके बजाय, यह एक इंसान की तरह फिल्म देखना सीखता है: उबाऊ बैकग्राउंड को अनदेखा करना और पूरी तरह से एक्शन, गति और आश्चर्यों पर ध्यान केंद्रित करना। अपने दिमाग को वीडियो तकनीक (कोडेक) के साथ संरेखित करके, इसने मशीनों के "देखने" का एक बहुत अधिक कुशल और बुद्धिमान तरीका बना लिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →