← नवीनतम पेपर
💬 NLP

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

ResAdapt एक इनपुट-साइड एडेप्टिव फ्रेमवर्क पेश करता है जो कॉस्ट-अवेयर पॉलिसी ऑप्टिमाइज़ेशन के साथ प्रशिक्षित एक लाइटवेट एलोकेटर के माध्यम से प्रति फ्रेम विजुअल रेजोल्यूशन बजट को गतिशील रूप से आवंटित करता है, जिससे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को निश्चित कम्प्यूटेशनल बजट के भीतर तर्क प्रदर्शन (reasoning performance) में महत्वपूर्ण सुधार करने और लंबे टेम्पोरल कॉन्टेक्स्ट को सपोर्ट करने में सक्षम बनाया जा सके।

मूल लेखक: Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao, Kun Xu, Kang Liu

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao, Kun Xu, Kang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 2 घंटे के सुरक्षा कैमरा वीडियो को देखकर एक रहस्य सुलझाने की कोशिश कर रहे हैं।

समस्या:
आपका मस्तिष्क (AI मॉडल) अविश्वसनीय रूप से स्मार्ट है, लेकिन इसमें एक सीमा है कि वह एक बार में कितनी जानकारी प्रोसेस कर सकता है। यदि आप इसे हाई डेफिनेशन में पूरा 2 घंटे का वीडियो खिला देते हैं, तो यह अभिभूत हो जाता है, इसकी "ब्रेन पावर" (कंप्यूटिंग बजट) खत्म हो जाती है, और यह क्रैश हो जाता है। यदि आप इसे केवल 10x की गति पर चला देते हैं (रेज़ोल्यूशन कम करके), तो आप उस सूक्ष्म विवरण को मिस कर सकते हैं जो रहस्य को सुलझाता है, जैसे कि कोई विशिष्ट लाइसेंस प्लेट या चेहरे का क्षणिक भाव।

वर्तमान तरीके इसे ठीक करने की कोशिश करते हैं:

  1. अंधाधुंध फ्रेम हटाना: "मैं हर दूसरे सेकंड को छोड़ दूँगा।" (आप ठीक उसी क्षण को छोड़ सकते हैं जब अपराध हुआ था)।
  2. सब कुछ धुंधला करना: "मैं पूरी वीडियो को लो-रेजोल्यूशन बना दूँगा।" (आप सभी बारीक विवरण खो देंगे)।
  3. AI को फिर से देखने के लिए कहना: "रुको, यहाँ ज़ूम करो, फिर वहाँ ज़ूम करो।" (इसमें बहुत समय लगता है और यह धीमा है)।

समाधान: ResAdapt (एक स्मार्ट कैमरा ऑपरेटर)
ResAdapt एक सुपर-इंटेलिजेंट कैमरा ऑपरेटर की तरह काम करता है, जो वीडियो के AI के मस्तिष्क तक पहुँचने से पहले ही खड़ा होता है।

AI को पूरा वीडियो देने के बजाय, ResAdapt पहले कच्चे फुटेज को देखता है और निर्णय लेता है: "ठीक है, यह हिस्सा उबाऊ है (एक स्थिर दीवार), चलो AI को एक छोटा, धुंधला थंबनेल दिखाएँ। लेकिन इस हिस्से में एक व्यक्ति भाग रहा है और उसके पास बंदूक है? चलो AI को एक क्रिस्टल-क्लियर, हाई-डेफिनिशन क्लोज-अप दिखाएँ!"

यह यह काम AI के सोचने शुरू करने से पहले करता है। यह सवाल पूछने के आधार पर हर एक फ्रेम के लिए "रेज़ोल्यूशन बजट" को गतिशील रूप से (dynamically) एडजस्ट करता है।

यह कैसे काम करता है (रूपक/Metaphors)

1. "स्मार्ट बजट" (वॉलेट/बटुआ)

कल्पना कीजिए कि आपके पास सीमित पैसा है (कंप्यूटिंग पावर) जिससे आप "विजुअल टोकन" (पिक्सेल) खरीद सकते हैं।

  • पुराना तरीका: आप पूरे दृश्य की 100 एक जैसी, मध्यम-गुणवत्ता वाली तस्वीरें खरीदते हैं।
  • ResAdapt का तरीका: आप महत्वपूर्ण एक्शन की 10 हाई-डेफिनिशन तस्वीरें खरीदते हैं और उबाऊ बैकग्राउंड के 90 छोटे, सस्ते स्केच खरीदते हैं। आपको कुल लागत उतनी ही मिलती है, लेकिन जहाँ वास्तव में ज़रूरत है, वहाँ आपको बहुत अधिक विवरण मिलता है।

2. "एलोकेटर" (एक कंडक्टर/संगीत निर्देशक)

ResAdapt के पास एक छोटा, हल्का मस्तिष्क होता है जिसे एलोकेटर (Allocator) कहते हैं। यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है।

  • यह वीडियो और प्रश्न (जैसे, "लड़के ने क्या गिराया?") को देखता है।
  • यह कैमरे को फुसफुसाता है: "फ्रेम 10? इसे धुंधला कर दो। फ्रेम 15? यहीं पर लड़के ने कप गिराया! ज़ूम इन करो! फ्रेम 20? बस एक त्वरित स्केच।"
  • मुख्य AI (ऑर्केस्ट्रा) अंतर को कभी नहीं जान पाता; उसे बस छवियों का एक बेहतरीन ढंग से क्यूरेट किया गया क्रम प्राप्त होता है और वह समस्या को तेज़ी से हल कर देता है।

3. "टीचर" (CAPO)

एलोकेटर इतना स्मार्ट कैसे बनता है? यह एक प्रशिक्षण पद्धति का उपयोग करता है जिसे CAPO (कॉस्ट-अवेयर पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है।

  • कल्पना कीजिए कि एक शिक्षक एलोकेटर को ग्रेड दे रहा है।
  • यदि एलोकेटर पैसे बचाता है (लो रेज़ोल्यूशन का उपयोग करता है) लेकिन AI फिर भी सही उत्तर देता है, तो शिक्षक उसे बोनस देता है।
  • यदि एलोकेटर पैसे बचाता है लेकिन विवरण छूट जाने के कारण AI गलत उत्तर देता है, तो शिक्षक उसे भारी दंड (penalty) देता है।
  • महत्वपूर्ण बात यह है कि शिक्षक कहता भी है: "दो लगातार एक जैसे फ्रेमों को हाई रेज़ोल्यूशन न दें; यह पैसे की बर्बादी है।" यह सिस्टम को आलसी या दोहराव वाला होने से रोकता है।

यह एक बड़ी बात क्यों है

  • यह तेज़ है: क्योंकि AI को धुंधले, बेकार फ्रेम प्रोसेस नहीं करने पड़ते, इसलिए यह समान समय में 16 गुना अधिक वीडियो देख सकता है।
  • यह स्मार्ट है: कठिन तर्क कार्यों (जैसे वीडियो में गणित की समस्या हल करना) पर, यह केवल "फ्रेम छोड़ने" या "सब कुछ धुंधला करने" की तुलना में काफी बेहतर प्रदर्शन करता है।
  • यह लचीला है: यह AI के मौजूदा हार्डवेयर को नहीं तोड़ता। यह बस AI को एक बेहतर-तैयार किया गया भोजन खिलाता है।

निचोड़ (The Bottom Line)

ResAdapt आपके AI के लिए एक पर्सनल एडिटर को काम पर रखने जैसा है। AI पर एक 4-घंटे का कच्चा वीडियो डालने और उम्मीद करने के बजाय कि वह इसे समझ लेगा, ResAdapt वीडियो को सबसे महत्वपूर्ण क्षणों तक एडिट करता है, महत्वपूर्ण हिस्सों को तेज़ (sharpen) करता है, और बाकी को धुंधला कर देता है। यह AI को समान ऊर्जा का उपयोग करके, लंबे वीडियो को अधिक स्पष्टता के साथ "देखने" की अनुमति देता है।

संक्षेप में: यह AI को वीडियो के उबाऊ हिस्सों पर अपनी दिमागी शक्ति बर्बाद करने से रोकता है ताकि वह अपनी 100% ऊर्जा उन हिस्सों पर केंद्रित कर सके जो वास्तव में मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →