← नवीनतम पेपर
🤖 AI

Rethinking Token Reduction for Large Vision-Language Models

यह शोध पत्र MetaCompress को प्रस्तुत करता है, जो एक लर्निंग-आधारित, प्रॉम्प्ट-अज्ञेय (prompt-agnostic) विधि है जो मौजूदा ह्यूरिस्टिक और प्रॉम्प्ट-निर्भर दृष्टिकोणों की सीमाओं को दूर करने के लिए टोकन रिडक्शन को एक सीखने योग्य संपीड़न मैपिंग (learnable compression mapping) के रूप में तैयार करती है, जिससे लार्ज विजन-लैंग्वेज मॉडल्स के लिए मल्टी-टर्न विजुअल क्वेश्चन अनस्विंग में बेहतर दक्षता और सटीकता प्राप्त होती है।

मूल लेखक: Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक Large Vision-Language Model, या LVLM) है जो किसी तस्वीर को देख सकता है और उसके बारे में आपसे चैट कर सकता है।

समस्या: "बहुत अधिक विवरण" की दुविधा

अभी, जब आप इस रोबोट को एक फोटो दिखाते हैं, तो यह छवि को हजारों छोटे-छोटे टुकड़ों में तोड़ देता है जिन्हें टोकन (जैसे पहेली के टुकड़े) कहा जाता है। यह तस्वीर को समझने के लिए हर एक टुकड़े को देखने की कोशिश करता है।

  • समस्या: यदि आप एक प्रश्न पूछते हैं, तो रोबोट सभी टुकड़ों को देखता है, उत्तर देता है, और आप खुश होते हैं।
  • वास्तविक दुनिया: लेकिन क्या होगा अगर आप एक बातचीत करना चाहते हैं?
    • आप: "इस फोटो में क्या है?"
    • रोबोट: "यह एक पार्क में खेल रहा कुत्ता है।"
    • आप: "क्या कुत्ते ने लाल रंग का कॉलर पहना है?"
    • रोबोट: "हाँ, उसने पहना है।"
    • आप: "बैकग्राउंड में किस तरह के पेड़ हैं?"

यहाँ पेच यह है: आपके दूसरे या तीसरे प्रश्न का उत्तर देने के लिए, रोबोट को फोटो के उन हिस्सों को देखने की आवश्यकता हो सकती है जिन्हें उसने पहले प्रश्न के लिए अनदेखा कर दिया था।

वर्तमान तरीके उन "महत्वपूर्ण नहीं" समझे जाने वाले टुकड़ों को तुरंत फेंककर गति बढ़ाने की कोशिश करते हैं। वे आमतौर पर आपके द्वारा पूछे गए पहले प्रश्न के आधार पर अनुमान लगाते हैं कि क्या महत्वपूर्ण है।

  • उपमा: कल्पना कीजिए कि एक लाइब्रेरियन है जो, आपके "इतिहास अनुभाग कहाँ है?" पूछने के बाद, विज्ञान और कला की सभी किताबें फेंक देता है, यह सोचकर कि आपको उनकी कभी आवश्यकता नहीं होगी। फिर, जब आप पूछते हैं, "क्या आपके पास अंतरिक्ष के बारे में कोई किताबें हैं?", तो लाइब्रेरियन को कहना पड़ता है, "ओह, मैंने उन्हें फेंक दिया।"

यह एक एकल प्रश्न के लिए काम करता है, लेकिन यह मल्टी-टर्न (बहु-चरण) बातचीत में बुरी तरह विफल हो जाता है क्योंकि रोबक को यह नहीं पता होता कि आप आगे क्या पूछेंगे।

पुराने समाधान (और वे क्यों विफल होते हैं)

  1. "प्रॉम्प्ट-डिपेंडेंट" (Prompt-Dependent) दृष्टिकोण: रोबोट आपके पहले प्रश्न को देखता है और केवल उन्हीं इमेज पार्ट्स को रखता है जो उस प्रश्न के लिए प्रासंगिक हैं।
    • दोष: यह बैकग्राउंड या अन्य विवरणों को फेंक देता है जो आपके अगले प्रश्न के लिए महत्वपूर्ण हो सकते हैं।
  2. "ह्यूरिस्टिक" (Heuristic) दृष्टिकोण: रोबोट एक सरल नियम का उपयोग करता है (जैसे "उन टुकड़ों को रखना जिन्हें रोबोट की आँखें वर्तमान में देख रही हैं")।
    • दोष: यह एक सामान्य मानचित्र के बजाय जीपीएस (GPS) का उपयोग करने जैसा है। यह ठीक है, लेकिन यह गलत टुकड़ों को फेंक देता है क्योंकि "नियम" पर्याप्त स्मार्ट नहीं होते हैं।

नया समाधान: MetaCompress

इस पेपर के लेखक, MetaCompress, एक स्मार्ट तरीका प्रस्तावित करते हैं। टुकड़ों को खुद से अनुमान लगाने के बजाय, वे रोबोट को छवि को स्वयं कंप्रेस (संक्षिप्त) करना सिखाते हैं।

इसे इस तरह समझें:

1. "स्मार्ट समराइज़र" (मैपिंग सीखना)

मैन्युअल रूप से यह तय करने के बजाय कि कौन से पहेली के टुकड़े रखने हैं, टीम ने एक छोटा, स्मार्ट "समराइज़र" मॉड्यूल बनाया।

  • पुराना तरीका: "मुझे लगता है कि कुत्ता महत्वपूर्ण है, इसलिए मैं कुत्ते के टुकड़ों को रखूँगा और घास को फेंक दूँगा।"
  • MetaCompress का तरीका: रोबोट पूरी छवि को देखता है और एक विशेष "कंप्रेशन रेसिपी" सीखता है। यह पता लगाता है कि हजारों पहेली के टुकड़ों को कैसे एक छोटे, सघन (dense) सेट में समेटा जाए जो अभी भी सभी आवश्यक जानकारी को धारण करता है, बस एक अधिक कुशल प्रारूप में।

2. "यूनिवर्सल अडैप्टर" (Prompt-Agnostic)

सबसे अच्छी बात? यह समराइज़र आपकी पहली क्वेरी की परवाह नहीं करता है।

  • यह यह तय करने के लिए आपके टेक्स्ट प्रॉम्प्ट को नहीं देखता कि क्या रखना है।
  • यह छवि को देखता है और उसका एक कंप्रेस्ड संस्करण बनाता है जो आपके द्वारा पूछे जाने वाले किसी भी प्रश्न के लिए तैयार है।
  • उपमा: समुद्र तट के लिए पैकिंग करने के बजाय कि "मैं समुद्र तट पर जा रहा हूँ," आप एक "यूनिवर्सल ट्रैवल किट" पैक करते हैं जिसमें समुद्र तट, पहाड़ या शहर के लिए आवश्यक हर चीज़ होती है, ताकि आपको कभी भी अनपैक और री-पैक न करना पड़े।

3. "डेटा-एफिशिएंट" (Data-Efficient) ट्रेनिंग

आमतौर पर, रोबोट को यह सिखाने के लिए भारी मात्रा में डेटा और समय की आवश्यकता होती है। लेखकों ने एक चतुर ट्रिक खोजी:

  • उन्होंने समराइज़र को एक बहुत छोटे डेटासेट (लगभग 20,000 इमेज) पर प्रशिक्षित किया।
  • उन्होंने एक "मेटा-लर्निंग" दृष्टिकोण का उपयोग किया, जिसका अर्थ है कि रोबोट ने विशिष्ट छवियों को याद करने के बजाय, सर्वश्रेष्ठ कंप्रेशन रणनीति को कैसे सीखा जाए यह सीखा।
  • परिणाम: यह एक शेफ को कुछ बुनियादी खाना बनाने की तकनीकें सिखाने जैसा है ताकि वे कोई भी व्यंजन बना सकें, बजाय इसके कि उन्हें 10,000 विशिष्ट रेसिपी याद करने के लिए मजबूर किया जाए।

परिणाम: तेज़, स्मार्ट और सस्ता

जब उन्होंने इस नई पद्धति का परीक्षण किया:

  • गति: रोबोट बहुत तेज़ हो गया क्योंकि उसे कम टुकड़ों को प्रोसेस करना था।
  • मेमोरी: इसने कम कंप्यूटर मेमोरी का उपयोग किया (जो फोन या लैपटॉप पर चलाने के लिए बेहतरीन है)।
  • सटीकता: आश्चर्यजनक रूप से, यह बातचीत में पुराने तरीकों की तुलना में अधिक सटीक था। क्योंकि इसने एक गलत अनुमान के आधार पर "गलत" टुकड़ों को नहीं फेंका, इसलिए यह फॉलो-अप प्रश्नों का उत्तर पूरी तरह से दे सका।

मुख्य निष्कर्ष (The Bottom Line)

MetaCompress एक ऐसे रोबोट से अपग्रेड करने जैसा है जो "अनुमान" लगाता है, एक ऐसे रोबोट में जो पूरी तस्वीर को "समझता" है और उसका एक सटीक, संक्षिप्त सारांश रखता है। यह कंप्यूटर को धीमा किए बिना या महत्वपूर्ण विवरण खोए बिना छवियों के बारे में लंबी, स्वाभाविक बातचीत की अनुमति देता है।

यह एक ऐसे लाइब्रेरियन से अंतर है जो अंदाजे के आधार पर किताबें फेंकता है, और एक ऐसे लाइब्रेरियन से जो एक पूर्ण, संक्षिप्त विश्वकोश (encyclopedia) बनाता है जिसमें आपके द्वारा पूछे जाने वाले किसी भी प्रश्न का उत्तर मौजूद होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →