← नवीनतम पेपर
💻 computer science

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

यह शोध पत्र PriorTR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) टोकन रिडक्शन विधि है जो एकल फॉरवर्ड पास के भीतर एक नल टोकन प्रोब (null token probe) का उपयोग करके टास्क-कंडीशन्ड अटेंशन को मॉडल-प्रेरित प्रायर्स (model-induced priors) से स्पष्ट रूप से अलग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को त्वरित करती है, जिससे आक्रामक टोकन बजट के तहत सटीकता-दक्षता संतुलन में सुधार होता है।

मूल लेखक: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction" (PriorTR) का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

बड़ी समस्या: "शोर वाला कमरा"

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान मित्र (AI) के साथ एक गंभीर बातचीत करने की कोशिश कर रहे हैं, लेकिन आप एक भीड़भाड़ वाले, शोर वाले कमरे में खड़े हैं। वह कमरा सैकड़ों लोगों (एक छवि का प्रतिनिधित्व करने वाले विजुअल टोकन) से भरा हुआ है।

आपका मित्र उस विशिष्ट प्रश्न का उत्तर देने की कोशिश कर रहा है जो आपने पूछा है, जैसे कि "लाल शर्ट पहने व्यक्ति क्या कर रहा है?"

हालाँकि, आपके मित्र की एक बुरी आदत है: वे स्वाभाविक रूप से कमरे के सबसे शोर मचाने वाले और चमक-धमक वाले लोगों की ओर आकर्षित होते हैं, चाहे आपने उनसे कुछ भी पूछा हो। यदि लाउडस्पीकर के पास चमकीले पीले सूट में कोई व्यक्ति खड़ा है, तो आपके मित्र की आँखें तुरंत उसी पर टिक जाएँगी, भले ही उस व्यक्ति का आपके प्रश्न से कोई लेना-देना न हो।

AI की दुनिया में, इसे "मॉडल-इंड्यूस्ड प्रायर" (model-induced prior) कहा जाता है। AI स्वाभाविक रूप से छवि के उच्च-कंट्रास्ट या बनावट वाले हिस्सों (जैसे कि चमकीला आकाश या व्यस्त बैकग्राउंड) पर ध्यान केंद्रित करता है क्योंकि वे विजुअल रूप से "शोर" (loud) होते हैं, न कि इसलिए कि वे आपके विशिष्ट निर्देश के लिए प्रासंगिक हैं।

पुराना तरीका: सबसे तेज़ आवाज़ों को चुनना

इन AI मॉडल्स को तेज़ करने के प्रयास में पिछले तरीकों ने समय बचाने के लिए कमरे के अधिकांश लोगों को अनदेखा करने की कोशिश की। वे यह देखते थे कि AI किन लोगों पर सबसे अधिक ध्यान दे रहा है और केवल उन्हीं को रखते थे।

खामी: क्योंकि AI स्वाभाविक रूप से "शोर वाले" लोगों (बैकग्राउंड नॉइज़) की ओर झुकाव रखता था, पुराने तरीके गलत लोगों को ही चुन लेते थे। उन्होंने उस पीले सूट वाले व्यक्ति को रखा और उस लाल शर्ट वाले व्यक्ति को हटा दिया जो वास्तव में उस क्रिया को कर रहा था जिसके बारे में आपने पूछा था। जब AI को बहुत कम लोगों के साथ अनुमान लगाना पड़ता था (एक "सख्त टोकन बजट"), तो वह अक्सर गलत उत्तर देता था क्योंकि वह गलत सबूतों को देख रहा होता था।

नया समाधान: PriorTR (द "साइलेंस फ़िल्टर")

लेखकों ने एक नई विधि प्रस्तावित की है जिसे PriorTR कहा जाता है। इसे AI को अपनी बुरी आदतों को अनदेखा करने और केवल उस पर ध्यान केंद्रित करने में मदद करने वाली एक चतुर ट्रिक के रूप में समझें जो आपने पूछी है।

यह इस प्रकार काम करता है, चरण-दर-चरण:

1. "मौन प्रेक्षक" (The Null Token)

इससे पहले कि AI आपके प्रश्न का उत्तर देने का प्रयास करे, शोधकर्ता उससे एक "डमी" प्रश्न पूछते हैं। वे छवि के ठीक बाद लेकिन आपके प्रश्न से पहले एक मौन, खाली टोकन (जैसे एक खाली स्थान या एक ठहराव) डाल देते हैं।

  • उपमा: कल्पना कीजिए कि आप अपने मित्र से कहते हैं, "बस कमरे को देखो और मुझे बताओ कि कौन सबसे अधिक उभर कर दिख रहा है, बिना मेरे कुछ भी विशिष्ट पूछे।"
  • परिणाम: आपका मित्र उन शोर मचाने वाले, चमकदार लोगों की ओर इशारा करता है (बैकग्राउंड नॉइज़)। ध्यान का यह मानचित्र "प्रायर" (Prior) है। यह दिखाता है कि AI स्वाभाविक रूप से क्या देखना पसंद करता है।

2. "असली सवाल" (The Posterior)

इसके बाद, आप अपना वास्तविक प्रश्न पूछते हैं: "लाल शर्ट पहने व्यक्ति क्या कर रहा है?"

  • उपमा: आपका मित्र फिर से कमरे को देखता है, लेकिन इस बार वह लाल शर्ट वाले व्यक्ति को खोजने की कोशिश कर रहा है। यह "पोस्टीरियर" (Posterior) है (निर्देश के साथ ध्यान)।

3. "घटाव की ट्रिक" (Prior Correction)

अब, PriorTR दोनों मानचित्रों की तुलना करता है।

  • सरल अंग्रेजी में गणित: यह "असली सवाल" वाले मानचित्र को लेता है और उसमें से "मौन प्रेक्षक" वाले मानचित्र को घटा (subtract) देता है।
  • परिणाम: यदि AI दोनों स्थितियों में शोर मचाते पीले सूट की ओर देख रहा था, तो घटाने से वह प्रभाव कट जाता है। यदि AI अचानक लाल शर्ट वाले व्यक्ति की ओर देखने लगा केवल इसलिए क्योंकि आपने पूछा था, तो वह सिग्नल मजबूत बना रहता है।

यह एक "प्रायर-करेक्टेड" (Prior-Corrected) मानचित्र बनाता है। यह ठीक से उजागर करता है कि आपके विशिष्ट प्रश्न द्वारा दी गई कौन सी नई और उपयोगी जानकारी है, जिससे AI का स्वाभाविक पूर्वाग्रह हट जाता है।

प्रतिफल: तेज़ और स्मार्ट

एक बार जब AI जान जाता है कि वास्तव में आपके प्रश्न के लिए कौन से लोग (टोकन) प्रासंगिक हैं, तो वह बाकी सबको हटा सकता है।

  • भौतिक छंटनी (Physical Pruning): AI केवल अतिरिक्त लोगों को "अनदेखा" नहीं करता है; वह उन्हें भौतिक रूप से अपनी मेमोरी से हटा देता है और उनके बारे में सोचना बंद कर देता है।
  • लाभ: यह AI को बहुत तेज़ (कम कंप्यूटिंग पावर की आवश्यकता) और सस्ता (कम मेमोरी का उपयोग) बनाता है, लेकिन आश्चर्यजनक रूप से, यह उत्तरों को अधिक सटीक भी बनाता है क्योंकि AI अब बैकग्राउंड के शोर से विचलित नहीं होता है।

यह क्यों महत्वपूर्ण है

यह शोध पत्र दिखाता है कि जब आप AI को बहुत कम "लोगों" के साथ काम करने के लिए मजबूर करते हैं (आक्रामक टोकन रिडक्शन), तो पुराने तरीके बुरी तरह विफल हो जाते हैं क्योंकि वे गलत लोगों को चुन लेते थे। PriorTR, इस "साइलेंस फ़िल्टर" ट्रिक का उपयोग करके, सही लोगों को बनाए रखता है।

संक्षेप में: PriorTR AI को यह सिखाता है कि "वह स्वाभाविक रूप से क्या देखना पसंद करता है" और "आप वास्तव में उससे क्या देखना चाहते हैं" के बीच अंतर कैसे किया जाए, जिससे वह अपनी बुद्धिमत्ता खोए बिना तेज़ी से काम कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →