← नवीनतम पेपर
🤖 AI

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

यह शोध पत्र CATP को प्रस्तुत करता है, जो एक नवीन टोकन प्रूनिंग विधि है जो बड़े मल्टीमॉडल मॉडलों में कम्प्यूटेशनल दक्षता बनाए रखते हुए सटीकता को महत्वपूर्ण रूप से बढ़ाने के लिए क्रॉस-अटेंशन तंत्र और एक परिष्कृत वोटिंग रणनीति का लाभ उठाती है।

मूल लेखक: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक बुद्धिमान लेकिन काम के बोझ से दबे हुए लाइब्रेरियन (BLIP-2 मॉडल) हैं, जो किताबों और तस्वीरों के एक विशाल पुस्तकालय के बारे में सवालों के जवाब देने की कोशिश कर रहे हैं।

हर बार जब कोई सवाल पूछता है, तो लाइब्रेरियन को जवाब खोजने के लिए हर एक किताब के हर एक पन्ने और हर एक फोटो के हर एक पिक्सेल को देखना पड़ता है। इसमें बहुत समय लगता है और लाइब्रेरियन थक जाता है (उच्च कम्प्यूटेशनल लागत)।

समस्या यह है कि उन पन्नों और पिक्सेलों में से अधिकांश केवल उबाऊ बैकग्राउंड शोर (जैसे बिल्ली की फोटो में आसमान का रंग, या टेक्स्ट का फॉन्ट) होते हैं। वे वास्तव में सवाल का जवाब देने में मदद नहीं करते हैं।

पुराना तरीका: "ब्रूट फोर्स" कट (The "Brute Force" Cut)

पिछले तरीकों ने इसे तेज़ करने की कोशिश की, बस आधे पन्नों को बेतरतीब ढंग से फेंक दिया या केवल उन्हीं पन्नों को रखा जिनमें सबसे बड़े, गहरे शब्द थे।

  • L2-norm विधि ऐसा था जैसे केवल बड़े फॉन्ट वाले पन्नों को रखना।
  • सेल्फ-अटेंशन (Self-attention) विधि ऐसा था जैसे केवल उन पन्नों को रखना जिन्हें लाइब्रेरियन ने टेक्स्ट के भीतर ही सबसे ज्यादा बार देखा था।

परिणाम: लाइब्रेरियन तेज़ तो हो गया, लेकिन वह भयानक जवाब देने लगा। उन्होंने बिल्ली की महत्वपूर्ण तस्वीर को इसलिए फेंक दिया क्योंकि उसका फॉन्ट छोटा था, या किसी उबाऊ पन्ने को इसलिए रख लिया क्योंकि उसमें एक बड़ा शब्द था। सटीकता (Accuracy) गिर गई।

नया तरीका: CATP (द "स्मार्ट मैचमेकर")

लेखकों ने CATP (Cross-Attention Token Pruning) पेश किया। CATP को एक स्मार्ट मैचमेकर के रूप में सोचें जो जानता है कि पूछे गए विशिष्ट प्रश्न के लिए चित्र का कौन सा हिस्सा प्रासंगिक है।

यहाँ बताया गया है कि CATP कैसे काम करता है, एक सरल उपमा का उपयोग करके:

1. वोटिंग सिस्टम (द "पैनल ऑफ जजेस")

केवल अंदाज़ा लगाने के बजाय कि चित्र के कौन से हिस्से महत्वपूर्ण हैं, CATP न्यायाधीशों का एक पैनल ( Cross-Attention Layers) स्थापित करता है।

  • कल्पना करें कि प्रश्न "क्वेरी टोकन्स" (वे विशिष्ट चीजें जिनके बारे में आप पूछ रहे हैं) की एक सूची है।
  • कल्पना करें कि छवि (Image) "इमेज टोकन्स" (फोटो के छोटे पहेली के टुकड़े) की एक सूची है।

पुराने दिनों में, न्यायाधीश केवल इस आधार पर चिल्लाते थे कि वे कितने "तेज़" थे!
CATP नियमों को बदल देता है: चित्र का हर एक टुकड़ा प्रश्न के हर एक हिस्से के लिए वोट दे सकता है।

  • यदि चित्र का एक टुकड़ा (जैसे "लाल गेंद") प्रश्न के एक हिस्से (जैसे "गेंद कहाँ है?") के लिए बहुत प्रासंगिक है, तो वह चित्र का टुकड़ा प्रश्न के हिस्से को उच्च वोट देगा।
  • यदि चित्र का एक टुकड़ा (जैसे "नीला आसमान") का सवाल से कोई लेना-देना नहीं है, तो वह कम वोट देगा।

2. स्कोरबोर्ड

CATP सभी वोटों को जोड़ता है।

  • प्रश्न के वे हिस्से जिन्हें चित्र से बहुत अधिक वोट मिलते हैं, वे "VIP" हैं। वे बने रहते हैं।
  • प्रश्न के वे हिस्से जिन्हें कम वोट मिलते हैं, वे "उबाऊ" हैं। उन्हें बाहर निकाल दिया जाता है (प्रून किया जाता है)।

यह सुनिश्चित करता है कि लाइब्रेरियन केवल प्रश्न के उन हिस्सों को रखे जो वास्तव में चित्र से जुड़े हुए हैं, और बाकी को हटा दे।

3. "वेटेड" अपग्रेड (The "Weighted" Upgrade)

पेपर में यह भी पाया गया कि चित्र के सभी टुकड़े समान नहीं होते हैं। कुछ चित्र के टुकड़े अधिक "प्रभावशाली" होते हैं।

  • स्टैंडर्ड CATP: प्रत्येक चित्र का टुकड़ा एक वोट देता है।
  • वेटेड CATP: यदि चित्र का कोई टुकड़ा पहले से ही बहुत महत्वपूर्ण है (उसका "सेल्फ-अटेंशन" स्कोर उच्च है), तो उसका वोट अधिक गिना जाता है। यह एक सीनियर जज को "सुपर वोट" देने जैसा है। यह प्रूनिंग को और भी स्मार्ट बनाता है।

यह एक बड़ी बात क्यों है?

लेखकों ने इसका परीक्षण एक विजुअल क्वेश्चन अनस्वर्सिंग (VQA) कार्य पर किया (एक तस्वीर को देखना और प्रश्न का उत्तर देना)।

  • पुराने तरीके: जब उन्होंने समय बचाने के लिए 75% डेटा को हटा दिया, तो सटीकता गिरकर लगभग शून्य (1% से 9%) हो गई। यह ऐसा था जैसे किसी लाइब्रेरियन को 100 पन्नों की किताब में से केवल 1 पन्ना पढ़ने के लिए कहना और फिर पूरी कहानी जानने की उम्मीद करना।
  • CATP: भले ही 75% डेटा को हटा दिया जाए, सटीकता आश्चर्यजनक रूप तेज बनी रहती है (लगभग 30% से 44%)।

मुख्य बात (The Bottom Line):
CATP एक हाइलाइटर देने जैसा है जो किताब में केवल उन वाक्यों को मार्क करता है जो वास्तव में सवाल का जवाब देते हैं। यह लाइब्रेरियन को किताब के 80% हिस्से को अनदेखा करने, काम को 8 गुना तेजी से पूरा करने और फिर भी एक सही उत्तर देने की अनुमति देता है।

पेपर का दावा है कि यह विधि पिछले "कटिंग" तरीकों की तुलना में 12 गुना अधिक सटीक है, जो इस बड़ी समस्या को हल करती है कि AI को मूर्ख बनाए बिना उसे तेज़ कैसे बनाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →