A Survey of Token Compression for Efficient Multimodal Large Language Models
यह शोध पत्र कुशल मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए टोकन कंप्रेशन तकनीकों का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो वर्तमान प्रगति को समेकित करने और भविष्य के अनुसंधान को निर्देशित करने के लिए मौजूदा विधियों को उनके लक्षित मोडैलिटीज (इमेज, वीडियो और ऑडियो) और उनके अंतर्निहित तंत्रों दोनों द्वारा वर्गीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) है जो टेक्स्ट पढ़ सकता है, तस्वीरें देख सकता है, वीडियो देख सकता है और ऑडियो सुन सकता है। यह सहायक अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसकी एक बड़ी समस्या है: जब आप इसे एक साथ बहुत अधिक जानकारी देते हैं, तो यह घबरा जाता है।
इस जानकारी को जो सहायक प्राप्त करता है, उसे "टोकन" (डेटा के छोटे टुकड़े) के एक प्रवाह के रूप में सोचें।
- एक टेक्स्ट प्रॉम्प्ट एक छोटे पत्र की तरह है।
- एक हाई-रेज़ोल्यूशन फोटो एक ऐसे पत्र की तरह है जिसे एक विशाल, विस्तृत भित्ति चित्र (म्यूरल) में बदल दिया गया हो।
- एक वीडियो हजारों उन भित्ति चित्रों का एक पुस्तकालय है, जो हर सेकंड बदल रहे हैं।
- ऑडियो ध्वनि तरंगों का एक निरंतर, हाई-स्पीड प्रवाह है।
जब आप इस सहायक को 90 मिनट की फिल्म खिलाते हैं, तो यह केवल "एक फिल्म" नहीं देखता। यह 5.4 करोड़ टोकन देखता है। यह एक ही सांस में किताबों के पुस्तकालय को पढ़ने की कोशिश करने जैसा है। सहायक का मस्तिष्क ("सेल्फ-अटेंशन" तंत्र) हर एक टोकन की तुलना दूसरे हर टोकन के साथ करने के लिए बाध्य है। इस गणित का भार इतना भारी और तेज़ होता जा रहा है कि कंप्यूटर की मेमोरी खत्म हो जाती है या उत्तर देने में बहुत समय लग जाता है।
समाधान: टोकन कंप्रेशन (Token Compression)
यह शोध पत्र (एक सर्वे) एक विस्तृत मार्गदर्शिका है कि इस सहायक को अपनी बुद्धिमत्ता खोए बिना अधिक कुशल कैसे बनाया जाए। लेखक इसे टोकन कंप्रेशन कहते हैं।
टोकन कंप्रेशन को यात्रा के लिए सूटकेस पैक करने की तरह समझें।
- समस्या: आपके पास कपड़ों से भरा एक सूटकेस है, लेकिन उनमें से 80% चीजें या तो डुप्लिकेट हैं (जैसे 50 एक जैसे सफेद टी-शर्ट) या ऐसी चीजें हैं जिनकी आपको ज़रूरत नहीं है (जैसे बीच की यात्रा के लिए भारी विंटर कोट)।
- लक्ष्य: आप महत्वपूर्ण चीजों को एक छोटे बैग में फिट करना चाहते हैं ताकि आप तेज़ी से यात्रा कर सकें, बिना उन चीजों को छोड़े जिनकी आपको वास्तव में आवश्यकता है।
यह शोध पत्र इस डेटा को "पैक" करने के वर्तमान तरीकों को दो मुख्य तरीकों में व्यवस्थित करता है: डेटा का प्रकार क्या है? और हम इसे कैसे पैक करते हैं?
1. डेटा के प्रकार के आधार पर पैकिंग (क्या)
विभिन्न प्रकार के डेटा में अलग-अलग तरह का "कचरा" (अनावश्यकता/रिडंडेंसी) होता है।
- इमेज (एक स्थिर फोटो):
- कचरा: नीले आसमान की एक फोटो में लाखों नीले पिक्सेल होते हैं जो सभी बिल्कुल एक जैसे होते हैं।
- समाधान: हर एक नीला पिक्सेल भेजने के बजाय, कंप्यूटर उन्हें एक साथ समूहबद्ध करता है। यह कहता है, "यह पूरा क्षेत्र बस नीला आसमान है," और पूरे पैच का प्रतिनिधित्व करने के लिए एक ही टोकन भेजता है।
- वीडियो (एक चलती हुई तस्वीर):
- कचरा: किसी व्यक्ति के बात करने वाले वीडियो में, बैकग्राउंड (दीवार या पेड़) 10 सेकंड तक बिल्कुल वैसा ही रहता है जबकि व्यक्ति थोड़ा हिलता-डुलता है।
- समाधान: कंप्यूटर समझ जाता है, "हमें हर सेकंड 30 बार बैकग्राउंड भेजने की ज़रूरत नहीं है।" यह बैकग्राउंड को एक बार रखता है और केवल उन हिस्सों के अपडेट भेजता है जो हिल रहे हैं। यह पूरे दृश्य को दोबारा भेजने के बजाय एक "चेंज लॉग" (बदलाव की सूची) भेजने जैसा है।
- ऑडियो (ध्वनि तरंग):
- कचरा: आवाज़ की रिकॉर्डिंग में अक्सर लंबे अंतराल, सन्नाटा या बैकग्राउंड का शोर होता है जो कोई अर्थ नहीं जोड़ता।
- समाधान: कंप्यूटर सन्नाटे को काट देता है और समान ध्वनियों को मिला देता है, केवल उन्हीं हिस्सों को रखता है जहाँ आवाज़ वास्तव में बोल रही है या संगीत बदल रहा है।
2. विधि के आधार पर पैकिंग (कैसे)
यह पेपर इस डेटा को पैक करने के लिए उपयोग की जाने वाली तकनीकों को चार मुख्य रणनीतियों में वर्गीकृत करता है:
- "श्रिंक रे" (परिवर्तन-आधारित/Transformation-based):
कल्पना कीजिए कि आप एक हाई-रेज़ोल्यूशन फोटो को बस छोटा कर रहे हैं। आप कुछ विवरण खो देते हैं, लेकिन आप सामान्य आकार और रंग बनाए रखते हैं। यह डेटा को गणितीय रूप से सिकोड़ने (जैसे पूलिंग या एवरेजिंग) के माध्यम से किया जाता है ताकि टोकन की सूची छोटी हो सके। - "ग्रुपिंग गेम" (समानता-आधारित/Similarity-based):
कल्पना कीजिए कि आपके पास 1,000 लाल लेगो ब्रिक्स का ढेर है। उन सभी 1,000 को सूचीबद्ध करने के बजाय, आप कहते हैं, "यहाँ एक लाल ब्रिक है, और 999 और बिल्कुल इसके जैसे हैं।" कंप्यूटर उन टोकन को ढूंढता है जो दिखने या सुनने में बहुत समान हैं और उन्हें एक एकल "प्रतिनिधि" टोकन में मिला देता है। - "स्पॉटलाइट" (अटेंशन-आधारित/Attention-based):
कल्पना कीजिए कि एक शिक्षक एक कक्षा को देख रहा है। शिक्षक केवल उन छात्रों पर ध्यान देता है जो हाथ उठा रहे हैं (महत्वपूर्ण टोकन) और उन पर ध्यान नहीं देता जो पीछे सो रहे हैं। कंप्यूटर अपने स्वयं के "अटेंशन स्कोर" (कि वह प्रत्येक डेटा के बारे में कितना ध्यान देता है) को देखता है और उन टोकन को हटा देता है जिन्हें वह वैसे भी अनदेखा कर रहा है। - "क्वैरी गाइड" (क्वेरी-आधारित/Query-based):
कल्पना कीजिए कि आप घास के ढेर में एक विशिष्ट सुई ढूंढ रहे हैं। घास के हर टुकड़े को देखने के बजाय, आप पूछते हैं, "सुई कहाँ है?" कंप्यूटर आपके प्रश्न (क्वेरी) का उपयोग करके उन सभी चीजों को फ़िल्टर कर देता है जो आपके प्रश्न से मेल नहीं खातीं, और केवल प्रासंगिक टोकन को रखता है।
यह क्यों महत्वपूर्ण है
लेखक समझाते हैं कि यह केवल कंप्यूटर को तेज़ चलाने के बारे में नहीं है। यह इसे उपयोगी बनाने के बारे में है।
- कंप्रेशन के बिना, वर्तमान मॉडल के लिए 90 मिनट की फिल्म को वास्तविक समय (रियल-टाइम) में प्रोसेस करना असंभव है।
- कंप्रेशन के साथ, मॉडल फिल्म को "देख" सकता है, कथानक को समझ सकता है, और उस पर सवाल पूछ सकता है, और वह भी मेमोरी के एक छोटे से हिस्से का उपयोग करते हुए।
चुनौती (Catch)
यह पेपर चेतावनी भी देता है कि यह जादू नहीं है। यदि आप सूटकेस को बहुत कसकर पैक करते हैं:
- आप विवरण खो सकते हैं: यदि आप फोटो को बहुत अधिक कंप्रेस करते हैं, तो आप बैकग्राउंड में एक छोटा लेकिन महत्वपूर्ण साइन मिस कर सकते हैं।
- यह प्रवाह को तोड़ देता है: वीडियो में, यदि आप बहुत अधिक फ्रेम को मिला देते हैं, तो हलचल झटकेदार या भ्रमित करने वाली लग सकती है।
- फिट होना कठिन है: इनमें से कुछ "पैकिंग" के तरीके आज उपलब्ध सबसे तेज़ कंप्यूटर चिप्स के साथ उपयोग करना कठिन है क्योंकि उनके लिए कंप्यूटर को अलग तरह से गणना करने के लिए रुकने की आवश्यकता होती है।
सारांश में:
यह शोध पत्र शोधकर्ताओं के लिए एक मानचित्र है। यह कहता है, "हमारे पास एक समस्या है: हमारा AI बहुत अधिक डेटा में डूब रहा है। यहाँ वे सभी अलग-अलग तरीके दिए गए हैं जिनसे हम इसे अपने डेटा को फ़िल्टर, ग्रुप और श्रिंक करना सिखाने की कोशिश कर रहे हैं ताकि यह वास्तव में वास्तविक दुनिया में कार्य कर सके।" यह इन तरीकों को इस आधार पर व्यवस्थित करता है कि वे चित्रों, वीडियो या ध्वनि को देख रहे हैं, और उस काम को करने के लिए वे विशिष्ट गणितीय ट्रिक्स का उपयोग करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।