← नवीनतम पेपर
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

यह शोध पत्र कुशल मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए टोकन कंप्रेशन तकनीकों का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो वर्तमान प्रगति को समेकित करने और भविष्य के अनुसंधान को निर्देशित करने के लिए मौजूदा विधियों को उनके लक्षित मोडैलिटीज (इमेज, वीडियो और ऑडियो) और उनके अंतर्निहित तंत्रों दोनों द्वारा वर्गीकृत करता है।

मूल लेखक: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) है जो टेक्स्ट पढ़ सकता है, तस्वीरें देख सकता है, वीडियो देख सकता है और ऑडियो सुन सकता है। यह सहायक अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसकी एक बड़ी समस्या है: जब आप इसे एक साथ बहुत अधिक जानकारी देते हैं, तो यह घबरा जाता है।

इस जानकारी को जो सहायक प्राप्त करता है, उसे "टोकन" (डेटा के छोटे टुकड़े) के एक प्रवाह के रूप में सोचें।

  • एक टेक्स्ट प्रॉम्प्ट एक छोटे पत्र की तरह है।
  • एक हाई-रेज़ोल्यूशन फोटो एक ऐसे पत्र की तरह है जिसे एक विशाल, विस्तृत भित्ति चित्र (म्यूरल) में बदल दिया गया हो।
  • एक वीडियो हजारों उन भित्ति चित्रों का एक पुस्तकालय है, जो हर सेकंड बदल रहे हैं।
  • ऑडियो ध्वनि तरंगों का एक निरंतर, हाई-स्पीड प्रवाह है।

जब आप इस सहायक को 90 मिनट की फिल्म खिलाते हैं, तो यह केवल "एक फिल्म" नहीं देखता। यह 5.4 करोड़ टोकन देखता है। यह एक ही सांस में किताबों के पुस्तकालय को पढ़ने की कोशिश करने जैसा है। सहायक का मस्तिष्क ("सेल्फ-अटेंशन" तंत्र) हर एक टोकन की तुलना दूसरे हर टोकन के साथ करने के लिए बाध्य है। इस गणित का भार इतना भारी और तेज़ होता जा रहा है कि कंप्यूटर की मेमोरी खत्म हो जाती है या उत्तर देने में बहुत समय लग जाता है।

समाधान: टोकन कंप्रेशन (Token Compression)
यह शोध पत्र (एक सर्वे) एक विस्तृत मार्गदर्शिका है कि इस सहायक को अपनी बुद्धिमत्ता खोए बिना अधिक कुशल कैसे बनाया जाए। लेखक इसे टोकन कंप्रेशन कहते हैं।

टोकन कंप्रेशन को यात्रा के लिए सूटकेस पैक करने की तरह समझें।

  • समस्या: आपके पास कपड़ों से भरा एक सूटकेस है, लेकिन उनमें से 80% चीजें या तो डुप्लिकेट हैं (जैसे 50 एक जैसे सफेद टी-शर्ट) या ऐसी चीजें हैं जिनकी आपको ज़रूरत नहीं है (जैसे बीच की यात्रा के लिए भारी विंटर कोट)।
  • लक्ष्य: आप महत्वपूर्ण चीजों को एक छोटे बैग में फिट करना चाहते हैं ताकि आप तेज़ी से यात्रा कर सकें, बिना उन चीजों को छोड़े जिनकी आपको वास्तव में आवश्यकता है।

यह शोध पत्र इस डेटा को "पैक" करने के वर्तमान तरीकों को दो मुख्य तरीकों में व्यवस्थित करता है: डेटा का प्रकार क्या है? और हम इसे कैसे पैक करते हैं?

1. डेटा के प्रकार के आधार पर पैकिंग (क्या)

विभिन्न प्रकार के डेटा में अलग-अलग तरह का "कचरा" (अनावश्यकता/रिडंडेंसी) होता है।

  • इमेज (एक स्थिर फोटो):
    • कचरा: नीले आसमान की एक फोटो में लाखों नीले पिक्सेल होते हैं जो सभी बिल्कुल एक जैसे होते हैं।
    • समाधान: हर एक नीला पिक्सेल भेजने के बजाय, कंप्यूटर उन्हें एक साथ समूहबद्ध करता है। यह कहता है, "यह पूरा क्षेत्र बस नीला आसमान है," और पूरे पैच का प्रतिनिधित्व करने के लिए एक ही टोकन भेजता है।
  • वीडियो (एक चलती हुई तस्वीर):
    • कचरा: किसी व्यक्ति के बात करने वाले वीडियो में, बैकग्राउंड (दीवार या पेड़) 10 सेकंड तक बिल्कुल वैसा ही रहता है जबकि व्यक्ति थोड़ा हिलता-डुलता है।
    • समाधान: कंप्यूटर समझ जाता है, "हमें हर सेकंड 30 बार बैकग्राउंड भेजने की ज़रूरत नहीं है।" यह बैकग्राउंड को एक बार रखता है और केवल उन हिस्सों के अपडेट भेजता है जो हिल रहे हैं। यह पूरे दृश्य को दोबारा भेजने के बजाय एक "चेंज लॉग" (बदलाव की सूची) भेजने जैसा है।
  • ऑडियो (ध्वनि तरंग):
    • कचरा: आवाज़ की रिकॉर्डिंग में अक्सर लंबे अंतराल, सन्नाटा या बैकग्राउंड का शोर होता है जो कोई अर्थ नहीं जोड़ता।
    • समाधान: कंप्यूटर सन्नाटे को काट देता है और समान ध्वनियों को मिला देता है, केवल उन्हीं हिस्सों को रखता है जहाँ आवाज़ वास्तव में बोल रही है या संगीत बदल रहा है।

2. विधि के आधार पर पैकिंग (कैसे)

यह पेपर इस डेटा को पैक करने के लिए उपयोग की जाने वाली तकनीकों को चार मुख्य रणनीतियों में वर्गीकृत करता है:

  • "श्रिंक रे" (परिवर्तन-आधारित/Transformation-based):
    कल्पना कीजिए कि आप एक हाई-रेज़ोल्यूशन फोटो को बस छोटा कर रहे हैं। आप कुछ विवरण खो देते हैं, लेकिन आप सामान्य आकार और रंग बनाए रखते हैं। यह डेटा को गणितीय रूप से सिकोड़ने (जैसे पूलिंग या एवरेजिंग) के माध्यम से किया जाता है ताकि टोकन की सूची छोटी हो सके।
  • "ग्रुपिंग गेम" (समानता-आधारित/Similarity-based):
    कल्पना कीजिए कि आपके पास 1,000 लाल लेगो ब्रिक्स का ढेर है। उन सभी 1,000 को सूचीबद्ध करने के बजाय, आप कहते हैं, "यहाँ एक लाल ब्रिक है, और 999 और बिल्कुल इसके जैसे हैं।" कंप्यूटर उन टोकन को ढूंढता है जो दिखने या सुनने में बहुत समान हैं और उन्हें एक एकल "प्रतिनिधि" टोकन में मिला देता है।
  • "स्पॉटलाइट" (अटेंशन-आधारित/Attention-based):
    कल्पना कीजिए कि एक शिक्षक एक कक्षा को देख रहा है। शिक्षक केवल उन छात्रों पर ध्यान देता है जो हाथ उठा रहे हैं (महत्वपूर्ण टोकन) और उन पर ध्यान नहीं देता जो पीछे सो रहे हैं। कंप्यूटर अपने स्वयं के "अटेंशन स्कोर" (कि वह प्रत्येक डेटा के बारे में कितना ध्यान देता है) को देखता है और उन टोकन को हटा देता है जिन्हें वह वैसे भी अनदेखा कर रहा है।
  • "क्वैरी गाइड" (क्वेरी-आधारित/Query-based):
    कल्पना कीजिए कि आप घास के ढेर में एक विशिष्ट सुई ढूंढ रहे हैं। घास के हर टुकड़े को देखने के बजाय, आप पूछते हैं, "सुई कहाँ है?" कंप्यूटर आपके प्रश्न (क्वेरी) का उपयोग करके उन सभी चीजों को फ़िल्टर कर देता है जो आपके प्रश्न से मेल नहीं खातीं, और केवल प्रासंगिक टोकन को रखता है।

यह क्यों महत्वपूर्ण है

लेखक समझाते हैं कि यह केवल कंप्यूटर को तेज़ चलाने के बारे में नहीं है। यह इसे उपयोगी बनाने के बारे में है।

  • कंप्रेशन के बिना, वर्तमान मॉडल के लिए 90 मिनट की फिल्म को वास्तविक समय (रियल-टाइम) में प्रोसेस करना असंभव है।
  • कंप्रेशन के साथ, मॉडल फिल्म को "देख" सकता है, कथानक को समझ सकता है, और उस पर सवाल पूछ सकता है, और वह भी मेमोरी के एक छोटे से हिस्से का उपयोग करते हुए।

चुनौती (Catch)

यह पेपर चेतावनी भी देता है कि यह जादू नहीं है। यदि आप सूटकेस को बहुत कसकर पैक करते हैं:

  • आप विवरण खो सकते हैं: यदि आप फोटो को बहुत अधिक कंप्रेस करते हैं, तो आप बैकग्राउंड में एक छोटा लेकिन महत्वपूर्ण साइन मिस कर सकते हैं।
  • यह प्रवाह को तोड़ देता है: वीडियो में, यदि आप बहुत अधिक फ्रेम को मिला देते हैं, तो हलचल झटकेदार या भ्रमित करने वाली लग सकती है।
  • फिट होना कठिन है: इनमें से कुछ "पैकिंग" के तरीके आज उपलब्ध सबसे तेज़ कंप्यूटर चिप्स के साथ उपयोग करना कठिन है क्योंकि उनके लिए कंप्यूटर को अलग तरह से गणना करने के लिए रुकने की आवश्यकता होती है।

सारांश में:
यह शोध पत्र शोधकर्ताओं के लिए एक मानचित्र है। यह कहता है, "हमारे पास एक समस्या है: हमारा AI बहुत अधिक डेटा में डूब रहा है। यहाँ वे सभी अलग-अलग तरीके दिए गए हैं जिनसे हम इसे अपने डेटा को फ़िल्टर, ग्रुप और श्रिंक करना सिखाने की कोशिश कर रहे हैं ताकि यह वास्तव में वास्तविक दुनिया में कार्य कर सके।" यह इन तरीकों को इस आधार पर व्यवस्थित करता है कि वे चित्रों, वीडियो या ध्वनि को देख रहे हैं, और उस काम को करने के लिए वे विशिष्ट गणितीय ट्रिक्स का उपयोग करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →