← नवीनतम पेपर
💻 computer science

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

यह शोधपत्र MASQuant प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक नवीन पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है, जो मोडैलिटी-अवेयर स्मूथिंग और क्रॉस-मोडल कंपनसेशन के माध्यम से स्मूथिंग मिसअलाइनमेंट और क्रॉस-मोडल कम्प्यूटेशनल इनवेरिएंस की चुनौतियों पर विजय प्राप्त करता है, और ड्यूल- एवं ट्राइ-मोडल आर्किटेक्चर में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

प्रकाशित 2026-03-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) है जो टेक्स्ट पढ़ सकता है, तस्वीरों को देख सकता है और ऑडियो सुन सकता है—और यह सब वह एक साथ कर सकता है। इस रोबोट को आपके फोन या सस्ते लैपटॉप पर चलाने के लिए पर्याप्त तेज़ बनाने के लिए, इंजीनियरों को इसके दिमाग को सिकोड़ने की ज़रूरत होती है। वे इसे क्वांटाइजेशन (Quantization) नामक प्रक्रिया के माध्यम से करते हैं, जो एक हाई-डेफिनिशन मूवी को छोटी फ़ाइल साइज़ में कंप्रेस करने जैसा है।

हालाँकि, इसमें एक बड़ी समस्या है। इस रोबोट के दिमाग में, सूचना के विभिन्न प्रकारों (टेक्स्ट, इमेज, ऑडियो) का "वॉल्यूम" बहुत अलग होता है।

  • टेक्स्ट एक फुसफुसाहट की तरह है।
  • इमेज एक चिल्लाहट की तरह है।
  • ऑडियो एक चीख की तरह है।

पुरानी समस्या: "एक ही नियम सबके लिए" वाली गलती

पिछली विधियों ने रोबोट के दिमाग को सिकोड़ने के लिए सभी के लिए एक ही नियम का उपयोग करने की कोशिश की। कल्पना कीजिए कि एक शिक्षक तीन छात्रों को पढ़ने में मदद करने की कोशिश कर रहा है: एक जीनियस है, एक औसत है, और एक संघर्ष कर रहा है। यदि शिक्षक उन सभी को बिल्चे एक ही होमवर्क की कठिनाई देता है, तो जीनियस ऊब जाएगा, औसत छात्र भ्रमित हो जाएगा, और संघर्ष कर रहे छात्र का बुरा हाल हो जाएगा।

रोबोट के दिमाग में, "चिल्लाने वाली" इमेज (जिनमें बहुत बड़ी संख्याएँ होती हैं) ने कंप्रेशन नियमों को उनके लिए सेट करने के लिए मजबूर किया। इसका मतलब था कि "फुसफुसाते" टेक्स्ट और ऑडियो को बहुत ज़्यादा कुचल दिया गया। उनकी महत्वपूर्ण बारीकियाँ खो गईं, और रोबोट गलतियाँ करने लगा, जैसे कि बिल्ली की तस्वीर को कुत्ता समझना, या एक साधारण वाक्य को समझने में विफल होना।

शोधकर्ता इसे "स्मूथिंग मिसअलाइनमेंट" (Smoothing Misalignment) कहते हैं। यह एक चौकोर पेग, एक गोल पेग और एक त्रिकोणीय पेग को एक ही छेद में फिट करने की कोशिश करने जैसा है।

नया समाधान: MASQuant

इस पेपर के लेखकों ने MASQuant के रूप में एक चतुर दो-चरणीय समाधान निकाला है, जिससे रोबोट अपनी बुद्धिमत्ता खोए बिना अपने दिमाग को छोटा रख सकता है।

चरण 1: व्यक्तिगत वॉल्यूम नॉब (मोडैलिटी-अवेयर स्मूथिंग)

सभी के लिए एक ही नियम का उपयोग करने के बजाय, MASQuant सूचना के प्रत्येक प्रकार को अपना स्वयं का "वॉल्यूम नॉब" देता है।

  • इमेज के लिए, यह नॉब को धीरे से नीचे करता है ताकि वे फिट भी हों और स्पष्ट भी रहें।
  • टेक्स्ट के लिए, यह नॉब को अलग तरह से घुमाता है ताकि फुसफुसाहट दबे नहीं।
  • ऑडियो के लिए, यह भी वही करता है।

अब, सूचना के हर प्रकार के साथ उसके अपने आकार के अनुसार निष्पक्ष व्यवहार किया जाता है। अब और अधिक कुचलना नहीं!

चरण 2: "मैजिक पैच" (क्रॉस-मोडल कंपनसेशन)

यहाँ पेचीदा हिस्सा है। यदि आप सभी को अलग-अलग वॉल्यूम नॉब देते हैं, तो आमतौर पर आपको प्रत्येक के लिए एक अलग "दिमाग" बचाने की आवश्यकता होगी। यह स्थान बचाने के उद्देश्य को ही विफल कर देता है!

MASQuant इस समस्या को क्रॉस-मोडल कंपनसेशन (Cross-Modal Compensation) नामक एक जादुई ट्रिक से हल करता है।

  1. यह एक एकल मस्तिष्क (टेक्स्ट के आधार पर, जो सबसे सामान्य इनपुट है) को सुरक्षित करता है।
  2. जब रोबोट को किसी तस्वीर को देखने या ऑडियो सुनने की आवश्यकता होती है, तो वह एक पूरा नया मस्तिष्क लोड नहीं करता है। इसके बजाय, वह पहले से मौजूद एकल मस्तिष्क पर एक छोटा, हल्का "मैजिक पैच" (एक छोटा गणितीय सुधार) लागू करता है।

इसे चश्मे पहनने की तरह समझें। आपके पास एक फ्रेम का जोड़ा (मुख्य मस्तिष्क) है। यदि आपको पढ़ने की आवश्यकता है, तो आप एक "रीडिंग लेंस" लगाते हैं। यदि आपको गाड़ी चलाने की आवश्यकता है, तो आप "ड्राइविंग लेंस" लगाते हैं। आपको तीन अलग-अलग चश्मों की आवश्यकता नहीं है; आपको बस एक फ्रेम और कुछ छोटे क्लिप्स की आवश्यकता है।

यह क्यों महत्वपूर्ण है

  • पहले: रोबोट के दिमाग को सिकोड़ने की कोशिश करने से वह सुनने या देखने की क्षमता खो देता था, विशेष रूप से जब डेटा बहुत कम (जैसे 4-बिट या 6-बिट कंप्रेशन) होता था।
  • बाद में: MASQuant के साथ, रोबोट तेज़ रहता है। यह जटिल चित्रों को समझ सकता है, ऑडियो सुन सकता है और टेक्स्ट पढ़ सकता है, भले ही उसका दिमाग बहुत छोटे आकार में सिकोड़ा गया हो।

संक्षेप में: MASQuant "ज़ोर से चिल्लाने वाली" इमेजेस को "शांत" टेक्स्ट और ऑडियो को डराने या दबाने से रोकता है। यह सबको समान अवसर देता है और एक चतुर "पैच" सिस्टम का उपयोग करता है ताकि रोबोट छोटा, तेज़ और अविश्वसनीय रूप से स्मार्ट बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →