← नवीनतम पेपर
🤖 AI

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models

MorphoQuant एक मोडैलिटी-अवेयर पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो डिस्ट्रीब्यूशन-अवेयर बायस कॉम्पन्सेशन और मॉर्फोलॉजी-डायरेक्टेड क्वांटाइजेशन फंक्शन ऑप्टिमाइजेशन को पेश करके 4-बिट ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स की चुनौतियों का समाधान करता है ताकि क्रॉस-मोडल मॉर्फोलॉजी को संरक्षित किया जा सके और आउटलायर लॉस को कम किया जा सके, जिससे प्रमुख बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है जो 16-बिट बेसलाइन्स से भी बेहतर है।

मूल लेखक: Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MorphoQuant" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "एक ही आकार सबके लिए" वाला सूट फिट नहीं बैठता

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान रोबोट है (Omni-modal Large Language Model) जो एक साथ देख, सुन, पढ़ और वीडियो देख सकता है। इस रोबोट को एक साधारण लैपटॉप या फोन पर चलाने के लिए, आपको इसे छोटा करने की आवश्यकता होगी। इस प्रक्रिया को Quantization कहा जाता है।

क्वांटाइजेशन को एक विशाल, अव्यवस्थित सूटकेस को एक छोटे, कठोर डिब्बे में पैक करने की तरह समझें।

  • "Inliers" (सामान्य वस्तुएं): आपके अधिकांश कपड़े सामान्य आकार की शर्ट और पैंट हैं। वे आसानी से डिब्बे में फिट हो जाते हैं।
  • "Outliers" (असामान्य वस्तुएं): लेकिन आपके पास कुछ अजीब आकार की चीजें भी हैं—एक विशाल बीच बॉल (beach ball), एक लंबा सर्फ़बोर्ड, या लकड़ी का एक टेढ़ा-मेढ़ा टुकड़ा।

पुराना तरीका: पारंपरिक तरीके हर चीज़ को एक ही कठोर डिब्बे में डालने की कोशिश करते हैं। उस विशाल बीच बॉल को फिट करने के लिए, उन्हें पूरे डिब्बे को बहुत बड़ा बनाना पड़ता है। लेकिन अगर डिब्बा बहुत बड़ा है, तो सामान्य शर्ट दब जाएंगी और उनमें सिलवटें पड़ जाएंगी (सटीकता खो जाएगी)। यदि वे जगह बचाने के लिए डिब्बे को छोटा बनाते हैं, तो बीच बॉल कट जाएगी (महत्वपूर्ण जानकारी खो जाएगी)। जटिल चीजों जैसे वीडियो और ऑडियो को एक साथ समझने वाले रोबोटों के लिए यह एक आपदा है।

समाधान: MorphoQuant

लेखकों ने MorphoQuant नामक एक नया सिस्टम बनाया है। सब कुछ एक कठोर डिब्बे में जबरदस्ती भरने के बजाय, उन्होंने महसूस किया कि "अजीब आकारों" (outliers) और "सामान्य आकारों" (inliers) के साथ अलग-अलग व्यवहार करने की आवश्यकता है, लेकिन बिना रोबोट की गति धीमी किए।

उन्होंने दो मुख्य तरकीबें इस्तेमाल कीं:

1. "मैजिक बायस" ट्रिक (Distribution-Aware Bias Compensation)

कल्पना कीजिए कि आप फिर से वही सूटकेस पैक कर रहे हैं। उस विशाल बीच बॉल को मुख्य हिस्से में कुचलने के बजाय, आप उसे बाहर निकालते हैं, उसे एक विशेष, हल्के फोम (Bias) में लपेटते हैं, और सूटकेस के बाहरी हिस्से पर टेप से चिपका देते हैं।

  • यह कैसे काम करता है: सिस्टम उन "अजीब" डेटा पॉइंट्स (outliers) की पहचान करता है जो 4-बिट बॉक्स के लिए बहुत बड़े हैं। उन्हें कुचलने के बजाय, यह गणना करता है कि वे वास्तव में कितने बाहर निकल रहे हैं और उस मात्रा को एक "करेक्शन टैग" (bias) के रूप में जोड़ देता है जो डेटा से जुड़ा होता है।
  • लाभ: मुख्य सूटकेस पूरी तरह से व्यवस्थित और छोटा रहता है (शुद्ध 4-बिट), जिससे रोबोट इसके माध्यम से बहुत तेज़ी से आगे बढ़ सकता है। "अजीब" चीजें अभी भी वहीं हैं, बस उन्हें अलग से संभाला गया है। यह एक धीमे, मिश्रित-आकार के सूटकेस (mixed-precision) की आवश्यकता को समाप्त करता है जो रोबोट के इंजन को भ्रमित कर सकता है।

2. "शेप-शिफ्टिंग" ग्रिड (Morphology-Directed Optimization)

एक बार जब बीच बॉल्स को बाहर निकाल दिया जाता है, तो सूटकेस में बचे हुए सामान सामान्य आकार की शर्ट हैं। वे करीने से व्यवस्थित और सममित (symmetrical) हैं।

  • यह कैसे काम करता है: लेखकों ने महसूस किया कि क्योंकि "अजीब" चीजें अब वहां नहीं हैं, इसलिए शेष डेटा का एक बहुत ही विशिष्ट, साफ आकार (जैसे एक परफेक्ट बेल कर्व) है। उन्होंने एक कस्टम ग्रिड (एक क्वांटाइजेशन फंक्शन) डिजाइन किया जो इस विशिष्ट आकार में पूरी तरह फिट बैठता है, न कि किसी जेनेरिक ग्रिड की तरह।
  • लाभ: यह एक सामान्य जूतों के डिब्बे के बजाय कस्टम-मोल्डेड जूतों के डिब्बे में स्विच करने जैसा है। शर्ट इतनी अच्छी तरह फिट होती हैं कि आप बिना सिलवटों के वास्तव में अधिक कपड़े पैक कर सकते हैं। यह सुनिश्चित करता है कि रोबट वीडियो या वाक्य को समझने के लिए आवश्यक सूक्ष्म विवरणों को न खोए।

परिणाम: छोटा, तेज़ और आश्चर्यजनक रूप से स्मार्ट

टीम ने इसका परीक्षण Qwen2.5-Omni पर किया, जो टेक्स्ट, इमेज, वीडियो और ऑडियो को संभाल सकता है।

  • सेटअप: उन्होंने मॉडल को 4-bit (अत्यंत छोटा) तक सिकोड़ने की कोशिश की, जो वेट्स (weights - मस्तिष्क का ज्ञान) और एक्टिवेशन्स (activations - रोबोट के वर्तमान विचार) दोनों के लिए था।
  • आश्चर्य: आमतौर पर, जब आप मॉडल को इतना छोटा करते हैं, तो वह "मूर्ख" हो जाता है। हालाँकि, MorphoQuant "अजीब आकारों" को संभालने में इतना अच्छा था कि 4-बिट मॉडल ने विशिष्ट परीक्षणों (जैसे ScienceQA और MMMU) में 16-बिट के बड़े मॉडलों से भी बेहतर प्रदर्शन किया।
  • उपमा: यह एक भारी, भारी-भरकम विंटर कोट लेने, उसकी अतिरिक्त भरावन (fluff) को हटाने और उसे इतनी अच्छी तरह से टेलर करने जैसा है कि वह मूल कोट जितना ही गर्म रखता है, लेकिन आप बिना पसीना आए इसमें मैराथन दौड़ सकते हैं।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि डेटा के विशिष्ट "आकार" (morphology) को समझने और "आउटलेयर्स" को एक विशेष, हल्के सुधार के साथ संभालने से, उन्होंने एक बड़ी बाधा को हल कर दिया है। वे इन विशाल, बहु-संवेदी AI मॉडलों को उनकी तर्क करने की क्षमता खोए बिना, मानक हार्डवेयर पर चलाने में सफल रहे, और वह भी मेमोरी के बहुत छोटे हिस्से का उपयोग करके।

संक्षेप में: उन्होंने चौकोर टुकड़े को गोल छेद में जबरदस्ती डालने की कोशिश करना बंद कर दिया। इसके बजाय, उन्होंने एक कस्टम एडॉप्टर बनाया जो चौकोर टुकड़े को छेद को तोड़े बिना पूरी तरह से फिट होने देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →