← नवीनतम पेपर
🤖 machine learning

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

यह शोधपत्र DualSpeed का प्रस्ताव करता है, जो एक फास्ट-स्लो प्रशिक्षण ढांचा है जो दक्षता के लिए विजुअल टोकन प्रूनिंग को एक फुल-सीक्वेंस ऑक्सिलरी मोड और सेल्फ-डिस्टिलेशन के साथ जोड़ता है ताकि प्रशिक्षण-अनुमान (training-inference) के बेमेल होने की समस्याओं को हल किया जा सके, जिससे प्रदर्शन से समझौता किए बिना MLLM प्रशिक्षण को 4.0×\times तक त्वरित किया जा सकता है।

मूल लेखक: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

प्रकाशित 2026-02-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) को हजारों तस्वीरें दिखाकर दुनिया को समझना सिखाने की कोशिश कर रहे हैं।

समस्या: "बहुत अधिक जानकारी" का अवरोध (The "Too Much Information" Bottleneck)
अभी, ये मॉडल ऐसे छात्रों की तरह हैं जो अभिभूत (overwhelmed) हो जाते हैं। जब आप उन्हें एक तस्वीर दिखाते हैं, तो कंप्यूटर उसे सैकड़ों या हजारों छोटे टुकड़ों में तोड़ देता है जिन्हें "विजुअल टोकन" कहा जाता है। यह ऐसा है जैसे आपने छात्र को हर एक तस्वीर के लिए 1,000 पन्नों की एक किताब थमा दी हो, भले ही उन पन्नों में से अधिकांश केवल खाली सफेद जगह या दोहराव वाले पैटर्न हों।

उन सभी पन्नों को पढ़ने में बहुत समय लगता है। यह इन मॉडलों को प्रशिक्षित करना अविश्वसनीय रूप से धीमा, महंगा और ऊर्जा-खपत वाला बना देता है।

पुराना विचार: "कट-एंड-पेस्ट" की गलती (The "Cut-and-Paste" Mistake)
शोधकर्ताओं ने महसूस किया कि उन पन्नों में से कई बेकार और अनावश्यक हैं। उन्होंने विजुअल टोकन प्रूनिंग (Visual Token Pruning) नामक एक तकनीक का उपयोग करने की कोशिश की, जो हाइलाइटर का उपयोग करके छात्र को दिखाने से पहले उबाऊ, अनावश्यक पन्नों को काटने जैसा है। यह बाद में छात्र का परीक्षण (inference) करते समय बहुत अच्छा काम करता है, जिससे वे तेज़ हो जाते हैं।

लेकिन जब उन्होंने इस पद्धति का उपयोग प्रशिक्षण (training) के दौरान करने की कोशिश की, तो यह उल्टा पड़ गया। इसने एक "विसंगति" (mismatch) पैदा कर दी।

  • उपमा: कल्पना कीजिए कि आपने छात्र को केवल एक किताब का 10-पन्नों का सारांश पढ़ाया। फिर, अंतिम परीक्षा में, आपने उन्हें पूरी 1,000 पन्नों की किताब थमा दी। छात्र घबरा जाएगा और असफल हो जाएगा क्योंकि उसने कभी भी पूर्ण संस्करण को संभालने के लिए नहीं सीखा था। वह छोटे संस्करण का बहुत आदी हो गया था।

समाधान: DualSpeed (द "फास्ट-स्लो" ट्रेनिंग कैंप)
इस शोध पत्र के लेखकों ने, डिंगकुन झांग और उनकी टीम ने, DualSpeed नामक एक नया प्रशिक्षण ढांचा बनाया है। इसे एक दो-ट्रैक वाले ट्रेनिंग कैंप के रूप में सोचें जो विसंगति की समस्या को हल करने के लिए बेतरतीब ढंग से आगे-पीछे स्विच करता है।

  1. फास्ट लेन (तेज़ अभ्यास - The Speedy Practice):

    • अधिकांश समय (लगभग 90% सत्रों में), मॉडल "फास्ट मोड" में प्रशिक्षित होता है।
    • यहाँ, वे बेकार विजुअल टोकन को बाहर निकालने के लिए "प्रूनिंग" तकनीक का उपयोग करते हैं। मॉडल संक्षिप्त, कुशल सारांशों से तेजी से सीखता है।
    • मॉडल को यह याद रखने में मदद करने के लिए कि वह किस संस्करण को देख रहा है, वे छोटे सारांश की शुरुआत में एक छोटा, अदृश्य "नाम टैग" (Mode Isolator) जोड़ते हैं। यह मॉडल को बताता है, "हे, यह संक्षिप्त संस्करण है; मुख्य विवरणों पर ध्यान केंद्रित करें।"
  2. स्लो लेन (पूर्ण-पुस्तक समीक्षा - The Full-Book Review):

    • कभी-कभी (लगभग 10% समय), मॉडल "स्लो मोड" में बदल जाता है।
    • यहाँ, वे मॉडल को पूरी, बिना प्रून की गई तस्वीर (सभी 1,000 पन्ने) दिखाते हैं।
    • यह सुनिश्चित करने के लिए कि मॉडल इन दुर्लभ सत्रों के दौरान आलसी न हो जाए, वे सेल्फ-डिस्टिलेशन (Self-Distillation) नामक एक ट्रिक का उपयोग करते हैं। "फास्ट मोड" (जिसने पहले ही बहुत कुछ सीख लिया है), एक शिक्षक के रूप में कार्य करता है, जो "स्लो मोड" वाले छात्र के कान में उत्तर फुसफुसाता है। यह सुनिश्चित करता है कि छात्र पूर्ण संस्करण को प्रभावी ढंग से सीखे, भले ही वह इसे कम बार देखे।

परिणाम: दोनों दुनियाओं का सर्वश्रेष्ठ संगम (Best of Both Worlds)
इन दोनों मोड को मिलाकर, मॉडल के पास फास्ट लेन की गति होती है लेकिन इसमें स्लो लेन के पूर्ण, जटिल विश्व को संभालने की क्षमता भी बनी रहती है।

  • गति: उन्होंने पहले की तुलना में मॉडल को 2.1 गुना से 4.0 गुना तेजी से प्रशिक्षित किया।
  • प्रदर्शन: गति के बावजूद, मॉडल मूर्ख नहीं हुए। उन्होंने अपनी मूल प्रदर्शन क्षमता का 99% से अधिक बनाए रखा।
  • लचीलापन: अंतिम मॉडल इतना स्मार्ट है कि वह दोनों (संक्षिप्त सारांश और पूर्ण चित्र) को संभाल सकता है (यदि आप बाद में गति चाहते हैं या अधिकतम सटीकता चाहते हैं)।

सारांश में
यह शोध पत्र दावा करता है कि एक "फास्ट-स्लो" स्विचिंग सिस्टम का उपयोग करके, वे इन विशाल AI मॉडलों को बहुत तेजी से सिखा सकते हैं बिना उन्हें पूरी किताबें पढ़ना भुलाए। उन्होंने पाया कि प्रशिक्षण के दौरान लगभग 90% विजुअल टोकन वास्तव में अनावश्यक होते हैं, और उन्हें स्मार्ट तरीके से काटकर (जबकि कभी-कभी पूर्ण संस्करण के साथ अभ्यास करते हुए), वे बुद्धिमत्ता खोए बिना भारी मात्रा में समय और पैसा बचा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →