SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models
SepPrune एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले फ्रेमवर्क है जो विज़न टोकन के 80.2% को हटाने के लिए यूनिफाइड क्वेरीज़ के रूप में मोडैलिटी सेपरेटर टोकन का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कम्प्यूटेशनल लागत को कुशलतापूर्वक कम करता है, जबकि मूल सटीकता के 96.3% को बनाए रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक ही समय में देखना और बोलना सिखाने की कोशिश कर रहे हैं। यह मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की दुनिया है, जो AI के सितारे हैं जो सूर्यास्त की एक तस्वीर देखकर उस पर कविता लिख सकते हैं, या एक जटिल चार्ट का विश्लेषण करके उसके बारे में सवालों के जवाब दे सकते हैं। ऐसा करने के लिए, रोबोट केवल चित्र को "देखता" नहीं है; वह चित्र को हजारों छोटे डिजिटल पहेली के टुकड़ों में तोड़ देता है जिन्हें "विज़न टोकन" कहा जाता है। इन टोकनों को व्यक्तिगत पिक्सेल की तरह समझें, लेकिन वे बहुत अधिक स्मार्ट हैं—वे छवि के सभी विवरणों को अपने पास रखते हैं।
हालाँकि, इसमें एक समस्या है। जब आप रोबोट को एक हाई-डेफिनिशन फोटो या एक लंबा वीडियो देते हैं, तो यह इतने सारे टोकन उत्पन्न करता है कि रोबोट अभिभूत हो जाता है। यह एक साथ किताबों के पुस्तकालय को पढ़ने की कोशिश करने जैसा है; यह प्रक्रिया धीमी, महंगी और अक्षम हो जाती है। वैज्ञानिक इसे ठीक करने के लिए यह figuring लगाने की कोशिश कर रहे हैं कि कौन से पहेली के टुकड़े वास्तव में महत्वपूर्ण हैं और कौन से केवल कचरा (clutter) हैं। कुछ तरीके यह अनुमान लगाने की कोशिश करते हैं कि शब्दों पर रोबोट कितना ध्यान देता है, जबकि अन्य डुप्लिकेट टुकड़ों को खोजने की कोशिश करते हैं। लेकिन ये दृष्टिकोण अक्सर अपनी ही जटिलता में फंस जाते हैं, जिससे रोबोट को तेज करने के प्रयास में वह और भी धीमा हो जाता है। बड़ा सवाल अभी भी बना हुआ है: हम तस्वीर को खोए बिना इस कचरे को कैसे कम करें?
यहाँ आता है SepPrune, एक नया तरीका जो इन AI मॉडल्स के लिए एक चतुर संपादक (editor) की तरह काम करता है। इस कार्य के पीछे के शोधकर्ताओं ने इन मॉडल्स के सोचने के तरीके को देखते हुए कुछ बहुत ही दिलचस्प देखा। उन्होंने पाया कि प्रोसेसिंग के शुरुआती चरणों में, मॉडल विशेष "सेपरेटर" (separator) टोकनों पर बहुत अधिक ध्यान देता है—ये वे छोटे मार्कर हैं जो इमेज डेटा और टेक्स्ट डेटा के बीच स्थित होते हैं, जो इन दोनों दुनियाओं के बीच एक पुल की तरह काम करते हैं। वास्तव में, ये सेपरेटर ही छवि को समझने की कुंजी हैं।
हर एक विज़न टोकन की महत्ता की गणना करने के बजाय (जो कि धीमा और अव्यवस्थित है), SepPrune सेपरेटर टोकन का एक 'मास्टर क्वेरी' के रूप में उपयोग करता है। कल्पना कीजिए कि सेपरेटर एक संग्रहालय के प्रवेश द्वार पर खड़ा एक टूर गाइड है। हर एक पेंटिंग से, "क्या तुम महत्वपूर्ण हो?" पूछने के बजाय, टूर गाइड पूरे कमरे को देखता है और इशारा करता है, "तुम, तुम और तुम उत्कृष्ट कृतियाँ हो; बाकी इंतज़ार कर सकते हैं।" सेपरेटर का उपयोग करके विज़न टोकनों को तेजी से स्कोर करने के माध्यम से, SepPrune तुरंत छवि के सबसे सूचनात्मक टुकड़ों की पहचान कर सकता है और बाकी को हटा सकता है।
इसके परिणाम प्रभावशाली हैं। Qwen2.5-VL-7B जैसे शक्तिशाली मॉडल्स पर परीक्षण करने पर, SepPrune 80% से अधिक विज़न टोकन को हटाने में सफल रहा, जबकि इसने मॉडल की मूल सटीकता का 96.3% बनाए रखा। यहाँ तक कि जब प्रूनिंग (छंटनी) को अत्यधिक 90.2% की कमी तक धकेला गया, तब भी मॉडल ने अपना 87.2% प्रदर्शन बनाए रखा। यह अन्य तरीकों की तुलना में एक महत्वपूर्ण छलांग है, जो अक्सर इतनी गहरी कटौती करने पर उच्च सटीकता बनाए रखने में संघर्ष करते हैं। इसके अलावा, क्योंकि इस तरीके में प्रत्येक टोकन के बीच जटिल गणनाओं की आवश्यकता नहीं होती है, इसलिए यह बहुत तेज़ है और मौजूदा स्पीड-अप तकनीकों के साथ सहजता से काम करता है।
शोधकर्ताओं ने यह भी सिद्ध किया कि उनके विशिष्ट चुनाव मायने रखते हैं। उन्होंने दिखाया कि सेपरेटर टोकन को "गाइड" के रूप में उपयोग करना, टेक्स्ट के अन्य हिस्सों का उपयोग करने की तुलना में बेहतर काम करता है, और चयन प्रक्रिया के दौरान टोकनों की "पोजीशन" (वे छवि में कहाँ स्थित हैं) को अनदेखा करना मॉडल को गलती से केवल तस्वीर के निचले हिस्से को रखने से रोकता है। संक्षेप में, SepPrune सुझाव देता है कि इमेज और टेक्स्ट के बीच के पुल को सुनकर, हम इन AI विजनरीज़ को उन विवरणों के प्रति अंधा किए बिना जो वास्तव में मायने रखते हैं, उन्हें तेज़ और अधिक कुशल बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।