DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
DUET-VLM एक बहुमुखी, द्वि-चरणीय ढांचा है जो विजन-लैंग्वेज मॉडल्स में बेसलाइन सटीकता को बनाए रखते हुए या उससे भी बेहतर प्रदर्शन करते हुए, आक्रामक विजुअल टोकन रिडक्शन (इमेज के लिए 89% और वीडियो के लिए 93.4% तक) प्राप्त करने के लिए विजन-ओनली रेडंडेंसी-अवेयर कंप्रेशन को सैलिएंट टेक्स्ट-गाइडेड टोकन ड्रॉपिंग के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान सहायक (एक विजन-लैंग्वेज मॉडल) है जो चित्रों और वीडियो के बारे में सवालों के जवाब देने में माहिर है। लेकिन एक समस्या है: यह सहायक अविश्वसनीय रूप से भूखा है।
हर बार जब आप इसे एक तस्वीर दिखाते हैं, तो यह हर एक पिक्सेल को भोजन के अलग-अलग निवाले के रूप में खाने की कोशिश करता है। एक हाई-रेज़ोल्यूशन फोटो में हजारों ऐसे "निवाले" (टोकन) हो सकते हैं। यदि आप इसे वीडियो दिखाते हैं, तो इसकी भूख अदम्य हो जाती है। यह सहायक को धीमा, चलाने में महंगा और आपके फोन या लैपटॉप में फिट करना कठिन बना देता है।
यह पेपर DUET-VLM पेश करता है, जो इस सहायक को खिलाने का एक नया तरीका है ताकि वह भरा हुआ और बुद्धिमान भी रहे, लेकिन बहुत कम भोजन खाए। इसे एक दो-चरणीय "स्मार्ट डाइट" के रूप में समझें।
समस्या: पिक्सेल का "बुफे" (Buffet)
वर्तमान में, जब एक AI किसी फोटो को देखता है, तो वह 576 (या यहाँ तक कि 2,800+) छोटे खाद्य पदार्थों के एक विशाल बुफे को देखता है। यह हर एक को चबाने की कोशिश करता है, भले ही वे उबाऊ बैकग्राउंड पिक्सेल हों जिनका कोई महत्व नहीं है। इससे ऊर्जा और समय दोनों बर्बाद होते हैं।
इसे ठीक करने के पिछले प्रयास एक अनाड़ी वेटर की तरह थे:
- विधि A: "चलो सारा भोजन एक साथ मिलाकर एक बड़ा स्मूदी बना देते हैं।" (बहुत जल्दी मिला देना)। परिणाम: आप विशिष्ट विवरणों का स्वाद खो देते हैं।
- विधि B: "चलो प्लेट का आधा हिस्सा बेतरतीब ढंग से फेंक देते हैं।" (टोकन को समान रूप रूप से हटा देना)। परिणाम: आप गलती से भोजन का सबसे महत्वपूर्ण हिस्सा फेंक सकते हैं।
समाधान: "DUET" डाइट
लेखक एक दो-चरणीय (Dual-Stage) दृष्टिकोण प्रस्तावित करते हैं, जो एक दो-चरणीय फिल्टर सिस्टम की तरह है।
चरण 1: "स्मार्ट सॉर्टर" (विज़न एनकोडर)
मुख्य मस्तिष्क तक भोजन पहुँचने से पहले, यह एक स्मार्ट सॉर्टर से गुजरता है।
- उपमा: कल्पना कीजिए कि आपके पास 500 लेगो (Lego) ईंटों का ढेर है। कुछ ईंटें एक महल की मुख्य संरचना ( "डोमिनेंट" टोकन) हैं, और कुछ फर्श पर बिखरी हुई साधारण, एक जैसी लाल ईंटें ( "रिडंडेंट" टोकन) हैं।
- DUET क्या करता है: उन सभी 500 ईंटों को रखने के बजाय, यह उन 50 सबसे महत्वपूर्ण ईंटों को चुनता है जो महल को थामे रखती हैं। फिर, यह शेष 450 ईंटों को 10 छोटे, व्यवस्थित बंडलों (क्लस्टर्स) में जोड़ देता है।
- परिणाम: 500 व्यक्तिगत ईंटों के बजाय, अब आपके पास 60 आइटम (50 मुख्य ईंटें + 10 बंडल) हैं। आपने महल का आकार नहीं खोया है, लेकिन आपने अव्यवस्था को 88% तक कम कर दिया है।
चरण 2: "कॉन्टेक्स्टुअल शेफ" (लैंग्वेज बैकबोन)
अब, कम किया गया भोजन मुख्य मस्तिष्क के पास जाता है, जो एक प्रश्न पढ़ रहा है जैसे, "खिलाड़ी की जर्सी पर क्या नंबर है?"
- उपमा: मस्तिष्क एक शेफ की तरह है जो रेसिपी पढ़ रहा है। वह जानता है कि यह जानने के लिए कि सूप नमकीन है या नहीं, उसे पूरा सूप चखने की आवश्यकता नहीं है; उसे बस नमक के डिब्बे के पास वाले चम्मच की आवश्यकता है।
- DUet क्या करता है: जैसे ही AI प्रश्न पढ़ता है, वह चरण 1 के 60 आइटमों को देखता है। वह पूछता है, "इनमें से कौन से आइटम मुझे प्रश्न का उत्तर देने में मदद करते हैं?"
- यदि प्रश्न जर्सी नंबर के बारे में है, तो AI कहता है, "बैकग्राउंड के पेड़ों और आसमान को अनदेखा करें। खिलाड़ी और जर्सी पर ध्यान दें।"
- जैसे-जैसे यह तर्क प्रक्रिया में गहराई तक जाता है, यह अप्रासंगिक बंडलों और ईंटों को धीरे-धीरे हटाता जाता है।
- परिणाम: जब तक AI उत्तर देता है, वह शायद केवल 10 या 20 आइटमों को देख रहा होता है, लेकिन उसने पहेली को सुलझाने के लिए आवश्यक सटीक आइटमों को बनाए रखा है।
यह एक बड़ी बात क्यों है?
इस पेपर ने प्रसिद्ध AI मॉडल्स (जैसे LLaVA और Video-LLaVA) पर इसका परीक्षण किया और अद्भुत परिणाम पाए:
- यह अत्यंत कुशल है: उन्होंने डेटा की मात्रा को 67% से 89% तक कम कर दिया। यह आपके किराने के बिल को 80% तक कम करने जैसा है बिना भूखे रहे।
- यह अभी भी अत्यंत बुद्धिमान है: इतने कम डेटा के बावजूद, AI ने अपनी सटीकता का 99% बनाए रखा। कुछ मामलों में, क्योंकि यह "जंक फूड" (अनावश्यक पिक्सेल) से विचलित नहीं था, इसने पहले की तुलना में बेहतर प्रदर्शन किया।
- यह वीडियो पर भी काम करता है: वीडियो डेटा के बड़े राक्षस होते हैं। DUET-VLM ने वीडियो डेटा को 90% से अधिक कम किया और फिर भी कहानी को पूरी तरह से समझा।
निष्कर्ष
DUET-VLM ऐसा है जैसे आपने अपने AI को स्मार्ट चश्मा पहना दिया हो। पूरी दुनिया को फैली हुई, बिना ध्यान केंद्रित आँखों से देखने के बजाय, यह महत्वपूर्ण विवरणों पर ज़ूम करने और शोर (noise) को अनदेखा करने के बारे में सीख जाता है।
- पुराना तरीका: "मैं सब कुछ देखता हूँ, इसलिए मुझे सब कुछ सोचना चाहिए।" (धीमा, महंगा)।
- DUET तरीका: "मैं महत्वपूर्ण चीजों को देखता हूँ, इसलिए मैं केवल उसी के बारे में सोचता हूँ।" (तेज़, सस्ता और उतना ही बुद्धिमान)।
इसका अर्थ है कि हम शक्तिशाली AI मॉडल्स को उनकी बुद्धिमत्ता से समझौता किए बिना, छोटे उपकरणों पर, तेज़ी से और सस्ते में चला सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।