OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance
OmniDrop एक ट्रेनिंग-फ्री, लेयर-वाइज टोकन प्रूनिंग फ्रेमवर्क है जो ओम्नी-मोडल LLMs के लिए है, जो टेक्स्ट क्वेरीज़ और एक टेम्पोरल डाइवर्सिटी स्कोर का उपयोग करके डिकोडर लेयर्स के भीतर अनावश्यक ऑडियोविजुअल टोकन को प्रगतिशील रूप से हटाता है, जिससे प्रदर्शन में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करते हुए लेटेंसी और मेमोरी उपयोग में महत्वपूर्ण कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक ("Omni-LLM") है जो एक ही समय में वीडियो देख सकता है और ऑडियो सुन सकता है। आप उससे एक सवाल पूछते हैं, जैसे "बैकग्राउंड में कौन गा रहा है?" या "कार का रंग क्या है?"
समस्या यह है कि उच्च-गुणवत्ता वाला वीडियो और ऑडियो डेटा का एक विशाल सैलाब की तरह होते हैं। वीडियो के केवल एक मिनट के लिए, रोबोट को 10,000 से अधिक छोटे टुकड़ों (जिन्हें "टोकन" कहा जाता है) को प्रोसेस करना पड़ता है। उन सभी के बारे में एक साथ सोचने की कोशिश करना एक फायरहोस (तेज धार वाले पाइप) से पानी पीने जैसा है—यह धीमा है, बहुत अधिक ऊर्जा खर्च करता है, और रोबोट को सुस्त बना देता है।
इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर रोबोट के सोचने शुरू करने से पहले ही वीडियो और ऑडियो के "बोरिंग" हिस्सों को फेंक देने की कोशिश करते हैं। वे यह मान लेते हैं कि यदि कोई ध्वनि और चित्र एक ही समय में होते हैं, तो वे आपस में संबंधित होने चाहिए।
पेपर का बड़ा विचार: "OmniDrop"
इस पेपर के लेखक कहते हैं, "रुकिए, यह धारणा गलत है।" सिर्फ इसलिए कि एक ध्वनि और एक चित्र एक साथ होते हैं, इसका मतलब यह नहीं है कि वे आपके विशिष्ट प्रश्न के लिए महत्वपूर्ण हैं।
चीजों को तुरंत फेंकने के बजाय, उन्होंने एक नया सिस्टम बनाया जिसे OmniDrop कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:
1. "धीमी शुरुआत" की रणनीति (लेयर-वाइज प्रूनिंग)
कल्पना कीजिए कि रोबोट का दिमाग एक बहु-मंजिला इमारत है।
- पुराना तरीका: आप सामने के दरवाजे (इनपुट) पर खड़े होते हैं और तुरंत 50% लोगों (डेटा) को बाहर निकाल देते हैं क्योंकि वे एक-दूसरे के समान दिखते हैं। यह जोखिम भरा है क्योंकि आप उस व्यक्ति को भी बाहर निकाल सकते हैं जिसके पास वास्तव में उत्तर है।
- OmniDrop तरीका: आप सभी को इमारत में आने देते हैं। शुरुआती मंजिलों (शुरुआती लेयर्स) पर, सभी आपस में मिलते हैं और बातें करते हैं। यह ऑडियो और वीडियो को एक साथ मिलकर दृश्य को समझने की अनुमति देता है।
- ट्विस्ट: जैसे-जैसे समूह ऊपर की मंजिलों (गहरी लेयर्स) की ओर बढ़ता है, रोबोट को एहसास होने लगता है, "ओह, मुझे प्रश्न का उत्तर देने के लिए केवल इन विशिष्ट लोगों से बात करने की आवश्यकता है।" इसके बाद यह धीरे-धीरे, फिर आक्रामक रूप से, महत्वहीन लोगों को जाने के लिए कहना शुरू कर देता है। यह सुनिश्चित करता है कि रोबोट यह जानने से पहले कि वह क्या खोज रहा है, "बड़ी तस्वीर" को न खो दे।
2. "सवाल एक टॉर्च की तरह" (क्वेरी-गाइडेड)
रोबोट को कैसे पता चलता है कि किसे रखना है?
- पुराना तरीका: यह ऑडियो और वीडियो को देखता है और अनुमान लगाने की कोशिश करता है कि उनमें से कौन से एक-दूसरे से मेल खाते हैं।
- OmniDrop तरीका: यह आपके टेक्स्ट प्रश्न के आधार पर एक टॉर्च की रोशनी डालता है।
- यदि आप पूछते हैं, "वह आवाज क्या है?", तो टॉर्च ऑडियो टोकन को हाइलाइट करती है और वीडियो टोकन को धुंधला कर देती है।
- यदि आप पूछते हैं, "शर्ट का रंग क्या है?", तो टॉर्च वीडियो टोकन को हाइलाइट करती है।
- रोबोट उन टोकन को रखता है जिन पर "टॉर्च" की रोशनी पड़ती है और उन्हें हटा देता है जो अंधेरे में हैं। यह छंटनी (प्रूनिंग) को स्मार्ट और कार्य के प्रति विशिष्ट बनाता है।
3. "बीच का हिस्सा न छोड़ें" का नियम (टेम्पोरल डायवर्सिटी)
एक खतरा है: यदि रोबोट केवल उन्हीं टोकन को रखता है जिन्हें टॉर्च हिट करती है, तो वह बाकी सब कुछ भूल सकता है, जिससे कहानी में एक "गैप" पैदा हो सकता है।
- समाधान: OmniDrop एक नियम जोड़ता है जिसे टेम्पोरल डायवर्सिटी कहा जाता है। भले ही कोई विशिष्ट क्षण सबसे महत्वपूर्ण न हो, लेकिन यदि वह मुख्य घटना से समय में दूर है, तो रोबोट उसे बने रहने के लिए थोड़ा "बोनस स्कोर" देता है।
- उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं। यदि आप केवल उन वाक्यों को रखते हैं जहाँ नायक बोलता है, तो आप परिवेश (सेटिंग) को मिस कर देंगे। OmniDrop कहता है, "नायक के संवादों को रखें, लेकिन बीच के शांत हिस्सों से भी कुछ वाक्य रखें ताकि कहानी टूटी हुई महसूस न हो।"
परिणाम
लेखकों ने Qwen2.5-Omni (एक लोकप्रिय मॉडल) का विभिन्न वीडियो और ऑडियो परीक्षणों पर परीक्षण किया।
- गति: इसने रोबोट को 40% तेज़ सोचने में सक्षम बनाया (इंतज़ार का समय कम हुआ)।
- मेमोरी: इसने 14.7% कम मेमोरी का उपयोग किया।
- स्मार्टनेस: आश्चर्यजनक रूप से, यह जानने के बारे में कि क्या फेंकना है, बेहतर होने के कारण, रोबोट वास्तव में अन्य तरीकों की तुलना में सवालों के जवाब देने में बेहतर (परीक्षणों पर 3.58 अंक अधिक) हो गया जो केवल डेटा के रैंडम टुकड़ों को फेंक देते थे।
संक्षेप में:
OmniDrop एक फिल्म के स्मार्ट संपादक की तरह है। फिल्म को देखने से पहले ही उसे आधा काटने के बजाय, यह आपको पूरी फिल्म देखने देता है, यह पता लगाता है कि आपके विशिष्ट प्रश्न के लिए कौन से दृश्य वास्तव में मायने रखते हैं, और फिर यह बाकी हिस्सों को देखते समय ही काट देता है, जिससे यह सुनिश्चित होता है कि आपको बिना कहानी खोए जल्दी उत्तर मिले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।