← नवीनतम पेपर
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop एक ट्रेनिंग-फ्री, लेयर-वाइज टोकन प्रूनिंग फ्रेमवर्क है जो ओम्नी-मोडल LLMs के लिए है, जो टेक्स्ट क्वेरीज़ और एक टेम्पोरल डाइवर्सिटी स्कोर का उपयोग करके डिकोडर लेयर्स के भीतर अनावश्यक ऑडियोविजुअल टोकन को प्रगतिशील रूप से हटाता है, जिससे प्रदर्शन में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करते हुए लेटेंसी और मेमोरी उपयोग में महत्वपूर्ण कमी आती है।

मूल लेखक: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक ("Omni-LLM") है जो एक ही समय में वीडियो देख सकता है और ऑडियो सुन सकता है। आप उससे एक सवाल पूछते हैं, जैसे "बैकग्राउंड में कौन गा रहा है?" या "कार का रंग क्या है?"

समस्या यह है कि उच्च-गुणवत्ता वाला वीडियो और ऑडियो डेटा का एक विशाल सैलाब की तरह होते हैं। वीडियो के केवल एक मिनट के लिए, रोबोट को 10,000 से अधिक छोटे टुकड़ों (जिन्हें "टोकन" कहा जाता है) को प्रोसेस करना पड़ता है। उन सभी के बारे में एक साथ सोचने की कोशिश करना एक फायरहोस (तेज धार वाले पाइप) से पानी पीने जैसा है—यह धीमा है, बहुत अधिक ऊर्जा खर्च करता है, और रोबोट को सुस्त बना देता है।

इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर रोबोट के सोचने शुरू करने से पहले ही वीडियो और ऑडियो के "बोरिंग" हिस्सों को फेंक देने की कोशिश करते हैं। वे यह मान लेते हैं कि यदि कोई ध्वनि और चित्र एक ही समय में होते हैं, तो वे आपस में संबंधित होने चाहिए।

पेपर का बड़ा विचार: "OmniDrop"
इस पेपर के लेखक कहते हैं, "रुकिए, यह धारणा गलत है।" सिर्फ इसलिए कि एक ध्वनि और एक चित्र एक साथ होते हैं, इसका मतलब यह नहीं है कि वे आपके विशिष्ट प्रश्न के लिए महत्वपूर्ण हैं।

चीजों को तुरंत फेंकने के बजाय, उन्होंने एक नया सिस्टम बनाया जिसे OmniDrop कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. "धीमी शुरुआत" की रणनीति (लेयर-वाइज प्रूनिंग)

कल्पना कीजिए कि रोबोट का दिमाग एक बहु-मंजिला इमारत है।

  • पुराना तरीका: आप सामने के दरवाजे (इनपुट) पर खड़े होते हैं और तुरंत 50% लोगों (डेटा) को बाहर निकाल देते हैं क्योंकि वे एक-दूसरे के समान दिखते हैं। यह जोखिम भरा है क्योंकि आप उस व्यक्ति को भी बाहर निकाल सकते हैं जिसके पास वास्तव में उत्तर है।
  • OmniDrop तरीका: आप सभी को इमारत में आने देते हैं। शुरुआती मंजिलों (शुरुआती लेयर्स) पर, सभी आपस में मिलते हैं और बातें करते हैं। यह ऑडियो और वीडियो को एक साथ मिलकर दृश्य को समझने की अनुमति देता है।
  • ट्विस्ट: जैसे-जैसे समूह ऊपर की मंजिलों (गहरी लेयर्स) की ओर बढ़ता है, रोबोट को एहसास होने लगता है, "ओह, मुझे प्रश्न का उत्तर देने के लिए केवल इन विशिष्ट लोगों से बात करने की आवश्यकता है।" इसके बाद यह धीरे-धीरे, फिर आक्रामक रूप से, महत्वहीन लोगों को जाने के लिए कहना शुरू कर देता है। यह सुनिश्चित करता है कि रोबोट यह जानने से पहले कि वह क्या खोज रहा है, "बड़ी तस्वीर" को न खो दे।

2. "सवाल एक टॉर्च की तरह" (क्वेरी-गाइडेड)

रोबोट को कैसे पता चलता है कि किसे रखना है?

  • पुराना तरीका: यह ऑडियो और वीडियो को देखता है और अनुमान लगाने की कोशिश करता है कि उनमें से कौन से एक-दूसरे से मेल खाते हैं।
  • OmniDrop तरीका: यह आपके टेक्स्ट प्रश्न के आधार पर एक टॉर्च की रोशनी डालता है।
    • यदि आप पूछते हैं, "वह आवाज क्या है?", तो टॉर्च ऑडियो टोकन को हाइलाइट करती है और वीडियो टोकन को धुंधला कर देती है।
    • यदि आप पूछते हैं, "शर्ट का रंग क्या है?", तो टॉर्च वीडियो टोकन को हाइलाइट करती है।
    • रोबोट उन टोकन को रखता है जिन पर "टॉर्च" की रोशनी पड़ती है और उन्हें हटा देता है जो अंधेरे में हैं। यह छंटनी (प्रूनिंग) को स्मार्ट और कार्य के प्रति विशिष्ट बनाता है।

3. "बीच का हिस्सा न छोड़ें" का नियम (टेम्पोरल डायवर्सिटी)

एक खतरा है: यदि रोबोट केवल उन्हीं टोकन को रखता है जिन्हें टॉर्च हिट करती है, तो वह बाकी सब कुछ भूल सकता है, जिससे कहानी में एक "गैप" पैदा हो सकता है।

  • समाधान: OmniDrop एक नियम जोड़ता है जिसे टेम्पोरल डायवर्सिटी कहा जाता है। भले ही कोई विशिष्ट क्षण सबसे महत्वपूर्ण न हो, लेकिन यदि वह मुख्य घटना से समय में दूर है, तो रोबोट उसे बने रहने के लिए थोड़ा "बोनस स्कोर" देता है।
  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं। यदि आप केवल उन वाक्यों को रखते हैं जहाँ नायक बोलता है, तो आप परिवेश (सेटिंग) को मिस कर देंगे। OmniDrop कहता है, "नायक के संवादों को रखें, लेकिन बीच के शांत हिस्सों से भी कुछ वाक्य रखें ताकि कहानी टूटी हुई महसूस न हो।"

परिणाम

लेखकों ने Qwen2.5-Omni (एक लोकप्रिय मॉडल) का विभिन्न वीडियो और ऑडियो परीक्षणों पर परीक्षण किया।

  • गति: इसने रोबोट को 40% तेज़ सोचने में सक्षम बनाया (इंतज़ार का समय कम हुआ)।
  • मेमोरी: इसने 14.7% कम मेमोरी का उपयोग किया।
  • स्मार्टनेस: आश्चर्यजनक रूप से, यह जानने के बारे में कि क्या फेंकना है, बेहतर होने के कारण, रोबोट वास्तव में अन्य तरीकों की तुलना में सवालों के जवाब देने में बेहतर (परीक्षणों पर 3.58 अंक अधिक) हो गया जो केवल डेटा के रैंडम टुकड़ों को फेंक देते थे।

संक्षेप में:
OmniDrop एक फिल्म के स्मार्ट संपादक की तरह है। फिल्म को देखने से पहले ही उसे आधा काटने के बजाय, यह आपको पूरी फिल्म देखने देता है, यह पता लगाता है कि आपके विशिष्ट प्रश्न के लिए कौन से दृश्य वास्तव में मायने रखते हैं, और फिर यह बाकी हिस्सों को देखते समय ही काट देता है, जिससे यह सुनिश्चित होता है कि आपको बिना कहानी खोए जल्दी उत्तर मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →