← नवीनतम पेपर
💻 computer science

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK एक ट्रेनिंग-मुक्त विजुअल टोकन प्रूनिंग विधि है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए हेड इम्पॉर्टेंस अवेयरनेस और टेक्स्ट-गाइडेड अटेंशन का लाभ उठाती है ताकि कार्य-प्रासंगिक विजुअल टोकन्स को चुनिंदा रूप से बनाए रखते हुए स्टेट-ऑफ-द-आर्ट सटीकता को बरकरार रखते हुए इन्फरेंस लेटेंसी और मेमोरी उपयोग को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त को किसी फिल्म के एक जटिल दृश्य के बारे में समझाने की कोशिश कर रहे हैं। आपके पास एक स्क्रिप्ट (टेक्स्ट) है और एक 4K वीडियो फ़ाइल (इमेज) है।

समस्या: बहुत अधिक डेटा
मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) एक सुपर-स्मार्ट AI असिस्टेंट की तरह हैं जो वीडियो को "देख" सकते हैं और टेक्स्ट को "पढ़" भी सकते हैं। हालाँकि, जब वे किसी इमेज को देखते हैं, तो वे केवल एक तस्वीर नहीं देखते; वे उसे सैकड़ों छोटे पहेली के टुकड़ों में तोड़ देते हैं जिन्हें विजुअल टोकन (visual tokens) कहा जाता है।

यदि आपके पास एक हाई-रेज़ोल्यूशन इमेज या एक लंबा वीडियो है, तो AI के पास हजारों ऐसे पहेली के टुकड़े हो सकते हैं। यह वैसा ही है जैसे आप एक 10,000 टुकड़ों वाली पहेली को हल करने की कोशिश कर रहे हों और उसी समय आपका दोस्त आपसे सवाल पूछ रहा हो। AI इससे घबरा जाता है, सोचने में बहुत समय लेता है, और कंप्यूटर की बहुत बड़ी मात्रा में मेमोरी (RAM) का उपयोग करता है। यह इसे चलाने के लिए धीमा और महंगा बना देता है, खासकर रियल-टाइम एप्लिकेशन के लिए।

पुराना समाधान: "औसत" दृष्टिकोण
इसे ठीक करने के लिए, शोधकर्ताओं ने टोकन प्रूनिंग (token pruning) का प्रयास किया—मूल रूप से, उन पहेली के टुकड़ों को फेंक देना जो महत्वहीन लगते हैं ताकि AI केवल सबसे महत्वपूर्ण टुकड़ों को ही हल करे।

पिछले तरीकों ने एक आलसी संपादक की तरह काम किया जिसने यह मान लिया कि AI का हर हिस्सा बिल्कुल एक ही तरह से काम करता है। वे पहेली के टुकड़ों को देखते थे और कहते थे, "आइए केवल उन्हें रखें जो एक-दूसरे के सबसे समान दिखते हैं" या "आइए उन्हें रखें जिन्हें AI ने सबसे अधिक देखा है, सभी 'आंखों' के साथ समान व्यवहार करते हुए।"

खोज: AI की पास विशेष "आंखें" हैं
इस पेपर के लेखकों ने, HAWK, एक दिलचस्प बात खोजी: AI की आंखें एक जैसी नहीं होती हैं। इसमें कई अलग-अलग अटेंशन हेड्स (attention heads) होते हैं (इन्हें विशेष सेंसर या लेंस के रूप में सोचें)।

  • एक "आंख" इमेज में टेक्स्ट पहचानने में बहुत अच्छी हो सकती है।
  • दूसरी "आंख" चेहरों को पहचानने में उत्कृष्ट हो सकती है।
  • तीसरी "आंख" बैकग्राउंड के दृश्यों पर केंद्रित हो सकती है।

यदि आप इन सभी आंखों के साथ एक जैसा व्यवहार करते हैं, तो आप गलती से उस पहेली के टुकड़े को फेंक सकते हैं जिसे "टेक्स्ट-सेंसर" देख रहा था, जबकि उस टुकड़े को रख सकते हैं जिसे "बैकग्राउंड-सेंसर" देख रहा था (जो कि आपके प्रश्न के लिए अप्रासंगिक हो सकता है)।

HAWK का समाधान: स्मार्ट संपादक
HAWK एक नया तरीका है जो एक स्मार्ट, विशेष संपादक की तरह काम करता है। AI के दिमाग को एक सिंगल ब्लॉक के रूप में देखने के बजाय, यह समझता है कि दिमाग के विभिन्न हिस्से अलग-अलग कार्यों के लिए अधिक महत्वपूर्ण हैं।

यहाँ बताया गया है कि HAWK कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. "हेड" मैप (स्थिर महत्व - Static Importance): AI के किसी विशिष्ट इमेज को देखने से पहले ही, HAWK यह पता लगाने के लिए एक बार का अध्ययन करता है कि कौन सी "आंखें" सबसे महत्वपूर्ण हैं। यह यह जानने जैसा है कि एक विशिष्ट काम के लिए, आपको अपनी "रीडिंग ग्लासेस" की आवश्यकता "नाइट-विज़न गॉगल्स" से अधिक है। HAWK प्रत्येक आंख के लिए महत्व का एक मैप बनाता है।
  2. "प्रश्न" गाइड (डायनेमिक अटेंशन - Dynamic Attention): जब आप AI से कोई प्रश्न पूछते हैं (जैसे, "पिकनिक टेबल कहाँ है?"), तो HAWK आपके प्रश्न को देखता है और पूछता है, "AI की कौन सी आंखें इस विशिष्ट प्रश्न का उत्तर देने के लिए सबसे उपयुक्त हैं?"
  3. स्मार्ट कट: HAWK इस जानकारी के दो हिस्सों को मिला देता है। वह कहता है, "ठीक है, 'टेक्स्ट-रीडिंग' आंख बहुत महत्वपूर्ण है, और प्रश्न टेबल के बारे में है। आइए उन पहेली के टुकड़ों को रखें जिन्हें 'टेक्स्ट-रीडिंग' आंख देख रही है, और बाकी को हटा दें।"

यह एक बड़ी बात क्यों है

  • कोई ट्रेनिंग आवश्यक नहीं: आपको AI को यह सिखाने के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह एक मौजूदा विशेषज्ञ को नए चश्मे देने जैसा है; वे तुरंत उनका उपयोग कर सकते हैं।
  • भारी गति वृद्धि: बेकार पहेली के टुकड़ों में से 80% तक को फेंककर, AI अपना काम बहुत तेज़ी से पूरा करता है।
  • बेहतर सटीकता: क्योंकि यह सही टुकड़ों को रखता है (जिन्हें विशेष आंखें देखती हैं), इसलिए यह भ्रमित नहीं होता है। परीक्षणों में, भले ही इसने 80% डेटा फेंक दिया हो, फिर भी AI ने सब कुछ देखने की तुलना में 96% उत्तर सही दिए।

सारांश में
HAWK को एक सुपर-इंटेलिजेंट AI के लिए एक पर्सनल असिस्टेंट के रूप में सोचें। AI के डेस्क पर पूरी लाइब्रेरी की किताबें फेंककर यह कहने के बजाय कि "इसे पढ़ो," HAWK जल्दी से किताबों को स्कैन करता है, यह समझता है कि आपके विशिष्ट प्रश्न के लिए कौन से अध्याय प्रासंगिक हैं, और केवल वे कुछ पन्ने ही AI को सौंप देता है। AI तेजी से पढ़ता है, कम ऊर्जा का उपयोग करता है, और फिर भी कहानी को पूरी तरह से समझ जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →