← नवीनतम पेपर
💻 computer science

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

यह शोध पत्र V2^2Drop का प्रस्ताव करता है, जो एक वेरिएशन-अवेयर डायनेमिक टोकन ड्रॉपिंग विधि है जो न्यूनतम वेरिएशन वाले विजुअल टोकन को क्रमिक रूप से हटाकर लार्ज विजन-लैंग्वेज मॉडल इन्फरेंस को महत्वपूर्ण रूप से तेज करती है, जिससे इमेज और वीडियो अंडरस्टैंडिंग कार्यों में मूल प्रदर्शन को लगभग यथावत बनाए रखते हुए पर्याप्त लेटेंसी में कमी आती है।

मूल लेखक: Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को किसी जटिल फिल्म के दृश्य के बारे में समझाने की कोशिश कर रहे हैं। आपके पास एक स्क्रिप्ट है जो 100 पन्नों की है, लेकिन आपके दोस्त के पास सुनने के लिए केवल 5 मिनट हैं। यदि आप हर एक शब्द पढ़ेंगे, तो आपका समय समाप्त हो जाएगा। यदि आप यादृच्छिक (random) शब्दों को छोड़ देते हैं, तो आप कहानी का मुख्य हिस्सा खो सकते हैं।

लार्ज विजन-लैंग्वेज मॉडल्स (LVLMs) सुपर-स्मार्ट AI सहायकों की तरह हैं जो वीडियो "देख" सकते हैं और उच्च-रिज़ॉल्यूशन वाली छवियों को "पढ़" सकते हैं। लेकिन समस्या यह है कि एक उच्च-गुणवत्ता वाली छवि या लंबे वीडियो को समझने के लिए, ये AI विजुअल डेटा को हजारों छोटे टुकड़ों में तोड़ देते हैं जिन्हें "टोकन" (tokens) कहा जाता है। यह एक 4K मूवी को 10,000 पन्नों की स्क्रिप्ट में बदलने जैसा है। यह AI को अविश्वसनीय रूप से धीमा और कंप्यूटर पावर का भूखा बना देता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने स्क्रिप्ट को कंप्रेस (compress) करने की कोशिश की है—यानी "बोरिंग" हिस्सों को हटा देना ताकि AI तेजी से पढ़ सके। हालांकि, पुराने तरीकों में दो बड़ी खामियां थीं:

  1. "आखिरी पन्ना" पूर्वाग्रह (The "Last Page" Bias): वे स्क्रिप्ट के आखिरी कुछ पन्नों को रखते थे और शुरुआत को हटा देते थे, भले ही सबसे महत्वपूर्ण सुराग शुरुआत में ही हों।
  2. "भारी बैकपैक" (The "Heavy Backpack"): यह तय करने के लिए कि क्या रखना है, उन्हें बहुत भारी गणित (अटेंशन स्कोर की गणना) करना पड़ता था, जिससे उनका बैकपैक और भी भारी हो जाता था, जो इस उद्देश्य को ही विफल कर देता था कि उन्हें हल्का होना चाहिए।

पेश है V2Drop: द "लेजी टोकन" डिटेक्टर

यह पेपर एक नई विधि पेश करता है जिसे V2Drop (वेरिएशन-अवेयर विजन टोकन ड्रॉपिंग) कहा जाता है। यह पूछने के बजाय कि, "AI इस हिस्से को कितना देखता है?" (जो पूर्वाग्रह का कारण बनता है), V2Drop पूछता है, "यह हिस्सा AI के दिमाग के माध्यम से यात्रा करते समय कितना बदलता है?"

यहाँ सरल उपमा (analogy) दी गई है:

उपमा: फैक्ट्री असेंबली लाइन

कल्पना कीजिए कि AI एक फैक्ट्री असेंबली लाइन है जिसमें 20 स्टेशन (लेयर्स) हैं। एक विजुअल टोकन (छवि का एक टुकड़ा) स्टेशन 1 में प्रवेश करता है और स्टेशन 20 तक जाता है।

  • "महत्वपूर्ण" टोकन: ये धातु के एक कच्चे टुकड़े की तरह हैं जिसे हर स्टेशन पर हथौड़े से पीटा जाता है, पेंट किया जाता है, वेल्ड किया जाता है और पॉलिश किया जाता है। अंत तक पहुँचते-पहुँचते, यह पूरी तरह बदल चुका होता है। इसे "काम" दिया गया है क्योंकि इसमें महत्वपूर्ण जानकारी होती है (जैसे खिलाड़ी की जर्सी का नंबर या किसी साइन पर लिखा टेक्स्ट)।
  • "आलसी" (Lazy) टोकन: ये पृष्ठभूमि के दृश्य (जैसे नीले आकाश का एक हिस्सा या एक खाली दीवार) की तरह हैं। यह स्टेशन 1 में प्रवेश करता है और स्टेशन 20 तक पहुँचते-पहुँचते बिल्कुल वैसा ही दिखता है। यह नहीं बदला क्योंकि AI ने इसके बारे में कुछ भी दिलचस्प नहीं पाया।

V2Drop की रणनीति:
V2Drop यह अनुमान लगाने के बजाय कि कौन से टोकन महत्वपूर्ण हैं, बस यह मापता है कि टोकन में कितना बदलाव आया

  • यदि एक टोकन बहुत बदला? इसे रखें! यह भारी काम कर रहा है।
  • यदि एक टोकन वैसा ही रहा (वह "आलसी" था)? इसे हटा दें! यह केवल अतिरिक्त भार है।

यह गेम चेंजर क्यों है?

  1. कोई "आखिरी पन्ना" पूर्वाग्रह नहीं:
    पुराने तरीके एक ऐसे शिक्षक की तरह थे जो थका होने के कारण केवल टेस्ट का आखिरी पन्ना ही ग्रेड करता है। V2Drop उत्तर की सामग्री को देखता है, न कि यह कि वह वाक्य में कहाँ स्थित है। यह इमेज के ऊपरी-बाएँ कोने से एक टोकन को हटा सकता है यदि वह बोरिंग है, और निचले-दाएँ कोने से एक टोकम को रख सकता है यदि वह महत्वपूर्ण है। यह पूरी छवि के साथ निष्पक्ष व्यवहार करता है।

  2. हल्का बैकपैक (दक्षता):
    क्योंकि V2Drop केवल "बदलाव" (एक सरल गणितीय गणना जिसे L2 Norm कहा जाता है) को मापता है, इसे अन्य तरीकों की तरह भारी "अटेंशन" गणित की आवश्यकता नहीं होती है। इसका मतलब है कि यह सबसे तेज़, आधुनिक कंप्यूटर चिप्स (जैसे FlashAttention) के साथ पूरी तरह से काम करता है, बिना उन्हें धीमा किए।

  3. परिणाम:
    पेपर दिखाता है कि इस "लेजी टोकन" डिटेक्टर का उपयोग करके, AI:

  • इमेज को समझने में 1.3 गुना तेज़ हो जाता है।
  • वीडियो को समझने में 1.8 गुना तेज़ हो जाता है।
  • अपनी मूल बुद्धिमत्ता का 94% से 98% बनाए रखता है।

निचोड़ (The Bottom Line)

V2Drop को एक स्मार्ट संपादक के रूप में सोचें जो समय बचाने के लिए कहानी के अंत को नहीं काटता है। इसके बजाय, वे कहानी को स्कैन करते हैं और उन वाक्यों को काट देते हैं जो केवल "फालतू" (बिना कोई मूल्य जोड़े एक ही विचार को दोहराना) हैं। कहानी छोटी और पढ़ने में तेज़ हो जाती है, लेकिन कथानक (plot) पूरी तरह बरकरार रहता है।

यह AI को बिना किसी विशाल घर जितने बड़े सुपरकंप्यूटर की आवश्यकता के, रीयल-टाइम में लंबी फिल्में देखने और हाई-डेफिनिशन फोटो का विश्लेषण करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →