← नवीनतम पेपर
💻 computer science

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

यह शोध पत्र टोकन भूमिकाओं के दृष्टिकोण से विजन-लैंग्वेज मॉडल्स में विजुअल टोकन प्रूनिंग का विश्लेषण करता है, जो यह प्रकट करता है कि मौजूदा प्रूनिंग विधियाँ विशिष्ट भूमिका पूर्वाग्रह प्रदर्शित करती हैं जो प्रदर्शन के साथ सीधे सहसंबद्ध नहीं हैं, और यह प्रदर्शित करता है कि नॉन-अलाइव टोकन्स को संरक्षित करने से डाउनस्ट्रीम परिणाम बने रह सकते हैं या यहाँ तक कि उनमें सुधार भी हो सकता है।

मूल लेखक: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

प्रकाशित 2026-08-06
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को तस्वीरें दिखाकर दुनिया को समझना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, रोबोट चित्र को इंसान की तरह नहीं "देखता"; यह चित्र को हजारों छोटे डिजिटल पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन" कहा जाता है। इन टोकनों को एक विशाल, अराजक ऑर्केस्ट्रा के व्यक्तिगत नोट्स की तरह समझें। रोबोट को गाना समझने के लिए हर एक नोट को सुनना होगा। लेकिन समस्या यह है कि हाई-रेज़ोल्यूशन वाली छवियों के लिए, वह ऑर्केस्ट्रा इतना विशाल हो जाता है कि वह रोबोट को धीमा कर देता है, जिससे वह सुस्त हो जाता है और कंप्यूटर मेमोरी का भूखा हो जाता है।

वैज्ञानिकों ने इसे ठीक करने के लिए रोबोट को "बोरिंग" नोट्स को अनदेखा करना सिखाकर इसे हल करने की कोशिश की है—वे नोट्स जो खुद को दोहराते हुए लगते हैं या जिनमें बहुत अधिक अर्थ नहीं होता। इसे "टोकन प्रूनिंग" (token pruning) कहा जाता है। यह एक कंडक्टर की तरह है जो ऑर्केस्ट्रा को उन नोट्स को बजाना बंद करने के लिए कहता है जो एक जैसे सुनाई देते हैं, इस उम्मीद में कि संगीत अभी भी शानदार लगेगा लेकिन बहुत तेज़ी से बजेगा। हाल ही में, "एम्बेडलेंस" (EmbedLens) नामक एक नए टूल ने शोधकर्ताओं को यह समझने में मदद की कि ये टोकन एक जैसे नहीं हैं। कुछ "जीवित" (alive) हैं (चित्र की असली कहानी लेकर चलते हैं), कुछ "सिंक" (sks/sinks) हैं (दोहराव वाले पैटर्न जो बस वहीं बैठे रहते हैं), और कुछ "मृत" (dead) हैं (पूरी तरह से अनावश्यक शोर)। बड़ा सवाल यह था: यदि हम जानते हैं कि कौन से टोकन "मृत" हैं, तो क्या हम उन्हें तेज़ गति देने के लिए बस फेंक सकते हैं?

यह शोध पत्र, जिसका शीर्षक है "सभी अनावश्यक टोकन एक जैसे नहीं होते" (Not All Redundant Tokens Are Alike), उसी प्रश्न की गहराई में जाता है। शोधकर्ताओं ने यह देखने के लिए कि विभिन्न प्रूनिंग विधियाँ किसे काटने का निर्णय लेती हैं, इस प्रश्न का बारीकी से अध्ययन किया। उन्होंने पाया कि जो विधियाँ "मृत" टोकनों को काटने की कोशिश करती हैं, वे हमेशा उन विधियों से बेहतर काम नहीं करतीं जो ऐसा नहीं करतीं। वास्तव में, उनके प्रयोग बताते हैं कि "मृत" टोकन भी पर्दे के पीछे कुछ महत्वपूर्ण काम कर रहे हैं, जैसे कि ऑर्केस्ट्रा को एक साथ थामे रखना। इन "मृत" टोकनों को हटाने से बचाने पर, रोबोट कभी-कभी सवालों के जवाब देने में वास्तव में बेहतर हो गया, न कि बदतर। यह साबित हुआ कि सिर्फ इसलिए कि कोई टोकन अकेले उपयोगी नहीं दिखता, इसका मतलब यह नहीं है कि उसे फेंकना सुरक्षित है; कभी-कभी, पूरे समूह को सही ढंग से बजने के लिए एक साथ रहना पड़ता है।

डिजिटल ऑर्केस्ट्रा की कहानी

यह समझने के लिए कि यह क्यों मायने रखता है, आइए देखें कि ये विजन-लैंग्वेज मॉडल्स (VLMs) कैसे काम करते हैं। कल्पना कीजिए कि आपके पास एक रोबोट है जो पढ़ और देख सकता है। जब आप उसे बिल्ली की फोटो दिखाते हैं, तो रोबोट की "आँख" (विजन एनकोडर) उस फोटो को डेटा के छोटे-छोटे टुकड़ों की एक लंबी सूची में तोड़ देती है। इन टुकड़ों को फिर रोबोट के "दिमाग" (एक लार्ज लैंग्वेज मॉडल) को सौंपा जाता है ताकि वह समझ सके कि बिल्ली क्या कर रही है।

समस्या यह है कि एक एकल फोटो सैकड़ों ऐसे टुकड़े उत्पन्न कर सकती है। यदि आपके पास एक वीडियो या बहुत विस्तृत छवि है, तो सूची इतनी लंबी हो जाती है कि रोबoret अभिभूत हो जाता है। इसमें चित्र के पहले भाग को प्रोसेस करने में बहुत समय लगता है (जिसे "प्रीफिल लेटेंसी" कहा जाता है), यह बहुत अधिक मेमोरी का उपयोग करता है, और बहुत अधिक ऊर्जा खर्च करता है। इसे ठीक करने के लिए, शोधकर्ताओं ने "टोकन प्रूनिंग" विकसित किया। यह एक स्मार्ट संपादक की तरह है जो टुकड़ों की सूची को देखता है और कहता है, "ठीक है, हमें एक ही नीले आसमान की 500 कॉपियों की आवश्यकता नहीं है; चलिए केवल 50 रखते हैं।"

कुछ समय के लिए, सभी ने मान लिया था कि नियम सरल था: "दिलचस्प चीजों को रखें, उबाऊ चीजों को फेंक दें।" हाल ही में, एम्बेडलेंस (EmbedLens) नामक एक टूल ने खेल बदल दिया। इसने रोबोट के दिमाग के अंदर झाँका और पाया कि टोकन तीन अलग-अलग समूहों में बँटे हैं:

  1. जीवित टोकन (Alive Tokens): ये सितारे हैं। वे चित्र के विशिष्ट विवरण लाते हैं, जैसे "मुलायम फर" या "हरी घास"।
  2. सिंक टोकन (Sink Tokens): ये बैकग्राउंड के शोर की तरह हैं। वे दोहराव वाले हैं और वास्तव में विशिष्ट छवि के बारे में बात नहीं करते, लेकिन वे स्थिर हैं और हमेशा वहां रहते हैं।
  3. मृत टोकन (Dead Tokens): ये परम शोर हैं। वे छवि या शब्दों से बिल्कुल भी जुड़े हुए नहीं लगते।

तार्किक अनुमान यह था: "यदि हमारे पास मृत टोकन हैं, तो चलिए उन्हें हटा देते हैं! वे बेकार हैं!"

महान प्रूनिंग प्रयोग

इस शोध पत्र के लेखकों ने उस अनुमान का परीक्षण करने का निर्णय लिया। उन्होंने तीन लोकप्रिय प्रूनिंग विधियों (FastV, DART, और DivPrune) को लिया और पूछा: "जब आप टोकनों की संख्या कम करते हैं, तो आप वास्तव में किन टोकनों को काट रहे हैं?"

उन्होंने इन विधियों को दस अलग-अलग टेस्ट सेटों पर चलाया, जिनमें "कार का रंग क्या है?" जैसे सरल प्रश्नों से लेकर जटिल विज्ञान के प्रश्नों तक शामिल थे। उन्होंने अलग-अलग स्तरों पर (12.5% से 87.5% तक टोकन हटाते हुए) कितने "जीवित", "सिंक" और "मृत" टोकन हटाए गए, इसका सटीक पता लगाया।

जो उन्होंने पाया वह थोड़ा उलझा हुआ था।
विभिन्न प्रूनिंग विधियाँ इस बात पर सहमत नहीं थीं कि "बेकार" क्या है।

  • DivPrune "मृत" टोकनों को काटने के मामले में बहुत आक्रामक था। ऐसा लग रहा था कि यह नियम का पालन कर रहा है: "शोर को हटाओ।"
  • हालाँकि, FastV और DART, "सिंक" टोकनों को बचाने के मामले में अजीब थे। वे दोहराव वाले बैकग्राउंड शोर को बनाए रखते थे, भले ही वह अनावश्यक लग रहा था।

यहाँ एक मोड़ है: केवल इसलिए कि किसी विधि ने अधिक "मृत" टोकनों को काटा, इसका मतलब यह नहीं था कि उसका प्रदर्शन बेहतर हुआ। वास्तव में, DivPrune (जिसने सबसे अधिक मृत टोकन काटे) कभी-कभी सबसे अच्छा था, तो कभी FastV (जिसने मृत टोकनों को रखा) बेहतर था। "मृत चीजों को काटने" और "अच्छा स्कोर प्राप्त करने" के बीच कोई सटीक मेल नहीं था।

"मृत टोकनों की रक्षा करें" का आश्चर्य

यह समझने के लिए कि यह क्यों हो रहा था, शोधकर्ताओं ने एक चतुर प्रयोग किया। प्रूनिंग विधियों को निर्णय लेने देने के बजाय, उन्होंने रोबोट को विशिष्ट प्रकार के टोकनों को रखने के लिए मजबूर किया। उन्होंने कहा, "ठीक है, FastV, तुम जो चाहो काट सकते हो, लेकिन तुम्हें सभी मृत टोकनों को रखना ही होगा।"

उन्हें उम्मीद थी कि प्रदर्शन गिर जाएगा। आखिर, यदि मृत टोकन बेकार हैं, तो उन्हें रखने से केवल जगह बर्बाद होगी और रोबोट को भ्रमित करेगा।

परिणाम? यह नहीं गिरा। कई मामलों में, यह बढ़ गया।

  • जब उन्होंने जीवित (Alive) टोकनों को सुरक्षित रखा, तो प्रदर्शन में सुधार हुआ (जो कि समझ में आता है)।
  • लेकिन जब उन्होंने मृत (Dead) टोकनों को सुरक्षित रखा, तो DivPrune विधि के लिए रोबोट का प्रदर्शन औसतन लगभग 0.93% बढ़ गया।

यह एक झटका था। इससे संकेत मिला कि भले ही एक अकेला "मृत" टोकन कचरा जैसा दिखे, लेकिन उन्हें हटाने से कुछ और टूट सकता है।

छिपा हुआ ऑर्केस्ट्रा कंडक्टर

"बेकार" टोकनों को रखने से मदद क्यों मिलती? लेखकों ने देखा कि टोकन अटेंशन (attention) नामक चीज़ का उपयोग करके एक-दूसरे से कैसे बात करते हैं। कल्पना कीजिए कि टोकन एक-दूसरे को नोट्स पास करने वाले संगीतकार हैं।

उन्होंने पाया कि जबकि एक एकल "मृत" टोकन बहुत अधिक ध्यान आकर्षित नहीं करता (वह मुख्य कलाकार नहीं है), लेकिन एक समूह के रूप में वे इतने अधिक हैं कि वे "अटेंशन बजट" का एक बड़ा हिस्सा ले लेते हैं। वे बैकअप गायकों के एक विशाल समूह की तरह हैं। यदि आप उन्हें सब काट देते हैं, तो शेष संगीतकार (जीवित टोकन) अपना संदर्भ खो देते हैं। "मृत" टोकन शायद धुन नहीं गा रहे हैं, लेकिन वे गीत की लय और संरचना को थामे हुए हैं।

जब शोधकर्ताओं ने मृत टोकनों को सुरक्षित रखा, तो शेष टोकनों के बीच अटेंशन पैटर्न अधिक संतुलित रहा। "जीवित" टोकन अभी भी ठीक से इंटरैक्ट कर सके क्योंकि "मृत" टोकन संरचना का समर्थन करने के लिए वहीं मौजूद थे।

निष्कर्ष

शोध पत्र सुझाव देता है कि हम केवल एक टोकन को देखकर यह नहीं कह सकते कि, "तुम मृत हो, जाओ।" यह इतना सरल नहीं है। "मृत" टोकन व्यक्तिगत रूप से कमजोर हो सकते हैं, लेकिन एक समूह के रूप में वे मजबूत हैं।

लेखक निष्कर्ष निकालते हैं कि प्रभावी प्रूनिंग केवल सबसे महत्वपूर्ण टोकनों को खोजने के बारे में नहीं है। यह संरचना (composition) के बारे में होना चाहिए। हमें यह सुनिश्चित करने की आवश्यकता है कि हम गलती से टोकनों की एक पूरी श्रेणी को न हटा दें जो, व्यक्तिगत रूप रूप से उबाऊ होने के बावजूद, समूह के कार्य करने के लिए आवश्यक है। यह एक याद दिलाता है कि AI जैसे जटिल सिस्टम में, यहाँ तक कि "अनावश्यक" हिस्से भी एक ऐसा काम कर रहे हो सकते हैं जिसे हम अभी पूरी तरह से नहीं समझते हैं।

इसलिए, अगली बार जब आप एक बिखरे हुए कमरे को साफ करने के बारे में सोचें, तो याद रखें, कभी-कभी वह सामान जिसे आप केवल कचरा समझते हैं, वास्तव में शेल्फ को थामे हुए होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →