← नवीनतम पेपर
💻 computer science

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

यह शोध पत्र टास्क-एडेप्टिव प्रूनिंग (TAP) का प्रस्ताव करता है, जो एक ऐसी विधि है जो विभिन्न विजन ट्रांसफॉर्मर कार्यों में टोकन को गतिशील रूप से रैंक करने और प्रूनिंग बजट आवंटित करने के लिए कार्य-विशिष्ट रजिस्टरों का उपयोग करती है, जिससे इमेज क्लासिफिकेशन, सिमेंटिक सेगमेंटेशन और ऑब्जेक्ट डिटेक्शन पर प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए महत्वपूर्ण थ्रूपुट सुधार प्राप्त होता है।

मूल लेखक: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

प्रकाशित 2026-08-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग है जो चित्रों को देखता है और समझने की कोशिश करता है कि उनके अंदर क्या है। यह दिमाग नन्हे कार्यकर्ताओं की एक विशाल टीम की तरह बना है, जिनमें से प्रत्येक के पास पहेली का एक टुकड़ा (एक "टोकन") है। निर्णय लेने के लिए, हर कार्यकर्ता को दूसरे हर कार्यकर्ता के साथ बातचीत करनी होती है। समस्या यह है कि यदि चित्र बड़ा है, तो बातचीत की संख्या विस्फोट की तरह बढ़ जाती है, जिससे दिमाग अभिभूत, धीमा और बिजली का भूखा हो जाता है। वैज्ञानिकों ने इसे ठीक करने के लिए दिमाग को चित्र के उबाऊ हिस्सों को अनदेखा करने और केवल महत्वपूर्ण हिस्सों को रखने के लिए कहने की कोशिश की है, ठीक वैसे ही जैसे एक शिक्षक कक्षा को केवल उन छात्रों पर ध्यान देने के लिए कहता है जिनके पास कुछ समझदारी भरी बात है। इसे "टोकन प्रूनिंग" (token pruning) कहा जाता है। लेकिन पेचीदा हिस्सा यह है कि "समझदार" या "महत्वपूर्ण" क्या है, यह इस बात पर निर्भर करता है कि रोबोट क्या करने की कोशिश कर रहा है। बिल्ली को पहचानने के लिए महत्वपूर्ण टुकड़ा आसमान का रंग पता लगाने के लिए बेकार हो सकता है। लंबे समय तक वैज्ञानिकों ने एक ही "इग्नोर लिस्ट" (अनदेखी सूची) का उपयोग करने की कोशिश की जो हर काम के लिए समान हो, लेकिन यह पाया गया कि एक ही आकार सभी के लिए सही नहीं होता।

यह शोध पत्र, जिसका शीर्षक "Putting Registers to Work" है, ठीक इसी समस्या का समाधान करता है। लेखक, जो क्वीन मैरी यूनिवर्सिटी ऑफ लंदन की एक टीम है, ने खोजा कि चित्र के टुकड़ों को फेंकने के नियम अलग-अलग कार्यों के लिए पूरी तरह से अलग होते हैं। उन्होंने पाया कि एक रणनीति जो वस्तुओं को खोजने (जैसे पार्क में कुत्ते को ढूंढना) के लिए बहुत अच्छा काम करती है, वह वास्तव में एक दृश्य को समझने (जैसे कि वह कुत्ता घास पर है या फुटपाथ पर) की रोबोट की क्षमता को नुकसान पहुँचा सकती है। इस समस्या को हल करने के लिए, उन्होंने एक चतुर नई प्रणाली बनाई जिसे टास्क-एडेप्टिव प्रूनिंग (TAP) कहा जाता है।

रोबोट के दिमाग को एक व्यस्त रसोईघर के रूप में सोचें। आमतौर पर, शेफ (प्रूनिंग पॉलिसी) यह तय करने के लिए एक ही रेसिपी का उपयोग करता है कि कौन सी सामग्री बाहर फेंकनी है, चाहे वह सूप बना रहा हो या केक। लेखकों को एहसास हुआ कि यह एक गलती थी। इसके बजाय, उन्होंने रसोई को विशेष "टास्क रजिस्टर्स" (task registers) दिए—इन्हें स्मार्ट, जादुई रेसिपी कार्ड के रूप में समझें जो पकवान पकाने के आधार पर बदलते रहते हैं। जब रोबोट को बिल्ली की पहचान करनी होती है, तो वह "कैट कार्ड" निकालता है, जो दिमाग को बताता है कि चित्र के किन हिस्सों को रखना है और किन्हें अनदेखा करना है। जब उसे पूरे कमरे का नक्शा बनाना होता है, तो वह "रूम कार्ड" बदल देता है। ये कार्ड केवल यह तय नहीं करते कि क्या फेंकना है; वे यह भी तय करते हैं कि मस्तिष्क द्वारा चित्र को प्रोसेस करते समय, परत-दर-परत, कब फेंकना है।

शोधकर्ताओं ने अपने "फ्रीज" किए गए मानक रोबोट दिमाग का उपयोग करके और बिना उसे फिर से प्रशिक्षित किए विभिन्न "इग्नोर नियमों" का परीक्षण किया। उन्हें तीन बड़े आश्चर्य मिले। पहला, वस्तुओं को खोजने के लिए महत्वपूर्ण टुकड़ों को चुनने का सबसे अच्छा तरीका, दृश्य मानचित्रण (scene mapping) के लिए सबसे अच्छे तरीके से बिल्कुल विपरीत है। दूसरा, रोबोट प्रसंस्करण के शुरुआती स्तरों को संभालने के मामले में बहुत संवेदनशील है, विशेष रूप से बिल्ली या कुत्ते जैसी सरल पहचान के कार्यों के लिए। तीसरा, जब रोबोट चित्र के किसी टुकड़े को हटा देता है, तो उसे बाद में कमी को भरने के लिए याद रखना पड़ता है कि वह कैसा दिखता था। लेकिन यहाँ मुख्य बात यह है कि वस्तुओं को खोजने के लिए, यह बेहतर है कि बस यह मान लिया जाए कि वह टुकड़ा कभी था ही नहीं और खाली जगह को भरने के लिए पास के पड़ोसी का उपयोग किया जाए। दृश्य मानचित्रण के लिए, यह बेहतर है कि वास्तव में सटीक अंतर को याद रखा जाए और बाद में इसे वापस चिपका दिया जाए।

इन सबको ठीक करने के लिए, TAP वर्तमान कार्य के लिए एक एकल "सक्रिय" (active) रजिस्टर कार्ड का उपयोग करता है। यह कार्ड दिमाग के माध्यम से यात्रा करता है, चित्र को देखता है और चलते-चलते तीन निर्णय लेता है:

  1. चयन (Selection): किन टोकनों को रखना है और किन्हें छोड़ना है।
  2. बजट (Budget): प्रत्येक चरण में कितने टोकन छोड़ दिए जाएँ (शायद शुरुआत में कुछ छोड़ दें, बाद में अधिक, या इसके विपरीत)।
  3. रिकवरी (Recovery): जब रोबोट को एक विस्तृत मानचित्र बनाने की आवश्यकता होती है, तो "भूल गए" विवरण को कितनी मात्रा में वापस लाया जाए।

परिणाम प्रभावशाली हैं। इन कार्य-विशिष्ट कार्डों का उपयोग करके, रोबोट अपनी बुद्धिमत्ता खोए बिना बहुत तेज़ हो गया। वस्तुओं को खोजने के मानक परीक्षण (COCO) पर, यह लगभग समान सटीकता बनाए रखते हुए (केवल 0.3 अंक गिरकर) 1.32 गुना तेज़ हो गया। दृश्य मानचित्रण (ADE20K) के परीक्षण पर, यह गुणवत्ता में मामूली गिरावट के साथ 1.30 गुना तेज़ हो गया। यहाँ तक कि सरल इमेज क्लासिफिकेशन के लिए भी, यह प्रतिस्पर्धी बना रहा।

लेखक सुझाव देते हैं कि यह दृष्टिकोण एक वास्तव में एकीकृत रोबोट मस्तिष्क की ओर एक कदम है—एक ऐसा मस्तिष्क जो कार को देखने, सड़क का चित्र बनाने या साइन बोर्ड पढ़ने के बीच स्विच कर सकता है, और यह सब एक ही मुख्य इंजन का उपयोग करके, लेकिन चलते समय अलग-अलग "सोचने के तरीकों" को सक्रिय करके कर सकता है। उन्होंने केवल अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे साबित करने के लिए हजारों प्रयोग किए, दिमाग को फ्रीज करके व्यक्तिगत नियमों का परीक्षण किया, और दिखाया कि उनका नया "रजिस्टर" सिस्टम पुराने "एक-आकार-सभी-के-लिए" वाले तरीकों की तुलना में लगातार बेहतर प्रदर्शन करता है। यह हमें याद दिलाता है कि AI की दुनिया में, कभी-कभी सबसे समझदारी भरा काम यह जानना है कि शोर को कब अनदेखा करना है, और "शोर" की परिभाषा पूरी तरह से इस पर निर्भर करती है कि आप क्या देखने की कोशिश कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →