Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers
यह शोधपत्र SAPER प्रस्तुत करता है, जो एक व्याख्यात्मक-निर्देशित (interpretable-guided) सॉफ्ट प्रूनिंग फ्रेमवर्क है जो विजन ट्रांसफॉर्मर्स की कम्प्यूटेशनल लागत को कुशलतापूर्वक कम करने के लिए अटेंशन हेड्स के स्पेक्ट्रल विश्लेषण और सिमेंटिक क्लस्टरिंग का लाभ उठाता है, जबकि उच्च वर्गीकरण सटीकता बनाए रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक हलचल भरे, हाई-टेक शहर के रूप में करें जहाँ कंप्यूटर दुनिया को देखना सीखते हैं। इस शहर में, सबसे शक्तिशाली इमारतें "विज़न ट्रांसफॉर्मर्स" (Vision Transformers) कहलाती हैं। ये केवल साधारण कैमरे नहीं हैं; ये विशाल, जटिल संरचनाएं हैं जो अविश्वसनीय सटीकता के साथ एक बिल्ली, एक कार या एक बादल को पहचान सकती हैं। वे एक छवि को छोटे-छोटे पहेली के टुकड़ों में तोड़कर और उन्हें "अटेंशन हेड्स" (attention heads) के एक नेटवर्क के माध्यम से भेजकर ऐसा करते हैं। इन हेड्स को विशेषज्ञों की एक टीम के रूप में सोचें, जिनमें से प्रत्येक अलग-अलग सुरागों के लिए छवि को स्कैन करता है। कुछ किनारों (edges) को देखते हैं, अन्य रंगों को, और कुछ किसी वस्तु के समग्र आकार को।
हालाँकि, इसमें एक पेच है। इन जासूसों को बेहद स्मार्ट बनाने के लिए, इंजीनियरों ने उन्हें विशाल, ऊर्जा-प्यास ऊँची इमारतों में बनाया है। ये इमारतें इतनी बड़ी हैं कि उन्हें चलाने के लिए भारी मात्रा में बिजली और शक्तिशाली कंप्यूटरों की आवश्यकता होती है, जिससे उन्हें फोन या रोबोट जैसे छोटे उपकरणों पर उपयोग करना कठिन हो जाता है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं, वह यह है: क्या हमें वास्तव में टीम के हर एक जासूस की आवश्यकता है? या उनमें से कुछ बस खड़े होकर एक-दूसरे के काम की नकल कर रहे हैं, या ऐसी चीजों को देख रहे हैं जिनका कोई महत्व नहीं है? यदि हम बिना टीम की अपराध सुलझाने की क्षमता खोए, उन अनावश्यक जासूसों को हटा सकें, तो हम उस गगनचुंबी इमारत को एक आरामदायक कुटिया में बदल सकते हैं, जिससे ऊर्जा की बचत होगी और ये स्मार्ट सिस्टम सभी के लिए सुलभ हो जाएंगे।
यह बिल्कुल वही पहेली है जिसे शोधकर्ताओं की एक टीम ने हल किया है जिन्होंने SAPER (Soft Attention PrunER) नामक एक नई विधि विकसित की है। उन्होंने महसूस किया कि इन एआई (AI) मॉडलों में जो अतिरेक (redundancy) है, वह कोई गलती नहीं है; बल्कि यह वास्तव में उनके अत्यधिक लचीले होने के तरीके का एक दुष्प्रभाव है। क्योंकि मॉडलों को बिना किसी विशिष्ट निर्देश के लाखों छवियों पर सिखाया जाता है, वे सुरक्षा के लिए कई बैकअप रास्ते बना लेते हैं। शोधकर्ता यह खोजने का एक तरीका चाहते थे कि कौन से "जासूस" वास्तव में अनूठे और महत्वपूर्ण काम कर रहे हैं और कौन से केवल खुद को दोहरा रहे हैं, ताकि उन्हें सुरक्षित रूप से हटाया जा सके।
इसे हल करने के लिए, टीम ने पहले एक नया तरीका बनाया जिससे यह देखा जा सके कि प्रत्येक जासूस क्या सोच रहा है। उन्होंने लैप्लेस मैप्स (Laplace maps) का आविष्कार किया, जो प्रत्येक अटेंशन हेड के लिए रंगीन हीटमैप या स्पेक्ट्रल फिंगरप्रिंट की तरह हैं। केवल नंबरों को देखने के बजाय, ये मैप्स एक हेड द्वारा छवि पर ध्यान केंद्रित करने के जटिल गणित को एक दृश्य पैटर्न में बदल देते हैं। यह एक गायक मंडली को सुनने जैसा है और यह महसूस करना कि जबकि कुछ गायक एक ही सुर लगा रहे हैं, अन्य पूरी तरह से अलग धुनें गा रहे हैं। इन पैटर्नों का विश्लेषण करके, शोधकर्ताओं ने पाया कि "जासूस" केवल सीधी पंक्तियों में व्यवस्थित नहीं हैं; वे कार्यात्मक समूहों (functional groups) में बनते हैं। नेटवर्क के शुरुआती स्तरों में कुछ हेड्स "कन्वोल्यूशनल" (convolutional) हेड्स के रूप में कार्य करते हैं, जो सरल किनारों और बनावट पर ध्यान केंद्रित करते हैं, जबकि गहरे स्तरों में अन्य जटिल, वैश्विक आकारों पर ध्यान केंद्रित करते हैं। आश्चर्यजनक रूप से, उन्होंने पाया कि एक ही काम करने वाले हेड्स पूरी इमारत में बिखरे हुए हो सकते हैं, न कि केवल एक विशिष्ट मंजिल पर चिपके हुए।
इस समझ से लैस होकर, उन्होंने SAPER बनाया, जो एक स्मार्ट टूल के रूप में कार्य करता है जो एक सौम्य संपादक (gentle editor) की तरह है। मॉडल के हिस्सों को अंधाधुंध काटने के बजाय, SAPER एक "सॉफ्ट" चयन प्रक्रिया का उपयोग करता है ताकि यह तय किया जा सके कि किन हेड्स को रखना है और किन्हें जाने देना है। यह एक छलनी की तरह है जो धीरे-धीरे अनावश्यक हेड्स को छानता है जबकि आवश्यक हेड्स को बनाए रखता है, जिससे मॉडल यह सीख पाता है कि कौन से वास्तव में जरूरी हैं। उन्होंने ImageNet-1K और CIFAR-100 जैसे विशाल इमेज डेटासेट पर इसका परीक्षण किया। परिणाम उत्साहजनक थे: SAPER मूल टीम की संख्या को काफी कम करने में सफल रहा—कभी-कभी मूल टीम के एक अंश को ही रखते हुए—और फिर भी वस्तुओं की पहचान करने में उच्च सटीकता बनाए रखी। उदाहरण के लिए, उन्होंने दिखाया कि बहुत कम हेड्स के साथ भी, मॉडल अच्छा प्रदर्शन कर सकता है, विशेष रूप से जब "नॉलेज डिस्टिलेशन" (knowledge distillation) नामक तकनीक का उपयोग किया जाता है, जहाँ छोटा मॉडल बड़े, स्मार्ट मॉडल से सीखता है।
यह पेपर सुझाव देता है कि यह दृष्टिकोण पिछले तरीकों की तुलना में गति और बुद्धिमत्ता के बीच बहुत बेहतर संतुलन प्रदान करता है। जबकि अन्य तकनीकों ने एक साथ मॉडल के पूरे ब्लॉक को काटने की कोशिश की, SAPER की व्यक्तिगत हेड्स को चुनने की क्षमता ने बहुत बारीक नियंत्रण की अनुमति दी। अपने प्रयोगों में, SAPER ने प्रतिस्पर्धी तरीकों की तुलना में अक्सर कम कंप्यूटिंग पावर (FLOPs द्वारा मापा गया) का उपयोग किया और समान या बेहतर परिणाम प्राप्त किए। शोधकर्ता निष्कर्ष निकालते हैं कि इन अटेंशन हेड्स की विशिष्ट भूमिकाओं को उनके स्पेक्ट्रल हस्ताक्षरों (spectral signatures) के माध्यम से समझकर, हम ऐसे विज़न मॉडल बना सकते हैं जो न केवल शक्तिशाली हैं बल्कि कुशल और पारदर्शी भी हैं, जो हमारी जेबों में फिट होने वाले और बैटरी खत्म न करने वाले स्मार्ट एआई के लिए मार्ग प्रशस्त करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।