Accelerating Vision Transformers on Brain Processing Unit
यह शोध पत्र लीनियर लेयर्स को कनवल्शनल ऑपरेटर्स से बदलकर, बिना पुनरप्रशिक्षण के वेट इनहेरिटेंस (weight inheritance) सक्षम करते हुए और न्यूनतम सटीकता हानि के साथ महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त करते हुए, CNN-अनुकूलित ब्रेन प्रोसेसिंग यूनिट्स (BPUs) पर विजन ट्रांसफॉर्मर्स को त्वरित करने के लिए एक नवीन विधि प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-एफिशिएंट, विशेष रूप से प्रशिक्षित फैक्ट्री वर्कर है जिसे BPU (ब्रेन प्रोसेसिंग यूनिट) कहा जाता है। यह वर्कर 4D लेगो ब्रिक्स (जो स्टैंडर्ड इमेज डेटा जैसे ऊंचाई, चौड़ाई, कलर चैनल्स और बैचों का प्रतिनिधित्व करते हैं) को असेंबल करने में माहिर है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह वर्कर CNNs (कन्वोल्यूशनल न्यूरल नेटवर्क्स) बनाने के लिए विशेषज्ञ माना जाता है, जो पारंपरिक "ईंट बिछाने वाले" (ब्रिक-लेयर्स) हैं।
हालाँकि, एक नया, क्रांतिकारी प्रकार का आर्किटेक्ट विज़न ट्रांसफॉर्मर (ViT) आ गया है। 4D लेगो ब्रिक्स के साथ काम करने के बजाय, ViT कागज के 3D स्टैक (डेटा के अनुक्रम/सीक्वेंस) के साथ काम करता है। यह अविश्वसनीय रूप से स्मार्ट है और अक्सर बेहतर परिणाम देता है, लेकिन यह एक अलग भाषा बोलता है। जब आप BPU फैक्ट्री वर्कर को एक ViT बनाने के लिए काम पर रखने की कोशिश करते हैं, तो वह भ्रमित हो जाता है। उसे ईंटों को स्टैक करने के लिए डिज़ाइन किया गया है, न कि कागज के ढेर को छाँटने के लिए। परिणामस्वरूप, ViT को एक बहुत ही धीमे, सामान्य-उद्देश्य वाले वर्कर (CPU) द्वारा बनाया जाना पड़ता है, जिससे सुपर-फास्ट BPU खाली बैठा रह जाता है।
पेपर का समाधान: "शेप-शिफ्टिंग" (आकार बदलने वाला) ट्रिक
इस पेपर के लेखक, जिनची तांग और यान गुओ ने एक चतुर वर्कअराउंड (जुगाड़) निकाला। उन्होंने BPU को कागज के स्टैक पढ़ना नहीं सिखाया (क्योंकि यह कठिन होता और पूरे सिस्टम को फिर से प्रशिक्षित करने की आवश्यकता होती), बल्कि उन्होंने कागज के स्टैक को इस तरह से पुनर्गठित किया कि वे लेगो ब्रिक्स की तरह दिखने लगें।
उन्होंने इसे निम्नलिखित सरल उपमाओं का उपयोग करके किया:
लीनियर लेयर की समस्या: एक मानक ViT में, मस्तिष्क जानकारी को प्रोसेस करने के लिए "लीनियर लेयर्स" का उपयोग करता है। इन्हें ऐसे समझें जैसे एक अनुवादक (ट्रांसलेटर) जो शब्दों की एक सूची पढ़ता है और एक नई सूची आउटपुट करता है। BPU सूचियाँ नहीं पढ़ सकता; वह केवल 4D ग्रिड को समझता है।
- समाधान: लेखकों ने उस "अनुवादक" को और उसके निर्देशों को इस तरह से रीशेप (आकार दिया) किया कि वह एक 1x1 लेगो ब्रिक की तरह दिखने लगा। गणितीय रूप से, यह बिल्कुल वही काम करता है, लेकिन अब यह BPU के फैक्ट्री सेटअप में पूरी तरह फिट बैठता है। यह एक सपाट मानचित्र को सिलेंडर में रोल करने जैसा है ताकि वह एक विशिष्ट ट्यूब में फिट हो सके, बिना मानचित्र की सामग्री बदले।
लेयर नॉर्मलाइजेशन की समस्या: ViT में डेटा को संतुलित रखने के लिए "लेयर नॉर्मलाइजेशन" नामक एक चरण भी होता है (जैसे एक थर्मोस्टेट कमरे के तापमान को नियंत्रित रखता है)। BPU में इन-बिल्ट थर्मोस्टेट नहीं है।
- समाधान: लेखकों ने BPU के मौजूदा लेगो ब्रिक्स से एक "थर्मोस्टेट" बनाया। उन्होंने छोटी ईंटों (1x1 कनवल्शन) की एक विशेष श्रृंखला बनाई जो औसत (average) और वेरिएंस (variance) की गणना करती है, जिससे प्रभावी रूप से केवल उन्हीं उपकरणों का उपयोग करके एक थर्मोस्टेट की नकल की गई जो BPU के पास पहले से मौजूद थे।
"नो रिट्रेनिंग" (पुनः प्रशिक्षण की आवश्यकता नहीं) का जादू
आमतौर पर, यदि आप किसी इमारत के ब्लूप्रिंट (नक्शे) में बदलाव करते हैं, तो आपको उसे गिराकर फिर से बनाना पड़ता है। लेकिन क्योंकि लेखक अपने "लेगो ब्रिक्स" को बनाने में इतने सावधान थे कि वे मूल "कागज के स्टैक" के गणितीय रूप से समान थे, इसलिए मूल ब्लूप्रिंट (वेट्स) अभी भी पूरी तरह से काम करते हैं।
उन्हें मॉडल को फिर से प्रशिक्षित करने या उसे नई चीजें सिखाने की आवश्यकता नहीं पड़ी। उन्होंने बस अपने प्री-ट्रेन्ड "DeiT" मॉडल (जो ViT का एक लोकप्रिय, कुशल संस्करण है) को लिया, अपनी शेप-शिफ्टिंग ट्रिक लागू की, और उसे BPU को सौंप दिया। BPU ने तुरंत नए फॉर्मेट को पहचान लिया और पूरी गति से काम करना शुरू कर दिया।
परिणाम: गति बनाम सटीकता
टीम ने दो अलग-अलग कार्यों पर इसका परीक्षण किया: हजारों वस्तुओं को पहचानना (ImageNet) और फूलों को छाँटना।
- समझौता (Trade-off): जब आप किसी मॉडल को इस तरह के विशेष हार्डवेयर पर चलाने के लिए कन्वर्ट करते हैं, तो आमतौर पर आप थोड़ी सी सटीकता खो देते हैं (जैसे हाई-डेफिनिशन फोटो से थोड़ा कंप्रेस्ड JPEG पर स्विच करना)।
- बड़े ImageNet टेस्ट पर, DeiT-Base मॉडल की सटीकता में केवल 1.4% की गिरावट आई (81.8% से 80.4%)।
- फ्लावर टेस्ट पर, यह गिरावट और भी कम, मात्र 0.5% थी।
- प्रतिफल (Payoff): उस मामूली सटीकता की कमी के बदले में, मॉडल बहुत तेज हो गया।
- सबसे बड़े मॉडल (DeiT-Base) ने स्टैंडर्ड CPU की तुलना में BPU पर 3.8 गुना तेजी से काम किया।
- छोटे मॉडलों ने भी 1.3x से 2.1x तक की स्पीड वृद्धि देखी।
एक मजेदार खोज
अपने परीक्षण के दौरान, लेखकों ने कुछ दिलचस्प देखा। कभी-कभी, टेस्ट इमेज पर आधिकारिक लेबल गलत होते हैं (जैसे, "शेर" की तस्वीर को "बंदर" के रूप में लेबल किया गया है)। मूल DeiT मॉडल ने शेर को सही ढंग से पहचाना, लेकिन सिस्टम ने इसे एक त्रुटि के रूप में चिह्नित किया क्योंकि लेबल गलत था। लेखकों का नया, तेज़ मॉडल भी शेर को सही ढंग से पहचान सका। यह सुझाव देता है कि मॉडल वास्तव में आधिकारिक स्कोर की तुलना में अधिक स्मार्ट है, क्योंकि यह टेस्ट डेटा की "टाइपो" (लिखने की गलतियों) को देख सकता है।
सारांश में
यह पेपर पहली बार है जब किसी ने सफलतापूर्वक एक विज़न ट्रांसफॉर्मर (कागज के स्टैक वाला आर्किटेक्ट) को एक विशेष ब्रेन प्रोसेसिंग यूनिट (लेगो फैक्ट्री) पर चलाया है, और वह भी बिना आर्किटेक्ट को शुरू से दोबारा बनाए। गणित को हार्डवेयर के अनुकूल चतुराई से रीशेप करके, उन्होंने लगभग बिना किसी बुद्धिमत्ता की हानि के 3.8x की स्पीड वृद्धि हासिल की, जो यह साबित करता है कि ये उन्नत AI मॉडल अंततः विशेष, एम्बेडेड चिप्स पर कुशलतापूर्वक चल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।