Reg4Pru: Regularisation Through Random Token Routing for Token Pruning
यह शोध पत्र Reg4Pru को प्रस्तुत करता है, जो एक नियमितीकरण (regularisation) तकनीक है जो विजन ट्रांसफॉर्मर के लिए टोकन प्रूनिंग में प्रदर्शन की हानि को कम करती है, जिससे FIVES रक्त वाहिका विभाजन डेटासेट पर औसत परिशुद्धता (average precision) में 46% का पूर्ण सुधार और 29% की गति वृद्धि प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Reg4Pru पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "भीड़भाड़ वाली पार्टी"
कल्पना कीजिए कि एक विजन ट्रांसफार्मर (आधुनिक इमेज रिकग्निशन के पीछे का AI दिमाग) एक विशाल, हाई-स्टेक्स पार्टी की तरह है। यहाँ "मेहमान" टोकन (tokens) हैं—छवि के वे छोटे हिस्से जिनका AI विश्लेषण कर रहा है।
एक मानक सेटअप में, हर एक मेहमान दूसरे हर मेहमान से बात करता है ताकि यह पता लगाया जा सके कि छवि क्या है। यह सटीकता के लिए बहुत अच्छा काम करता है, लेकिन यह अविश्वसनीय रूप से धीमा है। यदि आप मेहमानों की संख्या दोगुनी करते हैं, तो बातचीत की मात्रा चार गुना बढ़ जाती है। यह एक स्टेडियम में भरे लोगों के बीच सार्थक बातचीत करने की कोशिश करने जैसा है; इसमें बहुत समय लगता है।
इसे ठीक करने के लिए, शोधकर्ताओं ने टोकन प्रूनिंग (Token Pruning) का आविष्कार किया। यह दरवाजे पर खड़े एक बाउंसर की तरह है जो "बोरिंग" मेहमानों (छवि के अनावश्यक हिस्सों) को बाहर निकाल देता है ताकि पार्टी तेज़ी से चल सके।
गड़बड़ी: "भूलने की बीमारी" (The "Amnesia" Effect) का प्रभाव
पेपर इस बाउंसर रणनीति के साथ एक बड़ी समस्या की पहचान करता है।
- ट्रेनिंग के दौरान: AI पूरी पार्टी को देखकर सीखता है, और फिर कभी-कभार दक्षता का अभ्यास करने के लिए कुछ लोगों को बाहर निकाल देता है।
- टेस्टिंग (Inference) के दौरान: AI समय बचाने के लिए लोगों को स्थायी रूप से बाहर निकाल देता है। लेकिन यहाँ एक पेंच है: जब इसे कोई अंतिम निर्णय लेना होता है (जैसे रक्त वाहिकाओं का विस्तृत नक्शा बनाना), तो इसे छूटे हुए विवरणों को भरने के लिए बाहर निकाले गए मेहमानों को वापस लाना पड़ता है।
समस्या: AI भ्रमित हो जाता है। "बाहर निकाले गए" मेहमान (जो लेयर्स को स्किप कर रहे थे) अंधेरे में बैठे रहे, जबकि "रखे गए" मेहमान पार्टी कर रहे थे और सीख रहे थे। जब AI इन अंधेरे में बैठे मेहमानों को वापस रोशनी में लाने की कोशिश करता है, तो वे अब फिट नहीं बैठते। उन्हें उस दौरान की "भूलने की बीमारी" (amnesia) हो गई है जो वे गायब थे। इससे AI का प्रदर्शन गिर जाता है, विशेष रूप से नेटवर्क की गहरी और अधिक जटिल परतों में। यह एक जटिल पहेली को पूरा करने की कोशिश करने जैसा है जहाँ टुकड़ों ने बीच में ही भूल दिया कि तस्वीर कैसी दिखती थी।
समाधान: Reg4Pru (द "रैंडम रिहर्सल")
लेखकों ने एक नई ट्रेनिंग तकनीक प्रस्तावित की है जिसे Reg4Pru (रेगुलराइजेशन थ्रू रैंडम टोकन रूटिंग) कहा जाता है।
इसे इस रूप में सोचें कि यह वास्तविक शो से पहले AI के लिए एक रिहर्सल गेम है।
केवल लोगों को बाहर निकालने और अच्छे की उम्मीद करने के बजाय, AI ट्रेनिंग के दौरान एक खेल खेलता है जहाँ वह यादृच्छिक (random) रूप से मेहमानों के अलग-अलग समूहों को पार्टी के अलग-अलग हिस्सों को रैंडम समय के लिए "स्किप" करने के लिए कहता है।
- रैंडमनेस (Randomness) ही कुंजी है: कभी मेहमान A दो कमरे स्किप करता है; कभी मेहमान B पाँच कमरे स्किप करता है। "स्किप ज़ोन" हर बार बदल जाता है।
- परिणाम: क्योंकि मेहमानों को लगातार रैंडम सेक्शन स्किप करने और फिर वापस जुड़ने के लिए कहा जाता है, वे अनुकूलन योग्य (adaptable) बनना सीख जाते हैं। वे सीखते हैं कि वे चाहे कहीं भी प्रवेश करें या वे कितनी देर तक दूर रहे हों, वे अभी भी फिट हो सकते हैं और योगदान दे सकते हैं।
यह "रैंडम रिहर्सल" एक स्टेबलाइजर के रूप में कार्य करता है। यह AI को सिखाता है कि मेहमानों को "अंधेरे" से वापस लाना सुरक्षित है, जिससे पिछले तरीकों में देखी गई भ्रम और प्रदर्शन में गिरावट को रोका जा सके।
परिणाम: तेज़ और स्मार्ट
टीम ने FIVES नामक मेडिकल डेटासेट पर इसका परीक्षण किया, जिसमें आंखों की छवियों में रक्त वाहिकाओं को ढूंढना शामिल है (एक ऐसा कार्य जिसके लिए उच्च विवरण की आवश्यकता होती है)।
- तुलना: उन्होंने अपने तरीके की तुलना एक मानक "बाउंसर" (इस नई ट्रेनिंग के बिना प्रूनिंग) और एक "नो-प्रूनिंग" बेसलाइन से की।
- जीत:
- सटीकता (Accuracy): मानक प्रूनिंग विधि अंतिम चरण में बहुत खराब थी (प्रिसिजन में काफी गिरावट आई)। Reg4Pru ने इसे ठीक किया, और मानक प्रूनिंग विधि की तुलना में औसत प्रिसिजन में भारी 46% का सुधार किया।
- गति (Speed): उन्होंने इस उच्च सटीकता को प्राप्त करते हुए भी, बिना प्रूनिंग वाले धीमे संस्करण की तुलना में 29% तेज़ प्रदर्शन किया।
- विजुअल्स: पेपर हीटमैप दिखाता है जहाँ मानक प्रूनिंग विधि धुंधले, अस्त-व्यस्त परिणाम देती है, वहीं Reg4Pru रक्त वाहिकाओं की स्पष्ट और शार्प छवियां बनाता है, जो लगभग धीमी, नॉन-प्रूनड वर्जन के बराबर हैं।
सारांश
Reg4Pru एक ऐसी ट्रेनिंग ट्रिक है जो AI को तब भ्रमित होने से रोकती है जब वह छवि के कुछ हिस्सों को अनदेखा करके गति बढ़ाने की कोशिश करता है। ट्रेनिंग के दौरान रैंडम तरीके से "स्किपिंग" और "रीजॉइनिंग" का अभ्यास करके, AI स्थिर और सटीक रहना सीख जाता है, जिससे वह चिकित्सा के लिए आवश्यक सूक्ष्म विवरणों को खोए बिना उच्च-रिज़ॉल्यूशन वाली मेडिकल छवियों को बहुत तेज़ी से प्रोसेस कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।