← नवीनतम पेपर
💻 computer science

Reg4Pru: Regularisation Through Random Token Routing for Token Pruning

यह शोध पत्र Reg4Pru को प्रस्तुत करता है, जो एक नियमितीकरण (regularisation) तकनीक है जो विजन ट्रांसफॉर्मर के लिए टोकन प्रूनिंग में प्रदर्शन की हानि को कम करती है, जिससे FIVES रक्त वाहिका विभाजन डेटासेट पर औसत परिशुद्धता (average precision) में 46% का पूर्ण सुधार और 29% की गति वृद्धि प्राप्त होती है।

मूल लेखक: Julian Wyatt, Ronald Clark, Irina Voiculescu

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Julian Wyatt, Ronald Clark, Irina Voiculescu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Reg4Pru पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "भीड़भाड़ वाली पार्टी"

कल्पना कीजिए कि एक विजन ट्रांसफार्मर (आधुनिक इमेज रिकग्निशन के पीछे का AI दिमाग) एक विशाल, हाई-स्टेक्स पार्टी की तरह है। यहाँ "मेहमान" टोकन (tokens) हैं—छवि के वे छोटे हिस्से जिनका AI विश्लेषण कर रहा है।

एक मानक सेटअप में, हर एक मेहमान दूसरे हर मेहमान से बात करता है ताकि यह पता लगाया जा सके कि छवि क्या है। यह सटीकता के लिए बहुत अच्छा काम करता है, लेकिन यह अविश्वसनीय रूप से धीमा है। यदि आप मेहमानों की संख्या दोगुनी करते हैं, तो बातचीत की मात्रा चार गुना बढ़ जाती है। यह एक स्टेडियम में भरे लोगों के बीच सार्थक बातचीत करने की कोशिश करने जैसा है; इसमें बहुत समय लगता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने टोकन प्रूनिंग (Token Pruning) का आविष्कार किया। यह दरवाजे पर खड़े एक बाउंसर की तरह है जो "बोरिंग" मेहमानों (छवि के अनावश्यक हिस्सों) को बाहर निकाल देता है ताकि पार्टी तेज़ी से चल सके।

गड़बड़ी: "भूलने की बीमारी" (The "Amnesia" Effect) का प्रभाव

पेपर इस बाउंसर रणनीति के साथ एक बड़ी समस्या की पहचान करता है।

  1. ट्रेनिंग के दौरान: AI पूरी पार्टी को देखकर सीखता है, और फिर कभी-कभार दक्षता का अभ्यास करने के लिए कुछ लोगों को बाहर निकाल देता है।
  2. टेस्टिंग (Inference) के दौरान: AI समय बचाने के लिए लोगों को स्थायी रूप से बाहर निकाल देता है। लेकिन यहाँ एक पेंच है: जब इसे कोई अंतिम निर्णय लेना होता है (जैसे रक्त वाहिकाओं का विस्तृत नक्शा बनाना), तो इसे छूटे हुए विवरणों को भरने के लिए बाहर निकाले गए मेहमानों को वापस लाना पड़ता है।

समस्या: AI भ्रमित हो जाता है। "बाहर निकाले गए" मेहमान (जो लेयर्स को स्किप कर रहे थे) अंधेरे में बैठे रहे, जबकि "रखे गए" मेहमान पार्टी कर रहे थे और सीख रहे थे। जब AI इन अंधेरे में बैठे मेहमानों को वापस रोशनी में लाने की कोशिश करता है, तो वे अब फिट नहीं बैठते। उन्हें उस दौरान की "भूलने की बीमारी" (amnesia) हो गई है जो वे गायब थे। इससे AI का प्रदर्शन गिर जाता है, विशेष रूप से नेटवर्क की गहरी और अधिक जटिल परतों में। यह एक जटिल पहेली को पूरा करने की कोशिश करने जैसा है जहाँ टुकड़ों ने बीच में ही भूल दिया कि तस्वीर कैसी दिखती थी।

समाधान: Reg4Pru (द "रैंडम रिहर्सल")

लेखकों ने एक नई ट्रेनिंग तकनीक प्रस्तावित की है जिसे Reg4Pru (रेगुलराइजेशन थ्रू रैंडम टोकन रूटिंग) कहा जाता है।

इसे इस रूप में सोचें कि यह वास्तविक शो से पहले AI के लिए एक रिहर्सल गेम है।

केवल लोगों को बाहर निकालने और अच्छे की उम्मीद करने के बजाय, AI ट्रेनिंग के दौरान एक खेल खेलता है जहाँ वह यादृच्छिक (random) रूप से मेहमानों के अलग-अलग समूहों को पार्टी के अलग-अलग हिस्सों को रैंडम समय के लिए "स्किप" करने के लिए कहता है।

  • रैंडमनेस (Randomness) ही कुंजी है: कभी मेहमान A दो कमरे स्किप करता है; कभी मेहमान B पाँच कमरे स्किप करता है। "स्किप ज़ोन" हर बार बदल जाता है।
  • परिणाम: क्योंकि मेहमानों को लगातार रैंडम सेक्शन स्किप करने और फिर वापस जुड़ने के लिए कहा जाता है, वे अनुकूलन योग्य (adaptable) बनना सीख जाते हैं। वे सीखते हैं कि वे चाहे कहीं भी प्रवेश करें या वे कितनी देर तक दूर रहे हों, वे अभी भी फिट हो सकते हैं और योगदान दे सकते हैं।

यह "रैंडम रिहर्सल" एक स्टेबलाइजर के रूप में कार्य करता है। यह AI को सिखाता है कि मेहमानों को "अंधेरे" से वापस लाना सुरक्षित है, जिससे पिछले तरीकों में देखी गई भ्रम और प्रदर्शन में गिरावट को रोका जा सके।

परिणाम: तेज़ और स्मार्ट

टीम ने FIVES नामक मेडिकल डेटासेट पर इसका परीक्षण किया, जिसमें आंखों की छवियों में रक्त वाहिकाओं को ढूंढना शामिल है (एक ऐसा कार्य जिसके लिए उच्च विवरण की आवश्यकता होती है)।

  • तुलना: उन्होंने अपने तरीके की तुलना एक मानक "बाउंसर" (इस नई ट्रेनिंग के बिना प्रूनिंग) और एक "नो-प्रूनिंग" बेसलाइन से की।
  • जीत:
    • सटीकता (Accuracy): मानक प्रूनिंग विधि अंतिम चरण में बहुत खराब थी (प्रिसिजन में काफी गिरावट आई)। Reg4Pru ने इसे ठीक किया, और मानक प्रूनिंग विधि की तुलना में औसत प्रिसिजन में भारी 46% का सुधार किया।
    • गति (Speed): उन्होंने इस उच्च सटीकता को प्राप्त करते हुए भी, बिना प्रूनिंग वाले धीमे संस्करण की तुलना में 29% तेज़ प्रदर्शन किया।
    • विजुअल्स: पेपर हीटमैप दिखाता है जहाँ मानक प्रूनिंग विधि धुंधले, अस्त-व्यस्त परिणाम देती है, वहीं Reg4Pru रक्त वाहिकाओं की स्पष्ट और शार्प छवियां बनाता है, जो लगभग धीमी, नॉन-प्रूनड वर्जन के बराबर हैं।

सारांश

Reg4Pru एक ऐसी ट्रेनिंग ट्रिक है जो AI को तब भ्रमित होने से रोकती है जब वह छवि के कुछ हिस्सों को अनदेखा करके गति बढ़ाने की कोशिश करता है। ट्रेनिंग के दौरान रैंडम तरीके से "स्किपिंग" और "रीजॉइनिंग" का अभ्यास करके, AI स्थिर और सटीक रहना सीख जाता है, जिससे वह चिकित्सा के लिए आवश्यक सूक्ष्म विवरणों को खोए बिना उच्च-रिज़ॉल्यूशन वाली मेडिकल छवियों को बहुत तेज़ी से प्रोसेस कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →