INCRT: An Incremental Transformer That Determines Its Own Architecture
यह शोध पत्र INCRT को प्रस्तुत करता है, जो एक वृद्धिशील (incremental) ट्रांसफॉर्मर आर्किटेक्चर है जो कार्य आवश्यकताओं के ज्यामितीय माप के आधार पर अटेंशन हेड्स को गतिशील रूप से जोड़कर और हटाकर (pruning) प्रशिक्षण के दौरान स्वायत्त रूप से अपनी इष्टतम संरचना निर्धारित करता है, जिससे न्यूनतम, पर्याप्त मॉडल प्राप्त होते हैं जो बिना किसी प्री-ट्रेनिंग के BERT-base प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करते हैं और जिनमें काफी कम पैरामीटर्स होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने के लिए जासूसों की एक टीम बना रहे हैं।
पुराना तरीका (स्टैंडर्ड ट्रांसफॉर्मर जैसे BERT):
पारंपरिक रूप से, जब हम एक AI बनाते हैं, तो हम अनुमान लगाते हैं कि हमें कितने जासूसों की आवश्यकता होगी। हम कहते हैं, "चलिए 12 जासूसों की 12 टीमें भर्ती करते हैं!" हम उन्हें अपराध स्थल देखने से पहले ही भर्ती कर लेते हैं।
- समस्या: एक बार जांच शुरू होने के बाद, हमें एहसास होता है कि उन जासूसों में से 80% बस खाली बैठे हैं और कुछ नहीं कर रहे हैं। इस विशिष्ट अपराध के लिए उनकी आवश्यकता नहीं है। हमें उन्हें बाद में निकालना पड़ता है (जिसे "प्रूनिंग" कहा जाता है), लेकिन तब तक हमने बहुत सारा पैसा और समय उन लोगों को प्रशिक्षित करने में बर्बाद कर दिया है जो कभी उपयोगी होने वाले ही नहीं थे। यह एक पिज्जा डिलीवर करने के लिए 100 ट्रकों का बेड़ा खरीदने जैसा है।
नया तरीका (INCRT):
यह पेपर INCRT (इन्क्रीमेंटल ट्रांसफॉर्मर) पेश करता है, जो एक ऐसी जासूसी एजेंसी की तरह है जो जासूसों को एक-एक करके, केवल तभी भर्ती करती है जब वास्तव में आवश्यक हो।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "एनर्जी मीटर" (ज्यामितिक मात्रा)
अनुमान लगाने के बजाय, INCRT के पास रहस्य से जुड़ा एक विशेष "एनर्जी मीटर" होता है।
- कल्पना कीजिए कि रहस्य में अदृश्य "दिशाएं" या "सुराग" हैं जिन्हें पकड़ने की आवश्यकता है।
- शुरुआत में, AI के पास केवल एक जासूस होता है। वह सुरागों को देखता है। यदि जासूस "ऊर्जा" (महत्वपूर्ण दिशात्मक सुरागों) का एक बड़ा हिस्सा चूक जाता है, तो मीटर चिल्लाता है, "हमें और मदद की जरूरत है!"
- यदि जासूस सब कुछ पकड़ लेता है, तो मीटर शांत रहता है।
2. भर्ती करना और निकालना (विकास और प्रूनिंग)
- भर्ती करना: जैसे ही मीटर एक छूटे हुए सुराग का पता लगाता है, INCRT तुरंत एक नया जासूस भर्ती करता है जिसे विशेष रूप से उस सटीक छूटे हुए सुराग को पकड़ने के लिए प्रशिक्षित किया गया है। यह एक पूरी नई टीम को भर्ती नहीं करता है; केवल उस एक व्यक्ति को भर्ती करता है जिसकी आवश्यकता है।
- निकालना: कभी-कभी, एक जासूस अनावश्यक हो सकता है। शायद दो जासूस एक ही सुराग को पकड़ रहे हैं। सिस्टम इसे तुरंत नोटिस करता है और डुप्लिकेट को निकाल देता है।
- परिणाम: टीम का आकार गतिशील रूप से बढ़ता और घटता है जब तक कि वह "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) तक नहीं पहुँच जाता: अपराध सुलझाने के लिए पर्याप्त बड़ा, लेकिन कुशल होने के लिए पर्याप्त छोटा। कोई बर्बाद जासूस नहीं।
3. "सेल्फ-ड्राइविंग" आर्किटेक्चर
सामान्य AI में, आपको मैन्युअल रूप से एक "स्टॉप बटन" सेट करना होता है (जैसे, "100 राउंड के बाद प्रशिक्षण रोकें")।
- INCRT के पास एक आंतरिक दिशा-सूचक यंत्र (compass) है। यह भर्ती करना तब रोकता है जब "एनर्जी मीटर" शून्य पढ़ता है (इसका मतलब है कि सभी सुराग पकड़ लिए गए हैं)। यह जानता है कि इसे कब रुकना है क्योंकि गणित साबित करता है कि इसने पर्याप्त काम कर लिया है। इसे यह सुनने की ज़रूरत नहीं है कि "ठीक है, अब काफी है।"
4. "मैजिक फॉर्मूला" (प्रमेय/Theorems)
लेखकों ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे गणित से सिद्ध किया है।
- थ्योरम 1 (होमियोस्टैटिक बैलेंस): उन्होंने सिद्ध किया कि सिस्टम कभी भी भर्ती करने और निकालने के अंतहीन लूप में नहीं फंसेगा। यह हमेशा एक स्थिर, आदर्श आकार खोज लेगा और रुक जाएगा।
- थ्योरम 2 (भविष्यवाणी): उन्होंने एक फॉर्मूला खोजा जो बिल्कुल भविष्यवाणी करता है कि आपको कितने जासूसों की आवश्यकता होगी, यह इस बात पर निर्भर करता है कि रहस्य कितना "जटिल" है।
- उपमा: यदि रहस्य एक सरल "कुकी किसने चुराई?" (कम जटिलता) है, तो फॉर्मूला भविष्यवाणी करता है कि आपको 2 जासूसों की आवश्यकता है। यदि यह "राजसी गहने किसने चुराए?" (उच्च जटिलता) है, तो यह 150 की भविष्यवाणी करता है।
- शानदार बात: जब उन्होंने इसका परीक्षण किया, तो फॉर्मूला लगभग 100% सटीक था। AI को ठीक उतने ही जासूसों की आवश्यकता थी जितने कि गणित ने भविष्यवाणी की थी।
5. वास्तविक दुनिया के परिणाम
शोधकर्ताओं ने दो बहुत अलग कार्यों पर इसका परीक्षण किया:
- वायरस वर्गीकरण: SARS-CoV-2 के विभिन्न स्ट्रेन की पहचान करना।
- परिणाम: INCRT ने प्रसिद्ध BERT मॉडल की तुलना में 7 गुना कम पैरामीटर्स (जासूसों) के साथ इसे हल किया, और यह वास्तव में अधिक सटीक था। इसे बुनियादी बातें सीखने के लिए लाखों किताबें (प्री-ट्रेनिंग) पढ़ने की आवश्यकता नहीं थी; इसने बस वही सीखा जिसकी उसे वायरस के लिए आवश्यकता थी।
- सेंटिमेंट एनालिसिस (भावना विश्लेषण): यह निर्धारित करना कि मूवी रिव्यू सकारात्मक है या नकारात्मक।
- परिणाम: फिर से, इसने मानक मॉडलों की तुलना में बहुत कम संसाधनों का उपयोग किया और सर्वोत्तम संभव स्कोर के बहुत करीब पहुँच गया।
मुख्य निष्कर्ष
मानक AI मॉडल को "ओवर-पैकर्स" के रूप में सोचें। वे एक सूटकेस में 50 शर्ट पैक कर लेते हैं ताकि यदि उन्हें एक की आवश्यकता हो, तो उनके पास हो, भले ही उन्हें सप्ताहांत की यात्रा के लिए केवल एक की आवश्यकता हो।
INCRT एक स्मार्ट यात्री है। यह मौसम के पूर्वानुमान (कार्य) को देखता है, एक शर्ट पैक करता है, जाँच करता है कि क्या यह पर्याप्त है, और यदि पूर्वानुमान कहता है कि बारिश होने वाली है, तो ही एक और जोड़ता है। यह सुनिश्चित करता है कि उसका सूटकेस यात्रा के लिए बिल्कुल सही आकार का हो—हल्का, कुशल, और बिल्कुल वही जिसकी आवश्यकता थी।
संक्षेप में: INCRT को सीखते समय अपने मस्तिष्क की संरचना खुद बनाने देता है, यह सुनिश्चित करता है कि वह मस्तिष्क के उन हिस्सों पर कभी ऊर्जा बर्बाद न करे जो कोई काम नहीं कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।