N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation
यह शोध पत्र N-vium को प्रस्तुत करता है, जो एक मिश्रण-एग्जिट्स (mixture-of-exits) ट्रांसफार्मर है जो कई गहराइयों से भविष्यवाणियों को मिलाने के लिए टोकन-अनुकूली रूटिंग (token-adaptive routing) का उपयोग करने और ऊपरी परतों की गणना को स्थगित करने के माध्यम से मॉडल की गुणवत्ता से समझौता किए बिना मानक ट्रांसफार्मरों पर 57.9% तक वॉल-क्लॉक स्पीडअप प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक लंबी, जटिल किताब पढ़ रहे हैं, और आपको एक वाक्य में अगले शब्द का अनुमान लगाना है।
एक मानक AI मॉडल (एक "ट्रांसफॉर्मर") में, प्रक्रिया एक फैक्ट्री असेंबली लाइन की तरह है जिसमें 48 श्रमिकों की एक एकल पंक्ति में खड़ी है। आपके द्वारा टाइप किया गया हर एक शब्द को हर एक श्रमिक के पास से गुजरना होगा, एक-एक करके, प्रत्येक स्टेशन पर थोड़ा सा प्रसंस्करण (processing) प्राप्त करते हुए। केवल तब जब शब्द ने सभी 48 श्रमिकों के पास अपनी यात्रा पूरी कर ली होती है, अंतिम श्रमिक भविष्यवाणी चिल्लाकर बताता है।
समस्या क्या है? कई शब्द सरल होते हैं। "the" या "cat" जैसे शब्द को यह समझने के लिए कि आगे क्या आना चाहिए, 48 श्रमिकों की आवश्यकता नहीं होती। लेकिन मानक मॉडल उन्हें सुरक्षा के लिए फिर भी सभी के पास जाने के लिए मजबूर करता है। यह धीमा है और ऊर्जा बर्बाद करता है।
पुराना समाधान: "अर्ली एग्जिट" (शॉर्टकट)
पिछले तरीकों ने इसे ठीक करने की कोशिश की जिसमें सरल शब्दों को लाइन से जल्दी "बाहर निकलने" दिया जाता था। यदि कोई श्रमिक सोचता है, "मैं यह समझ गया," तो वह शब्द को बाहर जाने देता है।
- दोष: यह बिना अंतिम बॉस की जांच किए उत्तर का अनुमान लगाने वाले श्रमिक जैसा था। कभी-कभी वे गलत अनुमान लगाते थे। साथ ही, क्योंकि शब्द जल्दी बाहर निकल गया, फैक्ट्री भविष्य के शब्दों के लिए आवश्यक "स्मृति" (KV कैश) खो देती थी, जिससे सिस्टम को चीजों को नकली बनाने या पुन: गणना करने के लिए मजबूर होना पड़ता था, जिससे उत्तर की गुणवत्ता खराब हो जाती थी।
नया समाधान: N-vium (स्मार्ट मिश्रण)
यह शोध पत्र N-vium पेश करता है, जो खेल के नियमों को पूरी तरह से बदल देता है। एक एकल लाइन के बजाय, कल्पना करें कि फैक्ट्री के पास लाइन के विभिन्न बिंदुओं पर चार अलग-अलग निकास (exits) हैं।
N-vium कैसे काम करता है, इसके कुछ उपमाओं (analogies) का उपयोग यहाँ दिया गया है:
1. "स्मार्ट ट्रैफिक लाइट" (सीखा हुआ रूटिंग)
प्रत्येक चार निकासों पर, एक स्मार्ट ट्रैफिक लाइट (एक राउटर) होती है। यह शब्द को देखती है और निर्णय लेती है:
- "यह शब्द सरल है। चलिए इसे निकास 1 पर बाहर जाने देते हैं।"
- "यह शब्द कठिन है। इसे आगे बढ़ने दें।"
- "यह शब्द बहुत जटिल है। इसे निकास 4 तक भेजें।"
महत्वपूर्ण बात यह है कि AI अपने प्रशिक्षण के दौरान इन लाइटों को चलाना सीखता है। यह केवल अनुमान नहीं लगाता; यह जानता है कि कौन सा निकास उस विशिष्ट शब्द के लिए सबसे अच्छा उत्तर देगा।
2. "परफेक्ट ब्लेंड" (सटीक मिश्रण)
पुराने "अर्ली एग्जिट" तरीकों में, AI को एक निकास चुनना होता था और उम्मीद करनी होती थी कि वह सही है। N-vium में, AI सभी संभावित उत्तरों का एक परफेक्ट स्मूदी बनाता है।
- यह निकास 1 से उत्तर का थोड़ा सा हिस्सा लेता है।
- यह निकास 3 से थोड़ा सा मिश्रण करता है।
- यह निकास 4 का एक चुटकी हिस्सा जोड़ता है।
- परिणाम: अंतिम उत्तर गणितीय रूप से सटीक है। यह उतना ही अच्छा है जितना कि शब्द ने सभी 48 श्रमिकों के पास जाने के बाद होता, लेकिन यह तेज़ था क्योंकि "आसान" गणनाओं को शुरुआती निकासों द्वारा संभाल लिया गया था।
3. "पिगीबैक" ट्रिक (याददाश्त का नुकसान नहीं)
यह इस शोध पत्र का सबसे बड़ा जादू है। आमतौर पर, यदि कोई शब्द जल्दी बाहर निकल जाता है, तो फैक्ट्री अगले शब्द के लिए आवश्यक कार्य भूल जाती है।
- N-vium का समाधान: जब कोई शब्द जल्दी बाहर निकलता है, तो फैक्ट्री काम को फेंकती नहीं है। इसके बजाय, यह कहती है, "ठीक है, हम इस शब्द के लिए बाकी प्रोसेसिंग बाद में पूरी करेंगे।"
- जब अगला शब्द लाइन में आता है, तो फैक्ट्री दो काम एक साथ करती है: यह नए शब्द को प्रोसेस करती है, और पिछले शब्द के अधूरे काम को पिगीबैक (piggyback) करती है।
- उपमा: एक बस ड्राइवर की कल्पना करें। आमतौर पर, ड्राइवर यात्रियों को छोड़ने के लिए हर स्टॉप पर रुकता है। N-vium के साथ, ड्राइवर आसान यात्रियों को जल्दी उतार देता है, लेकिन फिर पिछले स्टॉप से "अधूरे" यात्रियों को उठा लेता है और उन्हें अगले स्टॉप पर जाने के रास्ते में छोड़ देता है, और वह भी बिना बस को रोके या धीमा किए।
परिणाम
शोधकर्ताओं ने 1.5 बिलियन "श्रमिकों" (पैरामीटर्स) तक के मॉडल बनाए।
- गति: उनका सबसे बड़ा मॉडल उसी आकार के मानक मॉडल की तुलना में 57.9% तेज़ था।
- गुणवत्ता: तेज़ होने के बावजूद, उत्तर उतने ही अच्छे थे (गुणवत्ता में कोई कमी नहीं)।
- हार्डवेयर: यह विशेष नए हार्डवेयर की आवश्यकता के बिना मानक कंप्यूटर चिप्स (GPUs) पर काम करता है।
सारांश
N-vium को एक ऐसे शॉर्टकट के रूप में न सोचें जो कोनों को काटता है, बल्कि एक स्मार्ट पुनर्गठन के रूप में देखें। यह महसूस करता है कि हर शब्द को पूरे फैक्ट्री टूर की आवश्यकता नहीं होती है। यह सरल शब्दों को जल्दी बाहर जाने देता है, उनके उत्तरों को जटिलों के साथ पूरी तरह से मिलाता है, और यह सुनिश्चित करने के लिए "पिगीबैकिंग" का उपयोग करता है कि कोई भी काम बर्बाद न हो। परिणाम एक ऐसा AI है जो कम सोचे बिना तेज़ी से सोचता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।