LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models
LLMForge एक हार्डवेयर-जागरूक न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो विशिष्ट एज डिवाइस बाधाओं के अनुरूप अनुकूलित सब-बिलियन-पैरामीटर लैंग्वेज मॉडल्स को स्वचालित रूप से उत्पन्न करने के लिए इनफिनिट-हेड अटेंशन और एक मल्टी-बैकएंड कॉस्ट मॉडल का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में ऊर्जा दक्षता, लेटेंसी और मॉडल सटीकता में महत्वपूर्ण सुधार प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक आदर्श, नन्हा रोबोट मस्तिष्क बनाने की कोशिश कर रहे हैं जो आपके स्मार्टफोन या स्मार्टवॉच पर चल सके। आप इसे इतना समझदार बनाना चाहते हैं कि यह भाषा को समझ सके, लेकिन इतना छोटा भी कि यह आपकी जेब में समा जाए बिना बैटरी खत्म किए या फोन को गर्म किए।
समस्या यह है कि इन "मस्तिष्क" के लिए मानक "ब्लूप्रिंट" (जिन्हें ट्रांसफॉर्मर कहा जाता है) विशाल सुपरकंप्यूटरों के लिए बनाए गए थे। जब आप इन्हें एज डिवाइसेज (edge devices) के लिए सिकोड़ने की कोशिश करते हैं, तो वे अक्सर ट्रैफिक जाम में फंस जाते हैं, मेमोरी खत्म कर देते हैं, या बहुत अधिक ऊर्जा खा जाते हैं।
LLMForge एक नया टूल है जिसे शोधकर्ताओं द्वारा हल करने के लिए बनाया गया है। इसे एक अति-बुद्धिमान, हार्डवेयर-जागरूक आर्किटेक्ट के रूप में समझें जो केवल मस्तिष्क को सिकोड़ता नहीं है; बल्कि उस विशिष्ट "धरातल" के आधार पर ब्लूप्रिंट को पूरी तरह से फिर से डिजाइन करता है जिस पर वह डिवाइस रहेगा।
यहाँ बताया गया है कि LLMForge कैसे काम करता है, जिसे तीन सरल भागों में विभाजित किया गया है:
1. द इनफिनिट-हेड अटेंशन (IHA): नियमों को तोड़ना
पारंपरिक रोबोट मस्तिष्क के पास एक कठोर नियम पुस्तिका होती है। यदि आप "सोचने वाले सिरों" (प्रोसेसर जो वाक्य के विभिन्न हिस्सों को देखते हैं) की संख्या बढ़ाना चाहते हैं, तो आपको प्रत्येक सिर को छोटा करना पड़ता है। यह एक पिज्जा की तरह है: यदि आप इसे अधिक स्लाइस में काटते हैं, तो हर स्लाइस छोटी हो जाती है। यह मस्तिष्क की बुद्धिमत्ता को सीमित करता है।
LLMForge का नवाचार: यह कठोर नियम पुस्तिका को फेंक देता है। इनफिनिट-हेड अटेंशन के साथ, आर्किटेक्ट मस्तिष्क के हर एक लेयर (परत) के लिए स्वतंत्र रूप से स्लाइस की संख्या, स्लाइस का आकार और टॉपिंग का प्रकार बदल सकता है।
- उपमा: कल्पना कीजिए कि एक निर्माण दल (construction crew) जो आमतौर पर समान आकार के कमरे बनाने के लिए बाध्य होता है। LLMForge उन्हें एक जादुई उपकरण देता है जो उन्हें एक ही फ्लोर प्लान के भीतर एक विशाल बॉलरूम के बगल में एक छोटा सा क्लोजेट, फिर एक मध्यम कार्यालय बनाने की अनुमति देता है। यह संभावित ब्लूप्रिंट्स की संख्या को 400 गुना तक बढ़ाता है, जिससे वे एक विशिष्ट डिवाइस की सीमाओं में फिट होने वाला आकार ढूंढ पाते हैं।
2. फोर्ज-फॉर्मर (Forge-Former): द क्रिस्टल बॉल
एक नया मस्तिष्क ब्लूप्रिंट बनाना और उसका परीक्षण करना महंगा और धीमा है। यह एक केक बनाने और फिर यह देखने के लिए कि क्या रेसिपी काम करती है, उसे फेंक देने जैसा है। यदि आपके पास परीक्षण करने के लिए हजारों रेसिपी हैं, तो आप दिवालिया हो जाएंगे।
LLMForge का समाधान: उन्होंने एक क्रिस्टल बॉल बनाया है जिसे फोर्ज-फॉर्मर कहा जाता है।
- यह कैसे काम करता है: हर एक केक बनाने के बजाय, क्रिस्टल बॉल रेसिपी (ब्लूप्रिंट) को देखता है और भविष्यवाणी करता है कि केक का स्वाद वास्तव में कितना अच्छा होगा (मॉडल कितना स्मार्ट होगा) और यह कितनी ऊर्जा का उपयोग करेगा।
- परिणाम: यह क्रिस्टल बॉल पिछले "अनुमान लगाने" वाले टूल्स की तुलना में बहुत अधिक सटीक है। यह सिस्टम को परीक्षण करने में लगने वाले समय और ऊर्जा की भारी बचत करते हुए, बहुत कम समय में हजारों डिजाइनों का परीक्षण करने की अनुमति देता है।
3. फोर्ज-डीएसई (Forge-DSE): द मल्टी-टूल नेविगेटर
अलग-अलग डिवाइसों की अलग-अलग समस्याएं होती हैं। एक उच्च श्रेणी का ग्राफिक्स कार्ड (GPU) डेटा को कितनी तेजी से स्थानांतरित किया जा सकता है, इससे सीमित हो सकता है, जबकि एक स्मार्टवॉच में लगा छोटा चिप इस बात से सीमित हो सकता है कि वह कितनी गर्मी पैदा कर सकता है। एक डिज़ाइन जो एक के लिए उत्तम है, वह दूसरे के लिए बुरा हो सकता है।
LLMForge का दृष्टिकोण: Forge-DSE इंजन एक मल्टी-टूल वाले नेविगेटर के रूप में कार्य करता है।
- यह केवल "सबसे स्मार्ट" मॉडल की तलाश नहीं करता है। यह स्मार्ट होने, तेज़ होने और ऊर्जा-कुशल होने के बीच सबसे अच्छे संतुलन (एक "पारेटो फ्रंट") की तलाश करता है।
- यह डिजाइनों का परीक्षण चार अलग-अलग प्रकार के हार्डवेयर (जैसे एक हाई-स्पीड GPU, एक विशेष चिप और एक रिंग-आकार की चिप) के विरुद्ध करता है।
- परिणाम: सिस्टम यह महसूस करता है कि "एक ही आकार सबके लिए सही नहीं है।" यह प्रत्येक डिवाइस के लिए अलग, अद्वितीय ब्लूप्रिंट बनाता है।
- स्पीड-केंद्रित डिवाइस के लिए, यह एक मस्तिष्क बनाता है जो चौड़ा और उथला (wide and shallow) होता है।
- ऊर्जा-केंद्रित डिवाइस के लिए, यह एक मस्तिष्क बनाता है जो गहरा और संकरा (deep and narrow) होता है।
परिणाम: वास्तविक दुनिया की जीत
शोधकर्ताओं ने दो आकारों के मॉडलों (लगभग 100 मिलियन और 300 मिलियन पैरामीटर्स) पर इस सिस्टम का परीक्षण किया और इसकी तुलना SmolLM2 और Qwen जैसे मौजूदा लोकप्रिय मॉडलों से की।
- "एक्यूरेसी" मॉडल: उनके नए डिजाइनों में से एक अपने प्रतिस्पर्धियों की तुलना में अधिक स्मार्ट था (कम त्रुटि दर), भले ही इसमें कम पैरामीटर्स (यह छोटा था) थे।
- "एनर्जी" मॉडल: एक अन्य डिज़ाइन ने मानक मॉडलों की तुलना में प्रति शब्द उत्पन्न करने में 40% कम ऊर्जा का उपयोग किया।
- "स्पीड" मॉडल: एक तीसरा डिज़ाइन बोलने शुरू करने (Time-to-First-Token) और वाक्य पूरा करने में 43% तेज़ था।
सारांश
LLMForge एक ऐसा सिस्टम है जो हर डिवाइस पर एक "एक ही आकार सबके लिए उपयुक्त" (one-size-fits-all) मस्तिष्क थोपने की कोशिश करना बंद कर देता है। इसके बजाय, यह एक लचीली डिज़ाइन भाषा, एक तेज़ भविष्यवाणी करने वाली क्रिस्टल बॉल और एक स्मार्ट नेविगेटर का उपयोग करके प्रत्येक विशिष्ट हार्डवेयर के लिए एक कस्टम मस्तिष्क तैयार करता है। परिणाम स्वरूप, छोटे, तेज़ और अधिक ऊर्जा-कुशल AI मिलते हैं जो वास्तव में आपकी जेब में फिट होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।