← नवीनतम पेपर
💻 computer science

Transformer Accelerator (TFA): A Macro-Op INT8 Hardware Chip for Transformer Inference and Machine Translation

यह शोध पत्र ट्रांसफॉर्मर एक्सेलेरेटर (TFA) प्रस्तुत करता है, जो एक सिंथेसाइज़ेबल INT8 हार्डवेयर इंजन है जो 100% कार्यात्मक सत्यापन के साथ बिट-एक्ज़ैक्ट, एंड-टू-एंड ट्रांसफॉर्मर इन्फरेंस प्राप्त करता है और CPU बेसलाइन की तुलना में महत्वपूर्ण अनुमानित ऊर्जा और स्पीडअप सुधार प्रदान करता है।

मूल लेखक: Shashank

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shashank

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस ने ट्रांसफॉर्मर नामक एक विशिष्ट प्रकार के न्यूरल नेटवर्क का उपयोग करके बोलना, अनुवाद करना और तर्क करना सीख लिया है। ये प्रणालियाँ अविश्वसनीय रूप से शक्तिशाली हैं, लेकिन वे बहुत अधिक ऊर्जा की भूखी भी हैं। एक वाक्य में एक नया शब्द उत्पन्न करने के लिए, एक ट्रांसफॉर्मर को अपने सीखे हुए तथ्यों की पूरी स्मृति को देखना पड़ता है, जो एक ऐसी प्रक्रिया है जिसमें भारी मात्रा में डेटा को स्थानांतरित करने की आवश्यकता होती है। बैटरी से चलने वाले उपकरणों, जैसे स्मार्टफोन या सेंसर के लिए, सूचनाओं का यह निरंतर आदान-प्रदान एक बाधा बन जाता है। इन संख्याओं को मेमोरी से प्राप्त करने के लिए आवश्यक ऊर्जा अक्सर उनके साथ वास्तव में गणना करने के लिए आवश्यक ऊर्जा से कहीं अधिक होती है। यह एक मौलिक समस्या पैदा करता है: आप एक ऐसी मशीन कैसे बना सकते हैं जो सूक्ष्मता को समझने की क्षमता खोए बिना, कम शक्ति वाले छोटे हार्डवेयर पर इन जटिल भाषा मॉडलों को कुशलतापूर्वक चला सके?

शशांक नामक एक शोधकर्ता ने इस समस्या को हल करने के लिए विशेष रूप से एक नए प्रकार का हार्डवेयर चिप डिजाइन किया है। एक सामान्य-उद्देश्य वाला कंप्यूटर बनाने के बजाय जो सब कुछ करने की कोशिश करता है, यह चिप एक विशेष उपकरण है जिसे केवल भाषा अनुवाद के लिए आवश्यक विशिष्ट गणित को संभालने के लिए बनाया गया है। 'ट्रांसफॉर्मर एक्सेलेरेटर' नामक यह डिज़ाइन मॉडल को व्याख्या किए जाने वाले प्रोग्राम के रूप में नहीं, बल्कि निर्देशों के एक प्रवाह (स्ट्रीम) के रूप में मानता है जो डेटा को सीधे मेमोरी से गणना इंजन तक और फिर वापस बाहर भेजता है। लक्ष्य एक ऐसा उपकरण बनाना था जो एक पूर्व-प्रशिक्षित भाषा मॉडल को ले सके, उसे पूरी तरह से सिलिकॉन पर चला सके, और मूल, उच्च-परिशुद्धता वाले कंप्यूटर संस्करण के गणितीय रूप से समान परिणाम दे सके, लेकिन बहुत कम ऊर्जा का उपयोग करे।

इस कार्य का मूल एक ऐसा चिप है जो वैज्ञानिक कंप्यूटिंग में आमतौर पर उपयोग किए जाने वाले जटिल दशमलव अंशों के बजाय पूर्ण संख्याओं (whole numbers) का उपयोग करके संचालित होता है। इन सरल पूर्ण संख्याओं में स्विच करके, स्थानांतरित किए जाने वाले डेटा की मात्रा को नाटकीय रूप से कम कर दिया जाता है। हालाँकि, इस बदलाव के कारण आमतौर पर सटीकता में कमी आती है क्योंकि संख्याओं के सूक्ष्म अंतर राउंड ऑफ (round off) हो जाते हैं। शोधकर्ता ने पाया कि इन संख्याओं को राउंड ऑफ करने का मानक तरीका इस विशिष्ट प्रकार के भाषा मॉडल के लिए विफल रहा, जिससे अनुवाद बिगड़ गया। समाधान चिप को बदलने में नहीं, बल्कि हार्डवेयर पर लोड करने से पहले मॉडल को तैयार करने के तरीके को बदलने में था। मॉडल के आंतरिक भार (weights) पर तैयारी के चरण के दौरान एक सटीक गणितीय रोटेशन (घूर्णन) लागू करके, शोधकर्ता ने कठिन संख्याओं को सुगम बना दिया। इसने सरल, कम-शक्ति वाले चिप को मूल जटिल संस्करण के बिट-दर-बिट समान परिणाम उत्पन्न करने में सक्षम बनाया, जिससे गणित की कठिनाई को हार्डवेयर के बजाय सॉफ्टवेयर के भीतर प्रभावी रूप से छिपा दिया गया।

यह सिद्ध करने के लिए कि यह काम कर गया, शोधकर्ता ने एक पूर्ण, पूर्व-प्रशिक्षित अनुवाद मॉडल लिया जो अंग्रेजी को फ्रेंच, जर्मन और रोमानियाई में बदलने में सक्षम है, और इसे चिप के लिए निर्देशों की एक श्रृंखला में संकलित किया। फिर चिप को एक कठोर सिमुलेशन के माध्यम से चलाया गया जिसने प्रक्रिया के हर एक चरण की जाँच की। परिणामों ने दिखाया कि चिप पूरे अनुवाद पाइपलाइन को निष्पादित कर सकता है, जिसमें जटिल 'अटेंशन मैकेनिज्म' भी शामिल हैं जो मॉडल को सही शब्दों पर ध्यान केंद्रित करने की अनुमति देते हैं, और इसमें शून्य त्रुटियां थीं। जब चिप ने दस कठिन अंग्रेजी कहावतों के लिए अनुवाद उत्पन्न किया, तो यह अंतर्निहित डेटा के मामले में मूल कंप्यूटर के आउटपुट से पूरी तरह मेल खाता था। आधे मामलों में, अंतिम अनुवादित शब्द फ्लोटिंग-पॉइंट संदर्भ के समान थे, और शेष आधे मामलों में, चिप ने समान रूप से वैध अनुवाद उत्पन्न किए, जैसे कि एक ही अवधारणा के लिए अलग शब्द का उपयोग करना या अलग विराम चिह्न का उपयोग करना। इसने प्रदर्शित किया कि हार्डवेयर न केवल तेज़ था, बल्कि विश्वसनीय भी था।

प्रदर्शन में सुधार पर्याप्त था। एक मानक बाईस-थ्रेड वाले कंप्यूटर प्रोसेसर की तुलना में, चिप डिज़ाइन सबसे छोटे कॉन्फ़िगरेशन में टोकन को बीस गुना तेज़ी से उत्पन्न करने में सक्षम था, भले ही वह एक सिम्युलेटेड मेमोरी सिस्टम पर चल रहा था जो जानबूझकर धीमा और कठिन बनाया गया था। शोधकर्ताओं ने अनुमान लगाया कि इस चिप के बड़े संस्करण कंप्यूटर बेसलाइन की तुलना में लगभग दो सौ गुना तेज़ हो सकते हैं। इससे भी महत्वपूर्ण बात यह है कि ऊर्जा दक्षता आश्चर्यजनक थी। अनुमान लगाया गया कि चिप प्रति शब्द उत्पन्न करने में कंप्यूटर प्रोसेसर की तुलना में लगभग तीन हजार गुना कम ऊर्जा का उपयोग करता है। यह दक्षता चिप की क्षमता से आती है जो भार (weights) को अपनी गणना इकाइयों के पास अधिकतम गति से स्ट्रीम करता है, बजाय इसके कि अगले डेटा को लाने से पहले गणना के पूरा होने का इंतज़ार किया जाए।

यह कार्य केवल सिमुलेशन तक ही सीमित नहीं था। यह सुनिश्चित करने के लिए कि डिज़ाइन केवल एक सैद्धांतिक अभ्यास नहीं है, शोधकर्ता ने चिप के डिजिटल विवरण को वास्तविक सिलिकॉन बनाने के लिए उपयोग किए जाने वाले पूर्ण विनिर्माण प्रवाह (manufacturing flow) से प्रोसेस किया। इस प्रक्रिया ने डिज़ाइन को एक भौतिक लेआउट में बदल दिया जिसे चिप पर प्रिंट किया जा सकता है। परिणामी लेआउट ने निर्माण के लिए आवश्यक सभी सख्त नियमों को पास कर लिया, जिससे पुष्टि हुई कि डिज़ाइन भौतिक रूप से संभव है। हालांकि परीक्षण किया गया विशिष्ट संस्करण पुरानी, बड़ी विनिर्माण तकनीक का उपयोग करके बनाया गया था, सफल लेआउट ने सिद्ध किया कि आर्किटेक्चर सुदृढ़ है और इसे आधुनिक, उच्च-गति प्रक्रियाओं तक सिकोड़ा जा सकता है। एक बार उन्नत मेमोरी घटकों के साथ बनाया जाने पर, भौतिक चिप और भी छोटी और तेज़ होने की उम्मीद है।

यह परियोजना इस बात पर प्रकाश डालती है कि हम भविष्य के आर्टिफिशियल इंटेलिजेंस को कैसे बना सकते हैं। सामान्य-उद्देश्य वाले कंप्यूटरों को तेज़ बनाने के बजाय, दृष्टिकोण एक चीज़ को पूरी तरह से करने वाले छोटे, विशिष्ट इंजनों के निर्माण पर केंद्रित है। अनिश्चित संख्याओं को संभालने की कठिन गणित को सॉफ्टवेयर तैयारी चरण में अलग करके, हार्डवेयर स्वयं सरल, तेज़ और अविश्वसनीय रूप से कुशल बना रह सकता है। इस डिज़ाइन की सफलता बताती है कि हम परिष्कृत भाषा मॉडलों को 'एज' (edge) पर, उन उपकरणों में चला सकते हैं जो वर्तमान में उन्हें संभालने के लिए बहुत छोटे हैं, बिना उस सटीकता को खोए जो इन मॉडलों को उपयोगी बनाती है। आगे का मार्ग इस डिज़ाइन को बड़े मॉडलों और अधिक जटिल भाषाई कार्यों को संभालने के लिए स्केल करने का है, लेकिन नींव रखी जा चुकी है: एक छोटा, सत्यापित और निर्माण योग्य चिप जो सुपरकंप्यूटर की सटीकता और बैटरी चालित डिवाइस की दक्षता के साथ दुनिया की भाषाओं का अनुवाद कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →