← नवीनतम पेपर
💬 NLP

Revisiting the Shape Convention of Transformer Language Models

यह शोध पत्र एक गहरे हॉर्सग्लास (hourglass) के आकार के FFN का प्रस्ताव करके ट्रांसफॉर्मर्स में पारंपरिक संकीर्ण-चौड़ा-संकीर्ण (narrow-wide-narrow) MLP डिज़ाइन को चुनौती देता है, और अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि यह आर्किटेक्चर न केवल मानक मॉडलों के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करता है, बल्कि अधिक कुशल पैरामीटर आवंटन को भी सक्षम बनाता है, जैसे कि निश्चित बजट के भीतर बेहतर परिणाम प्राप्त करने के लिए छिपे हुए आयामों (hidden dimensions) का विस्तार करना।

मूल लेखक: Feng-Ting Liao, Meng-Hsi Chen, Guan-Ting Yi, Da-shan Shiu

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Feng-Ting Liao, Meng-Hsi Chen, Guan-Ting Yi, Da-shan Shiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ट्रांसफॉर्मर लैंग्वेज मॉडल (वही तरह का AI जो कहानियाँ लिखता है, सवालों के जवाब देता है और आपसे बातें करता है) की कल्पना एक विशाल, बहु-मंजिला फैक्ट्री के रूप में करें। इसके अंदर, जानकारी का हर हिस्सा (शब्द या टोकन) हर मंजिल पर दो मुख्य वर्कस्टेशन से गुजरता है:

  1. अटेंशन स्टेशन (Attention Station): यह वह जगह है जहाँ फैक्ट्री के कर्मचारी पूरे वाक्य को देखते हैं ताकि संदर्भ (context) को समझ सकें। "ओह, यह शब्द वहाँ मौजूद उस शब्द को संदर्भित कर रहा है।"
  2. FFN स्टेशन (Feed-Forward Network): यह वह जगह है जहाँ कर्मचारी जानकारी को प्रोसेस करने और उसे परिष्कृत (refine) करने का भारी काम करते हैं।

वर्षों तक, FFN स्टेशन के लिए "मानक ब्लूप्रिंट" एक नैरो-वाइड-नैरो (Narrow-Wide-Narrow) आकार था। इसे एक फनल (कीप) की तरह समझें जो जानकारी को नीचे दबाता है, फिर अचानक इसे एक विशाल, चौड़े कमरे में विस्फोट की तरह फैला देता है ताकि जटिल गणनाएँ की जा सकें, और फिर इसे वापस दबा देता है। उद्योग ने यह मान लिया था कि यह "चौड़ा कमरा" इसलिए आवश्यक था क्योंकि इसमें फैक्ट्री के अधिकांश कर्मचारी (पैरामीटर्स) समाहित थे।

बड़ा विचार: द ऑवरग्लास (The Hourglass)
इस शोध पत्र के लेखकों ने एक सरल प्रश्न पूछा: क्या इस चौड़े कमरे को वास्तव में इतना चौड़ा होने की आवश्यकता है? या यह केवल एक आदत है जिससे हम फंस गए हैं?

उन्होंने एक नया ब्लूप्रिंट प्रस्तावित किया जिसे ऑवरग्लास FFN (Hourglass FFN) कहा गया। एक विशाल चौड़े कमरे के बजाय, इसकी कल्पना कई छोटे, एक के ऊपर एक रखे गए "ऑवरग्लास" आकारों के रूप में करें।

  • आकार: यह चौड़ा होकर शुरू होता है, एक संकीर्ण बाधा (bottleneck) में सिकुड़ जाता है, और फिर वापस फैलता है।
  • स्टैक (Stack): इसे केवल एक बार करने के बजाय, वे इन ऑवरग्लास आकारों को एक के ऊपर एक रखते हैं, जो "रेसिड्यूअल पाथवेज़" (जैसे एक कन्वेयर बेल्ट जो सूचना को चरणों को छोड़ने की अनुमति देती है) द्वारा जुड़े होते हैं।

उपमा: ट्रैफिक जाम बनाम एक्सप्रेस लेन
पारंपरिक "वाइड" FFN को एक विशाल, भीड़भाड़ वाले हाईवे की तरह समझें। इसमें ट्रैफिक को संभालने के लिए बहुत सारे लेन (पैरामीटर्स) हैं, लेकिन इसे बनाना और बनाए रखना महंगा है।

नया "ऑवरग्लास" FFN एक स्मार्ट ट्रैफिक सिस्टम की तरह है जिसमें कुछ संकीर्ण सुरंगें हैं।

  • चालक (The Trick): ट्रैफिक को एक संकीर्ण सुरंग के माध्यम से भेजने के लिए मजबूर करके, और फिर इसे फिर से फैलने देकर, सिस्टम अधिक कुशल होने के लिए मजबूर होता है। यह शोर (noise) को छान देता है और सबसे महत्वपूर्ण संकेतों पर ध्यान केंद्रित करता है।
  • बोनस: क्योंकि "सुरंग" संकीर्ण है, आप निर्माण के बहुत सारे पैसे बचा लेते हैं (पैरामीटर्स)।

हमने बचाए हुए पैसों का क्या किया?
सबसे रोमांचक हिस्सा यह है। पुराने डिज़ाइन में, FFN स्टेशन लगभग 75% बजट खा जाता था। नए ऑवरग्लास डिज़ाइन के साथ, उन्होंने उस बजट का एक बड़ा हिस्सा बचा लिया।

केवल फैक्ट्री को सस्ता बनाने के बजाय, उन्होंने बचाई गई बचत को पुनर्निवेशित (reinvested) किया। उन्होंने बचाए गए कर्मचारियों को अटेंशन स्टेशन में स्थानांतरित कर दिया।

  • परिणाम: अब फैक्ट्री के पास बहुत बेहतर "अटेंशन" टीम है जो शब्दों के बीच संदर्भ और संबंधों को बहुत बेहतर तरीके से समझ सकती है, जबकि "प्रोसेसिंग" टीम अधिक सुव्यवस्थित (leaner) लेकिन गहरी (deeper) है।

निष्कर्ष (रेस के परिणाम)
लेखकों ने अलग-अलग आकार की कई फैक्ट्रियां बनाईं (113-मिलियन-पैरामीटर वाले छोटे मॉडल से लेकर 1-बिलियन-पैरामीटर वाले मॉडल तक) परीक्षण करने के लिए।

  1. छोटे से मध्यम आकार की फैक्ट्रियां (लग' लगभग 900M पैरामीटर्स तक): ऑवरग्लास डिज़ाइन जीत गया। इसने पारंपरिक वाइड डिज़ाइन की तुलना में बेहतर परिणाम दिए (कम भ्रम, बेहतर तर्क)। इसने साबित कर दिया कि अच्छा काम करने के लिए आपको एक विशाल चौड़े कमरे की आवश्यकता नहीं है; कई कुशल, स्टैक्ड ऑवरग्लास बेहतर काम करते हैं।
  2. 1-बिलियन पैरामीटर वाली फैक्ट्री: इस विशाल स्तर पर, ऑवरग्लास डिज़ाइन ने पारंपरिक डिज़ाइन के समान प्रदर्शन किया। यह हारा नहीं, लेकिन इसने बहुत बड़े अंतर से जीत भी हासिल नहीं की। यह सुझाव देता है कि हालांकि ऑवरग्लास शानदार है, फिर भी बहुत बड़े मॉडलों के लिए प्रसंस्करण के लिए न्यूनतम "प्रोसेसिंग रूम" की आवश्यकता होती है।
  3. स्वीट स्पॉट (The Sweet Spot): उन्होंने पाया कि सबसे अच्छा संतुलन केवल चीजों को चौड़ा या गहरा बनाने के बारे में नहीं था। यह एक विशिष्ट "U-आकार" के संतुलन को खोजने के बारे में था जहाँ मॉडल न तो बहुत पतला (बहुत गहरा) हो और न ही बहुत मोटा (बहुत चौड़ा)।

मुख्य निष्कर्ष (The Takeaway)
लंबे समय तक, AI इंजीनियरों को लगा कि एक अच्छा लैंग्वेज मॉडल बनाने का एकमात्र तरीका "नैरो-वाइड-नैरो" आकार था। यह शोध पत्र दिखाता है कि आकार वास्तव में एक आदत है, भौतिकी का नियम नहीं।

एक डीप ऑवरग्लास (Deep Hourglass) आकार में स्विच करके, हम:

  • ऐसे मॉडल बना सकते हैं जो उतने ही स्मार्ट हैं लेकिन कम संसाधनों का उपयोग करते हैं।
  • अपना ध्यान "अटेंशन" वाले हिस्से को मजबूत करने की ओर स्थानांतरित कर सकते हैं, जो मॉडल को संदर्भ समझने में बेहतर मदद करता है।
  • यह सिद्ध कर सकते हैं कि कभी-कभी, "चौड़ा और उथला" होने के बजाय "संकीर्ण लेकिन गहरा" होना अधिक स्मार्ट होता है।

संक्षेप में: यह पेपर सुझाव देता है कि हमें विशाल, चौड़े प्रोसेसिंग रूम बनाना बंद करना चाहिए और कुशल, स्टैक्ड ऑवरग्लास बनाना शुरू करना चाहिए, जिससे हम बातचीत को समझने में अधिक मानसिक शक्ति (brainpower) लगाने में सक्षम हो सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →