← नवीनतम पेपर
💬 NLP

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

यह शोध पत्र बाउंडेड हाइपरबोलिक टैन (BHyT) का प्रस्ताव करता है, जो प्री-लेयर नॉर्मलाइज़ेशन के लिए एक स्थिर और कुशल ड्रॉप-इन रिप्लेसमेंट है जो डेटा-संचालित इनपुट बाउंडिंग के माध्यम से गहराई-संबंधी अस्थिरता को समाप्त करता है और RMSNorm की तुलना में तेज़ प्रशिक्षण और उच्च थ्रूपुट प्राप्त करता है।

मूल लेखक: Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

प्रकाशित 2026-06-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ब्लॉकों से एक बहुत ऊँचा टॉवर बनाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "ब्लॉक" एक कंप्यूटर प्रोग्राम (एक लार्ज लैंग्वेज मॉडल) की परतें (layers) हैं जो बोलना और तर्क करना सीखती हैं।

लंबे समय तक, इन टावरों को बनाने का मानक तरीका "प्री-लेयर नॉर्मलाइज़ेशन" (Pre-Layer Normalization या Pre-LN) नामक टूल का उपयोग करना था। इस टूल को एक क्वालिटी कंट्रोल इंस्पेक्टर के रूप में सोचें जो हर एक मंजिल पर रुकता है, ब्लॉकों को मापता है, यह जाँचता है कि वे सही आकार के हैं या नहीं, और अगला तल जोड़ने से पहले उन्हें सुचारू (smooth) बनाता है।

समस्या: इंस्पेक्टर बहुत धीमा है और टॉवर डगमगा जाता है

पेपर दो मुख्य समस्याओं की ओर इशारा करता है:

  1. यह धीमा है: क्योंकि इंस्पेक्टर को हर एक मंजिल पर रुककर गणित करना पड़ता है, इसलिए निर्माण प्रक्रिया धीमी हो जाती है। आप जितने अधिक तल जोड़ेंगे, पूरा प्रोजेक्ट उतना ही धीमा होता जाएगा।
  2. "गहराई का अभिशाप" (The Curse of Depth): जैसे-जैसे टॉवर ऊँचा होता जाता है, ऊपरी मंजिलों के ब्लॉक बहुत बड़े और डगमगाते हुए होने लगते हैं। टॉवर में ऊपर की ओर जाने वाला "सिग्नल" (सूचना) विकृत हो जाता है, जिससे टॉवर अस्थिर हो जाता है। पेपर इसे "डेप्थ का अभिशाप" कहता है।

कुछ लोगों ने इस पुराने तरीके को ठीक करने के लिए इंस्पेक्टर को पूरी तरह से हटाने और केवल एक सरल "tanh" फंक्शन (एक गणितीय वक्र जो संख्याओं को सिकोड़ देता है) का उपयोग करने की कोशिश की। यह तेज़ था, जैसे बिना रुके टॉवर बनाना। लेकिन, इंस्पेक्टर के बिना, ऊपरी मंजिलों के ब्लॉक फिर से बहुत बड़े हो गए और टॉवर अस्थिर हो गया।

समाधान: BHyT (स्मार्ट, बाउंडेड बिल्डर)

लेखकों ने BHyT (बाउंडेड हाइपरबोलिक टैनह - Bounded Hyperbolic Tanh) नामक एक नया तरीका प्रस्तावित किया है। आप BHyT को एक स्मार्ट, स्व-विनियमित बिल्डर के रूप में देख सकते है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है।

यहाँ बताया गया है कि BHyT कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "स्पीड बंप" (बाउंडेड इनपुट)
ब्लॉकों को टॉवर में ऊपर की ओर अनंत रूप से बढ़ने देने के बजाय, BHyT एक "स्पीड बंप" या एक बाड़ा (fence) लगा देता है। यह एक गणितीय नियम (जो चेबिशेव असमानता पर आधारित है, जो एक सुरक्षा जाल की तरह है) का उपयोग करता है यह कहने के लिए कि, "डेटा कितना भी बड़ा क्यों न हो जाए, हम इसे अगले स्तर पर जाने से पहले धीरे से वापस एक सुरक्षित, आरामदायक रेंज में सिकोड़ देंगे।"

  • यह कैसे मदद करता है: यह ब्लॉकों को बहुत बड़ा होने से रोकता है (जिससे अस्थिरता आती है) बिना हर एक चरण पर पूर्ण, धीमी जांच की आवश्यकता के।

2. "एक बार की जांच" (वेरिएंस एप्रोक्सिमेशन)
पुराना तरीका (Pre-LN) हर मंजिल पर ब्लॉकों का सटीक आकार निकालता था। BHyT स्मार्ट है:

  • यह मंजिल के निचले हिस्से में एक बार सटीक माप करता है।
  • मंजिल के दूसरे भाग के लिए, दोबारा मापने के बजाय, यह पहले माप और टॉवर के ज्ञात डिज़ाइन के आधार पर एक त्वरित, शिक्षित अनुमान (एप्रोक्सिमेशन) का उपयोग करता है।
  • यह कैसे मदद करता है: यह बहुत सारा समय और कंप्यूटर पावर बचाता है क्योंकि इसे हर बार हर एक ईंट को दो बार गिनने के लिए नहीं रुकना पड़ता है।

परिणाम: एक तेज़, स्थिर टॉवर

पेपर ने अलग-अलग आकार के मॉडलों (374-मिलियन ब्लॉक वाले छोटे टॉवर से लेकर 3-बिलियन ब्लॉक वाले बड़े टॉवर तक) पर इस नए बिल्डर का परीक्षण किया। उन्हें यहाँ क्या पता चला:

  • स्थिरता (Stability): BHyT के साथ बनाए गए टॉवर डगमगाए नहीं। "ब्लॉक" (एक्टिवेशन्स) पूरे रास्ते सही आकार के रहे, जिससे "डेप्थ का अभिशाप" रुक गया।
  • गति (Speed): क्योंकि BHyT ने हर स्टेप पर भारी गणित करने के लिए नहीं रोका, इसने ट्रेनिंग के दौरान 1.6% तेज़ी से टॉवर बनाया और टेक्स्ट जनरेशन में 1.77% तेज़ी दिखाई।
  • गुणवत्ता (Quality): भले ही यह तेज़ था, लेकिन अंतिम टॉवर उतना ही स्मार्ट था। इसने भाषा परीक्षणों और तर्क पहेलियों पर पुराने तरीकों की तुलना में बेहतर प्रदर्शन किया, और फाइन-ट्यूनिंग के बाद भी यह जो सीखा था उसे "भूलता" नहीं है।

सारांश

संक्षेप में, पेपर का तर्क है कि BHyT एआई मॉडल बनाने का एक बेहतर तरीका है। यह धीमे, दोहराव वाले "क्वालिटी इंस्पेक्टर" को एक स्मार्ट, बाउंडेड बिल्डर से बदल देता है जो डेटा को एक सुरक्षा बाड़े के साथ नियंत्रण में रखता है और समय बचाने के लिए त्वरित अनुमानों का उपयोग करता है। यह हमें अपनी बुद्धिमत्ता से समझौता किए बिना ऊंचे, अधिक स्थिर और तेज़ एआई मॉडल बनाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →