← नवीनतम पेपर
📊 statistics

Uniform Scaling Limits in AdamW-Trained Transformers

यह शोध पत्र यह स्थापित करता है कि AdamW-प्रशिक्षित ट्रांसफॉर्मर में छिपी अवस्थाओं (hidden states) और बैकप्रोपैगेटेड चरों (backpropagated variables) की संयुक्त गतिशीलता, जैसे-जैसे गहराई और अटेंशन हेड्स की संख्या बढ़ती है, एक फॉरवर्ड-बैकवर्ड ODE सिस्टम (विशेष रूप से कॉज़ल मास्किंगिंग की अनुपस्थिति में एक McKean-Vlasov ODE) की ओर समान रूप से अभिसरित होती है, जो कवरिंग आर्गुमेंट्स पर निर्भर किए बिना आयाम-स्वतंत्र त्रुटि सीमाएं प्रदान करती है।

मूल लेखक: William Gibson, Christoph Reisinger

प्रकाशित 2026-05-13
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William Gibson, Christoph Reisinger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Uniform Scaling Limits in AdamW-Trained Transformers" शोध पत्र की सरल भाषा और रचनात्मक उपमाओं (analogies) का हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: एक अराजक भीड़ से एक सुव्यवस्थित नदी तक

कल्पना कीजिए कि एक Transformer (आधुनिक चैटबॉट्स के पीछे का AI प्रकार) एक विशाल, बहुमंजिला इमारत है।

  • मंजिलें (Floors): इस इमारत में LL मंजिलें (layers) हैं।
  • कर्मचारी (Workers): प्रत्येक मंजिल पर, HH टीमों के कर्मचारी (attention heads) हैं जो नीचे से आ रही जानकारी को देखते हैं।
  • डेटा (Data): जानकारी "टोकन्स" (शब्द या इमेज पैचेस) की एक धारा है जो इमारत में ऊपर की ओर बढ़ रही है।
  • प्रशिक्षण (Training): इस इमारत को AdamW नामक ऑप्टिमाइज़र का उपयोग करके "प्रशिक्षित" किया जा रहा है। AdamW को एक बहुत ही सख्त, बुद्धिमान फोरमैन (सुपरवाइजर) के रूप में समझें जो गलतियों को कम करने के लिए श्रमिकों के औजारों को समायोजित करता है, जबकि उनके औजारों के आकार को बहुत बड़ा और अस्थिर होने से रोकने के लिए उन्हें धीरे से सिकोड़ता भी है (इसे weight decay कहा जाता है)।

समस्या:
जब यह इमारत बहुत बड़ी हो जाती है (हजारों मंजिलें और लाखों कर्मचारी), तो हर एक कर्मचारी की गति को ट्रैक करना असंभव हो जाता है। यह एक विशाल रेत के तूफान में रेत के हर एक कण के सटीक पथ को ट्रैक करने की कोशिश करने जैसा है। आमतौर पर, गणितज्ञ कहते हैं, "यदि हम पूरे तूफान को समझना चाहते हैं, तो हमें हर एक कण को गिनना होगा," जिससे गणित इस बात पर निर्भर हो जाता है कि टोकन (grains) की संख्या कितनी है।

बड़ी उपलब्धि (Breakthrough):
यह शोध पत्र सिद्ध करता है कि आपको हर कण को गिनने की आवश्यकता नहीं है। भले ही आपके पास एक अरब टोकन हों, पूरे सिस्टम का व्यवहार एक सुचारू, अनुमानित प्रवाह (flow) में बदल जाता है जो इस बात पर निर्भर नहीं करता कि आपके पास कितने टोकन हैं।

मुख्य उपमा: "इंटरेक्टिंग पार्टिकल सिस्टम" (Interacting Particle System)

लेखक छिपी हुई अवस्थाओं (नेटवर्क के माध्यम से बहने वाले डेटा) को एक इंटरेक्टिंग पार्टिकल सिस्टम (IPS) के रूप में मॉडल करते हैं।

  • पुराना तरीका: कल्पना कीजिए कि एक कमरा लोगों (टोकन्स) से भरा है जो एक-दूसरे से बात करने की कोशिश कर रहे हैं। यदि आप जानना चाहते हैं कि समूह क्या सोच रहा है, तो आपको हर एक बातचीत को सुनना होगा। यदि कमरा बड़ा होता है, तो गणित कठिन हो जाता है।
  • नया तरीका: लेखक दिखाते हैं कि यदि आपके पास पर्याप्त लोग हैं, तो आप व्यक्तियों को सुनना बंद कर सकते हैं और केवल कमरे के "औसत वाइब" (average vibe) को सुन सकते हैं।
    • व्यक्ति A को व्यक्ति B से बात करते हुए ट्रैक करने के बजाय, आप ट्रैक करते हैं कि "औसत व्यक्ति" "औसत वाइब" के साथ कैसे इंटरैक्ट करता है।
    • यह व्यक्तिगत अपडेट के एक अराजक, असतत (discrete) मलबे को डेटा की एक सुचारू, निरंतर "नदी" (River of Data) में बदल देता है।

"यूनिफॉर्म" जादू: इससे कोई फर्क नहीं पड़ता कि आपके पास कितने टोकन हैं

इस शोध पत्र का सबसे आश्चर्यजनक हिस्सा शब्द "Uniform" है।

गणित में, जब आप यह सिद्ध करने की कोशिश करते हैं कि कुछ चीज़ सभी संभावित इनपुट के लिए काम करती है, तो आपको आमतौर पर "सबसे खराब स्थिति" (worst-case scenario) की चिंता करनी पड़ती है। यदि आपके पास 100 टोकन हैं, तो गणित एक चीज़ है। यदि आपके पास 1,000,000 टोकन हैं, तो गणित आमतौर पर बहुत अधिक जटिल हो जाता है, और त्रुटि सीमाएँ (error bounds - कि आपका अनुमान कितना गलत हो सकता है) खराब हो जाती हैं।

  • शोध पत्र का दावा: लेखक सिद्ध करते हैं कि वास्तविक, अस्त-व्यस्त ट्रांसफार्मर और उनके सुचारू, निरंतर "नदी" मॉडल के बीच की त्रुटि (error) टोकन बढ़ने के साथ बढ़ती नहीं है
  • रूपक (Metaphor): कल्पना कीजिए कि आप मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं। आमतौर पर, यदि आप अधिक मौसम स्टेशन (टोकन्स) जोड़ते हैं, तो आपका भविष्यवाणी मॉडल अधिक जटिल और हल करने में कठिन हो जाता है। यह शोध पत्र कहता है, "नहीं। एक बार जब आपके पास पर्याप्त स्टेशन हो जाते हैं, तो मौसम का पैटर्न एक सुचारू, अनुमानित वक्र (curve) बन जाता है जिसे गणना करना उतना ही आसान है चाहे आपके पास 10 स्टेशन हों या 10 मिलियन।"

उन्होंने यह "कवरिंग आर्गुमेंट" (जो कि एक शहर में ट्रैफ़िक को समझने के लिए हर एक गली का मानचित्र बनाने जैसा है) नामक गणितीय चाल से बचकर हासिल किया। इसके बजाय, उन्होंने "कंसंट्रेशन ऑफ मेजर" (concentration of measure) नामक तकनीक का उपयोग किया, जो यह पहचानने जैसा है कि एक विशाल भीड़ में, औसत व्यवहार इतना स्थिर होता है कि आउटलेयर्स (outliers) मायने नहीं रखते।

AdamW की भूमिका: "डिकपल्ड" (Decoupled) फोरमैन

यह शोध पत्र विशेष रूप से AdamW पर ध्यान केंद्रित करता है, जो इन मॉडलों को प्रशिक्षित करने के लिए मानक ऑप्टिमाइज़र है।

  • समस्या: कई गणितीय मॉडलों में, जो "औजार" (पैरामीटर्स) श्रमिक उपयोग करते हैं, वे अनंत रूप से बड़े और अनियंत्रित हो सकते हैं, जिससे गणित बिगड़ जाता है।
  • समाधान: AdamW में एक विशेष विशेषता है जिसे "डिकपल्ड वेट डिके" (decoupled weight decay) कहा जाता है। यह एक ऐसे फोरमैन की तरह है जो कहता है, "आप गलतियों को ठीक करने के लिए अपने औजारों को समायोजित कर सकते हैं, लेकिन मैं हर दिन आपके औजारों को वापस एक सुरक्षित आकार में धीरे से सिकोड़ दूँगा।"
  • परिणाम: यह सभी श्रमिकों के औजारों को एक निश्चित, सुरक्षित "बॉक्स" (एक कॉम्पैक्ट सेट) के भीतर रखता है। क्योंकि औजार बहुत अधिक अनियंत्रित नहीं होते, इसलिए गणित स्थिर रहता है, और लेखक यह सिद्ध कर सकते हैं कि उनका "नदी" मॉडल लंबे प्रशिक्षण सत्रों के दौरान भी पूरी तरह काम करता है।

"फ्लो मैप" (Flow Map) और "बैकवर्ड रिवर" (Backward River)

यह शोध पत्र केवल आगे की ओर जाने वाले डेटा (Input \to Output) को ही नहीं देखता है। यह बैकप्रोपैगेशन (मॉडल अपनी गलतियों से कैसे सीखता है) को भी देखता है।

  • फॉरवर्ड रिवर (Forward River): डेटा इमारत में ऊपर की ओर बहता है।
  • बैकवर्ड रिवर (Backward River): ग्रेडिएंट्स (सीखी गई सीख) इमारत में नीचे की ओर बहते हैं।
  • सिस्टम: लेखक दिखाते हैं कि फॉरवर्ड डेटा और बैकवर्ड सबक दोनों ही विपरीत दिशाओं में बहने वाली दो सिंक्रोनाइज्ड (तालमेल वाली) नदियों के साधारण अंतर समीकरणों (Ordinary Differential Equations - ODEs) में परिवर्तित हो जाते हैं।
    • इसे विपरीत दिशाओं में बहने वाली दो तालमेल वाली नदियों के रूप में सोचें।
    • उन्होंने सिद्ध किया कि वास्तविक कंप्यूटर के असतत चरण (मंजिल से मंजिल तक कूदना) इन गणितीय नदियों के सुचारू प्रवाह के लगभग समान हैं।

मुख्य परिणाम (The Theorem)

यह शोध पत्र एक विशिष्ट सूत्र प्रदान करता है कि वास्तविक ट्रांसफार्मर उनके सुचारू गणितीय मॉडल के कितने करीब है। त्रुटि इन पर निर्भर करती है:

  1. LL (Depth): इमारत कितनी ऊँची है।
  2. HH (Heads): श्रमिक टीमों की संख्या कितनी है।

जैसे-जैसे इमारत ऊँची होती है और इसमें अधिक टीमें होती हैं, त्रुटि कम होती जाती है। महत्वपूर्ण बात यह है कि टोकनों की संख्या (NN) त्रुटि सूत्र में दिखाई नहीं देती है।

सरल शब्दों में:
यदि आप अनंत गहराई और अनंत चौड़ाई वाला ट्रांसफार्मर बनाते हैं, जिसे AdamW के साथ प्रशिक्षित किया जाता है, तो इसका व्यवहार पूरी तरह से अनुमानित और सुचारू हो जाता है। आप पूरे सिस्टम को समीकरणों के एक सरल सेट के साथ वर्णित कर सकते हैं, और इससे कोई फर्क नहीं पड़ता कि आप 10 शब्द प्रोसेस कर रहे हैं या 10 बिलियन शब्द; खेल के नियम वही रहते हैं।

योगदान का सारांश

  1. सुचारूता (Smoothness): उन्होंने ट्रांसफार्मर के अराजक, चरण-दर-चरण प्रशिक्षण को एक सुचारू, निरंतर प्रवाह (ODEs) में बदल दिया।
  2. टोकन स्वतंत्रता (Token Independence): उन्होंने सिद्ध किया कि यह सुचारूता इस बात पर निर्भर नहीं करती कि आप मॉडल को कितने टोकन खिला रहे हैं। यह एक दुर्लभ और शक्तिशाली परिणाम है क्योंकि यह टोकनों की संख्या के संबंध में "डायमेंशनलिटी के अभिशाप" (curse of dimensionality) को हटा देता है।
  3. AdamW स्थिरता: उन्होंने दिखाया कि जिस तरह से AdamW वेट्स को सिकोड़ता है, वह सिस्टम को स्थिर रखता है, जिससे वे बिना गणित बिगड़े ये परिणाम सिद्ध कर पाते हैं।
  4. डायमेंशन स्वतंत्रता (बोनस): यदि वे AdamW के एक विशिष्ट संस्करण (Blockwise) का उपयोग करते हैं, तो गणित शब्द एम्बेडिंग के आकार (गणित के "शब्दावली आकार") की भी परवाह नहीं करता, जिससे मॉडल और भी अधिक स्केलेबल हो जाता है।

निष्कर्ष:
यह शोध पत्र हमें एक ऐसा गणितीय "लेंस" प्रदान करता है जो हमें पेड़ों के बजाय पूरे जंगल को देखने की अनुमति देता है। यह हमें बताता है कि जैसे-जैसे ये AI मॉडल बड़े होते जा रहे हैं, वे केवल अधिक जटिल नहीं हो रहे हैं; वे वास्तव में अधिक सरल और अधिक अनुमानित होते जा रहे हैं, जो सुचारू नियमों द्वारा संचालित होते हैं जो डेटा की विशाल मात्रा से स्वतंत्र हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →