← नवीनतम पेपर
🤖 machine learning

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

यह शोध पत्र Asteria को प्रस्तुत करता है, जो एक रनटाइम सिस्टम है जो विषम मेमोरी पदानुक्रमों (heterogeneous memory hierarchies) में ऑप्टिमाइज़र स्टेट्स को गतिशील रूप से वितरित करके और ओवरहेड को कम करने तथा अभिसरण (convergence) को त्वरित करने के लिए महत्वपूर्ण प्रीकंडीशनर गणनाओं को क्रिटिकल GPU ट्रेनिंग पाथ से अलग करके, लार्ज लैंग्वेज मॉडल्स के लिए व्यावहारिक, स्केलेबल सेकंड-ऑर्डर ऑप्टिमाइज़ेशन को सक्षम बनाता है।

मूल लेखक: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको एक "शिक्षक" (एक ऑप्टिमाइज़र) की आवश्यकता है जो रोबोट की गलतियों को देखे और उसे सुधार करने के लिए बताए।

वर्तमान में, अधिकांश शिक्षक एक सरल विधि का उपयोग करते हैं जिसे AdamW कहा जाता है। यह एक ऐसे छात्र की तरह है जो अपना होमवर्क चेक करता है, कुछ गलत उत्तर देखता है, और छोटे, त्वरित सुधार करता है। यह तेज़ है और अच्छा काम करता है, लेकिन इसे वास्तव में कुशल होने के लिए बहुत अधिक अभ्यास (लाखों उदाहरणों) की आवश्यकता होती है।

वहाँ एक अधिक स्मार्ट, उन्नत शिक्षक विधि है जिसे सेकंड-ऑर्डर ऑप्टिमाइज़ेशन (जैसे SOAP या Shampoo) कहा जाता है। यह शिक्षक केवल यह नहीं देखता कि क्या गलत था; बल्कि यह गलतियों के आकार (shape) का विश्लेषण करता है ताकि समस्या को गहराई से समझा जा सके। यह बहुत तेज़ी से सीखता है और इसे कम उदाहरणों की आवश्यकता होती है। हालाँकि, एक बहुत बड़ी समस्या है। यह स्मार्ट शिक्षक अविश्वसनीय रूप से भारी है। इसे जटिल गणित करने के लिए भारी मात्रा में मेमोरी और कंप्यूटिंग पावर की आवश्यकता होती है, जिससे अक्सर कंप्यूटर क्रैश हो जाता है या इतना धीमा हो जाता है कि सरल शिक्षक ही काम पूरा कर लेता है।

एस्टरिया (Asteria) से मिलिए: एक "स्मार्ट लॉजिस्टिक्स मैनेजर"

ऑक्सफोर्ड के शोधकर्ताओं ने एस्टरिया नामक एक नया सिस्टम बनाया है। एस्टरिया को एक नए शिक्षक के रूप में नहीं, बल्कि एक शानदार लॉजिस्टिक्स मैनेजर के रूप में सोचें जो पूरे क्लासरूम को पुनर्गठित करता है ताकि स्मार्ट शिक्षक अपना काम बिना स्कूल को नुकसान पहुँचाए कर सके।

यहाँ बताया गया है कि एस्टरिया तीन सबसे बड़ी समस्याओं को कैसे हल करता है, सरल उपमाओं का उपयोग करते हुए:

1. "एक छोटे कमरे में फर्नीचर" की समस्या (मेमोरी)

समस्या: स्मार्ट शिक्षक को अपने दिमाग (GPU मेमोरी) में विशाल, जटिल चार्ट (मैट्रिक्स) रखने की आवश्यकता होती है। एक मानक कंप्यूटर पर, इतनी जगह नहीं होती। यह एक स्टूडियो अपार्टमेंट में किंग-साइज़ बेड, डाइनिंग टेबल और एक अलमारी फिट करने की कोशिश करने जैसा है। कमरा भर जाता है, और शिक्षक को छोड़ना पड़ता है।
एस्टरिया का समाधान: एस्टरिया एक फोल्डिंग फर्नीचर विशेषज्ञ की तरह कार्य करता है। वह महसूस करता है कि शिक्षक को एक ही समय में सब कुछ अपने हाथों में रखने की आवश्यकता नहीं है।

  • यह चार्ट के सबसे सक्रिय हिस्सों को GPU (डेस्क) पर रखता है।
  • यह भारी, कम बार उपयोग किए जाने वाले हिस्सों को CPU (गलियारे) या यहाँ तक कि हार्ड ड्राइव (गैरेज) में ले जाता है।
  • महत्वपूर्ण बात यह है कि यह भारी हिस्सों को ठीक तभी वापस डेस्क पर लाता है जब उनकी आवश्यकता होती है। यह स्मार्ट शिक्षक को एक सुपरकंप्यूटर के समान ही एक छोटे लैपटॉप पर भी कुशलता से काम करने की अनुमति देता है।

2. "ट्रैफिक जाम" की समस्या (गति)

समस्या: हर कुछ चरणों के बाद, स्मार्ट शिक्षक को अपने चार्ट को अपडेट करने के लिए एक विशाल, जटिल गणना (जैसे एक बड़ा पहेली हल करना) करनी पड़ती है। इसमें बहुत समय लगता है और यह पूरी क्लास के काम को रोक देता है। यह एक डिलीवरी ट्रक के समान है जो एक अकेला पैकेज उतारने के दौरान पूरे हाईवे को ब्लॉक कर देता है। GPU (कंप्यूटर का मस्तिष्क) गणना के पूरा होने का इंतज़ार करते हुए खाली बैठा रहता है।
एस्टरिया का समाधान: एस्टरिया एक समानांतर असेंबली लाइन पेश करता है।

  • मुख्य क्लास को भारी गणित करने के लिए रोकने के बजाय, एस्टरिया "भारी काम" को बैक ऑफिस में काम करने वाली टीम (CPU) को भेज देता है।
  • जबकि मुख्य क्लास (GPU) रोबोट को सिखाना जारी रखती है, बैक ऑफिस के कर्मचारी पृष्ठभूमि में चुपचाप जटिल पहेलियों को हल कर रहे होते हैं।
  • जब तक क्लास को नए चार्ट की आवश्यकता होती है, बैक ऑफिस अपना काम पूरा कर चुका होता है और उन्हें स्लाइड करके भेज देता है। मुख्य क्लास को कभी रुकना नहीं पड़ता। "ट्रैफिक जाम" गायब हो जाता है।

3. "ग्रुप चैट" की समस्या (डिस्ट्रीब्यूटेड ट्रेनिंग)

समस्या: कई कंप्यूटरों के साथ एक साथ प्रशिक्षण देते समय, आमतौर पर सभी को अगले चरण पर जाने से पहले बिल्कुल सटीक जानकारी पर सहमत होना पड़ता है। यह एक ग्रुप चैट की तरह है जहाँ सभी को अगला संदेश टाइप करने से पहले सबसे धीमे व्यक्ति के जवाब का इंतज़ार करना पड़ता है।
एस्टरिया का समाधान: एस्टरिया एक "काफी अच्छा है" (Good Enough) नीति का उपयोग करता है।

  • सभी को पूरी तरह से सिंक्रोनाइज़ होने का इंतज़ार करने के बजाय, यह कंप्यूटरों को थोड़े समय के लिए थोड़ी "पुरानी" (stale) जानकारी के साथ काम करने की अनुमति देता है।
  • यह केवल तभी अपडेट भेजता है जब वे वास्तव में आवश्यक हों।
  • यह समूह को तेज़ रखता है, जैसे कि एक ऐसी टीम जो अपडेट मिलने का इंतज़ार करने के बजाय बाद में अपडेट प्राप्त करते हुए काम जारी रखने के लिए एक-दूसरे पर भरोसा करती है।

परिणाम: उन्होंने क्या पाया?

शोधकर्ताओं ने वास्तविक हार्डवेयर पर एस्टरिया का परीक्षण किया, जिसमें एक शक्तिशाली सिंगल कंप्यूटर (Nvidia DGX Spark) और कंप्यूटरों का एक बड़ा क्लस्टर (Nvidia GH200) शामिल है।

  • यह छोटी मशीनों पर भी काम करता है: वे एक बड़े भाषा मॉडल (1 बिलियन पैरामीटर्स) को एक एकल मशीन पर प्रशिक्षित करने में सक्षम थे, जो पहले इस स्मार्ट शिक्षक की मेमोरी आवश्यकताओं को संभालने में असमर्थ थी।
  • यह वास्तविक समय में तेज़ है: क्योंकि यह "ट्रैफिक जाम" को छिपा देता है, इसलिए कठिन गणित होने के बावजूद प्रशिक्षण वास्तविक घड़ी के समय (clock time) में कम समय में पूरा हो जाता है।
  • यह ऊर्जा बचाता है: कंप्यूटर के मस्तिष्क (GPU) को व्यस्त रखकर और उसे गणनाओं की प्रतीक्षा में खाली न बैठने देकर, एस्टरिया पुराने, बोझिल तरीकों की तुलना में समान परिणाम प्राप्त करने के लिए वास्तव में कम कुल ऊर्जा का उपयोग करता है।
  • यह गुणवत्ता नहीं खोता: मॉडल उतना ही अच्छा सीखता है जितना कि वह "नेटिव" (अन-ऑप्टिमाइज्ड) स्मार्ट शिक्षक के साथ सीखता, लेकिन यह बहुत तेज़ी से और कम लागत में वहां पहुँच जाता है।

सारांश:
एस्टरिया कोई नया गणितीय सूत्र नहीं बनाता है। इसके बजाय, यह इस बात पर पुनर्विचार करता है कि कंप्यूटर उस गणित को कैसे चलाता है। यह भारी काम को मुख्य काम से अलग करता है, सभी उपलब्ध स्टोरेज स्पेस का बुद्धिमानी से उपयोग करता है, और कंप्यूटरों को एसिंक्रोनस (asynchronously) रूप से काम करने देता है। यह एक "सैद्धांतिक रूप से महान लेकिन व्यावहारिक रूप से असंभव" विधि को अगली पीढ़ी के AI को प्रशिक्षित करने के लिए एक व्यावहारिक उपकरण में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →