← नवीनतम पेपर
🤖 machine learning

Aurora: A Leverage-Aware Spectral Optimizer

यह शोध पत्र ऑरोरा (Aurora) को प्रस्तुत करता है, जो एक लीवरेज-अवेयर स्पेक्ट्रल ऑप्टिमाइज़र है जो म्यूऑन (Muon) के पोलर फैक्टर ज्योमेट्री को संरक्षित करते हुए मैट्रिक्स पैरामीटर अपडेट में रो-यूनिफॉर्मिटी (row-uniformity) को लागू करता है, जिससे न्यूरॉन स्टैग्नेशनेशन (neuron stagnation) को रोका जा सके और विशेष रूप से बहुत विस्तृत (wide) एमएलपी परतों को प्रशिक्षित करने में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Alec Dewulf, Dhruv Pai, Li Yang, Ashley Zhang, Ben Keigwin

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alec Dewulf, Dhruv Pai, Li Yang, Ashley Zhang, Ben Keigwin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप श्रमिकों की एक विशाल टीम (एक न्यूरल नेटवर्क) को जटिल पहेलियों को हल करने के लिए प्रशिक्षित कर रहे हैं। इस टीम में, विशिष्ट विभाग हैं जिन्हें MLP लेयर्स कहा जाता है, जहाँ काम को व्यक्तिगत स्टेशनों में विभाजित किया गया है। प्रत्येक स्टेशन एक "न्यूरॉन" है जो अंतिम उत्तर के एक बहुत छोटे हिस्से के लिए जिम्मेदार है।

यह शोध पत्र एक नए प्रबंधक Aurora को पेश करता है जो पिछले प्रबंधक, Muon द्वारा काम सौंपने के तरीके में मौजूद एक बड़ी खामी को ठीक करता है।

समस्या: "आलसी कार्यकर्ता" का चक्र (The "Lazy Worker" Loop)

पुराने सिस्टम (Muon) के तहत, प्रबंधक पूरी टीम के प्रदर्शन को देखता था और काम को संतुलित करने की कोशिश करता था। हालाँकि, कुछ विशेष प्रकार के कार्यों के लिए (गणितीय रूप में जिन्हें "टॉल मैट्रिसेस" कहा जाता है), Muon ने अनजाने में एक दुष्चक्र बना दिया:

  1. असमान विभाजन: कुछ श्रमिकों (न्यूरॉन्स) को उनके कौशल में बहुत बड़े और रोमांचक अपडेट मिले, जबकि अन्यों को बहुत छोटे, लगभग अदृश्य अपडेट मिले।
  2. मृत्यु का चक्र (The Death Spiral): जिन श्रमिकों को बहुत छोटे अपडेट मिले, वे धीरे-धीरे फीके पड़ने लगे। क्योंकि वे सीख नहीं पा रहे थे, इसलिए उन्होंने टीम के आउटपुट में योगदान देना बंद कर दिया। अंततः, वे "डेड न्यूरॉन्स" बन गए—वे अभी भी पेरोल पर थे लेकिन कुछ भी नहीं कर रहे थे।
  3. फीडबैक लूप: जैसे-जैसे इन श्रमिकों ने योगदान देना बंद किया, प्रबंधक (Muon) ने उन्हें अपडेट करने की आवश्यकता कम समझी, जिससे उन्हें और भी छोटे अपडेट मिले। यह उपेक्षा का एक स्व-सुदृढ़ (self-reinforcing) चक्र बन गया।

शोध पत्र दिखाता है कि Muon के साथ प्रशिक्षित बड़े मॉडलों में, न्यूरॉन्स की एक महत्वपूर्ण संख्या वास्तव में काम छोड़ देती है, विशेष रूप से नेटवर्क की शुरुआती परतों में।

पुराना समाधान: "ब्लंट फ़ोर्स" दृष्टिकोण (The "Blunt Force" Approach)

कुछ शोधकर्ताओं ने इसे ठीक करने के लिए बस हर कार्यकर्ता को समान मात्रा में ऊर्जा देने की कोशिश की (रो नॉर्मलाइजेशन)। वे टीम को देखते, देखते कि कोई कमजोर है, और बस उसे ऊपर उठाने की कोशिश करते।

हालाँकि, शोध पत्र का तर्क है कि यह ब्लंट दृष्टिकोण एक नाजुक घड़ी को ठीक करने के लिए हथौड़े का उपयोग करने जैसा था। हालाँकि इसने श्रमिकों को मरने से तो रोक दिया, लेकिन इसने काम के स्वरूप को विकृत कर दिया। इसने टीम को एक ऐसी ज्यामिति (geometry) में धकेल दिया जो पहेली के प्राकृतिक प्रवाह में फिट नहीं बैठती थी। यह एक समझौता था: आपने श्रमिकों को तो बचा लिया, लेकिन काम की लय को तोड़ दिया।

नया समाधान: Aurora

Aurora एक नया ऑप्टिमाइज़र है जो बिना लय बिगाड़े इस समस्या को हल करता है। Aurora को एक मास्टर कोरियोग्राफर की तरह समझें जो एक साथ दो नियमों को समझता है:

  1. ज्यामिति का नियम (The Geometry Rule): टीम को एक विशिष्ट, सुंदर, ऑर्थोगोनल पैटर्न (जैसे एक पूर्ण रूप से सिंक्रोनाइज्ड डांस) में चलना चाहिए ताकि पहेली को कुशलतापूर्वक हल किया जा सके। यह वह "पोलर फैक्टर" है जिसमें Muon अच्छा था।
  2. निष्पक्षता का नियम (The Fairness Rule): प्रत्येक कार्यकर्ता को ऊर्जा और ध्यान का समान हिस्सा मिलना चाहिए।

Aurora इन दोनों को एक साथ प्रबंधित करता है। केवल बाद में कमजोर श्रमिकों को बढ़ावा देने के बजाय, यह उस सटीक कदम की गणना करता है जो नृत्य पैटर्न और निष्पक्षता की आवश्यकता दोनों को एक साथ संतुष्ट करता है।

व्यावहारिक रूप में यह कैसे काम करता है:

  • यह नेटवर्क के "टॉल" (tall) हिस्सों को देखता है (MLP परतों में अप और गेट प्रोजेक्शन)।
  • यह एक त्वरित, पुनरावृत्ति गणना (जैसे मानसिक गणित के कुछ राउंड) चलाता है ताकि वह सटीक अपडेट खोज सके जो टीम के डांस स्टेप्स को भी एकदम सही रखे और यह भी सुनिश्चित करे कि कोई भी अंधेरे में न छूटे।
  • यह "डेड न्यूरॉन" की समस्या को पूरी तरह से रोकता है।

परिणाम

लेखकों ने बड़े लैंग्वेज मॉडल्स (340 मिलियन और 1.1 बिलियन पैरामीटर्स) पर Aurora का परीक्षण किया और पाया:

  • कोई डेड न्यूरॉन नहीं: Muon के विपरीत, Aurora ने हर एक न्यूरॉन को सक्रिय और योगदान करने योग्य बनाए रखा।
  • बेहतर प्रदर्शन: Aurora के साथ प्रशिक्षित मॉडल, Muon या "ब्लंट फ़ोर्स" सुधारकों की तुलना में तेजी से सीखे और रीजनिंग एवं नॉलेज टेस्ट (जैसे MMLU) में उच्च स्कोर प्राप्त किया।
  • जितना चौड़ा, उतना बेहतर: शोध पत्र ने पाया कि टीम जितनी अधिक विस्तृत (MLP परतों में अधिक न्यूरॉन्स) होगी, Aurora का लाभ उतना ही बड़ा होगा। यह सुझाव देता है कि Aurora अत्यंत विस्तृत, शक्तिशाली नेटवर्क को प्रशिक्षित करने की कुंजी है, जिससे मृत श्रमिकों पर संसाधनों की बर्बादी के बिना काम किया जा सके।

मुख्य निष्कर्ष (The Bottom Line)

Aurora AI मॉडल्स को प्रशिक्षित करने का एक स्मार्ट तरीका है। यह एक छिपी हुई खामी को ठीक करता है जहाँ AI "न्यूरॉन्स" चुपचाप खत्म हो रहे थे, यह सुनिश्चित करता है कि नेटवर्क का प्रत्येक हिस्सा प्रभावी ढंग से उपयोग किया जाए, और साथ ही सीखने की प्रक्रिया की गणितीय संरचना को भी पूर्ण रखता है। यह एक ऐसे मैनेजर से अपग्रेड करने जैसा है जो अनजाने में आधे स्टाफ को अनदेखा कर देता है, बजाय एक ऐसे मैनेजर के जो यह सुनिश्चित करता है कि हर कोई पूर्ण तालमेल के साथ नृत्य कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →