← नवीनतम पेपर
💻 computer science

DynMuon: A Dynamic Spectral Shaping View of Muon

यह शोध पत्र DynMuon को प्रस्तुत करता है, जो एक गतिशील स्पेक्ट्रल शेपिंग विधि है जो वक्रता (curvature) और शोर (noise) के आधार पर स्पेक्ट्रल पावर पैरामीटर pp को धनात्मक से हल्के ऋणात्मक मानों की ओर शेड्यूलिंग करके Muon-आधारित प्रशिक्षण को अनुकूलित करती है, जिससे मानक Muon की तुलना में कम वैलिडेशन लॉस और तेज़ अभिसरण (convergence) प्राप्त होता है।

मूल लेखक: Fangzhou Wu, Rikhav Shah, Sandeep Silwal, Qiuyi Zhang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fangzhou Wu, Rikhav Shah, Sandeep Silwal, Qiuyi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल रोबोट (एक Large Language Model) को मानव भाषा बोलना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको उसकी गलतियों के आधार पर उसके आंतरिक "नूब्स" (knobs) और "डायल" (dials) को लगातार ट्यून करना पड़ता है। इस प्रक्रिया को ट्रेनिंग (training) कहा जाता है।

लंबे समय तक, इन नूब्स को घुमाने का मानक तरीका एक साधारण पेचकस (screwdriver) का उपयोग करने जैसा था: आप बस उन्हें उस दिशा में थोड़ा सा घुमाते थे जो मददगार लग रही थी। हाल ही में, एक नया तरीका Muon चैंपियन बनकर उभरा है। यह एक साधारण पेचकस से अपग्रेड होकर एक हाई-टेक, सेल्फ-लेवलिंग रेंच (wrench) बनने जैसा है, जो जानता है कि रोबोट को तेजी से और स्थिरता से सीखने के लिए नूब्स को किस दिशा में कैसे घुमाना है।

DynMuon अगला विकास (evolution) है। यह एक "स्मार्ट शेड्यूलर" (smart scheduler) है जो यह समझता है कि रेंच को हमेशा एक ही तरीके से सेट नहीं रहना चाहिए। इसके बजाय, यह जैसे-जैसे ट्रेनिंग आगे बढ़ती है, अपनी रणनीति बदलता रहता है।

यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है, कुछ उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "एक ही आकार के सभी के लिए" वाला रेंच (One-Size-Fits-All Wrench)

वर्तमान चैंपियन, Muon, रोबोट के नूब्स को एडजस्ट करने के लिए एक विशिष्ट नियम का उपयोग करता है। यह सीखने की सभी "दिशाओं" के साथ एक जैसा व्यवहार करता है।

  • उपमा: कल्पना कीजिए कि आप एक पहाड़ पर चढ़ रहे हैं। Muon एक गाइड की तरह है जो हमेशा आपको सबसे खड़ी राह (steepest path) बताता है। यह तब बहुत अच्छा काम करता है जब आप पहाड़ के निचले हिस्से में होते हैं (शुरुआती ट्रेनिंग), क्योंकि खड़ी राह आपको जल्दी ऊपर ले जाती है।
  • समस्या: जैसे-जैसे आप शिखर के करीब पहुँचते हैं (देर से होने वाली ट्रेनिंग), इलाके में बदलाव आता है। खड़ी राहें पथरीली और खतरनाक (शोर/noise से भरी) हो सकती हैं, जबकि समतल राहें वास्तव में वह जगह होती हैं जहाँ शिखर तक के अंतिम कुछ कदम छिपे होते हैं। यदि आप खड़ी राह पर ही जोर देते रहते हैं, तो आप फंस सकते हैं या भटक सकते हैं।

2. खोज: खेल के बीच में रणनीति बदलना

लेखकों ने इस शोध पत्र में पाया कि नूब्स को घुमाने का "सबसे अच्छा" तरीका इस बात पर निर्भर करता है कि आप ट्रेनिंग प्रक्रिया में कब हैं। उन्होंने एक गणितीय "नब" (knob) देखा जिसे pp (स्पेक्ट्रल एक्सपोनेंट) कहा जाता है, जो यह नियंत्रित करता है कि रेंच कैसे व्यवहार करता है।

  • शुरुआती चरण (चढ़ाई): शुरुआत में, रोबोट बड़ी और स्पष्ट गलतियाँ कर रहा होता है। "खड़ी" दिशाएँ (उच्च वक्रता/high curvature) उपयोगी जानकारी से भरी होती हैं।
    • DynMuon का कदम: यह एक धनात्मक (positive) मान सेट करता है। यह चिल्लाकर कहने जैसा है, "कड़ी रास्तों पर ज़ोर लगाओ!" यह रोबोट को पहाड़ के शुरुआती हिस्से में बहुत तेज़ी से दौड़ने में मदद करता है।
  • अंतिम चरण (शिखर): जैसे-जैसे रोबोट बेहतर होता जाता है, बड़ी गलतियाँ खत्म हो जाती हैं। अब, उपयोगी जानकारी "समतल" दिशाओं (कम वक्रता/low curvature) में छिपी होती है। हालाँकि, ये समतल रास्ते भी वे स्थान हैं जहाँ रैंडम शोर (static) छिप सकता है।
    • DynMuon का कदम: यह धीरे-धीरे नब को एक हल्के ऋणात्मक (mildly negative) मान की ओर घुमाता है। यह फुसफुसाने जैसा है, "सावधानी बरतें, लेकिन समतल रास्तों पर ध्यान केंद्रित करें।" यह रोबलेट का ध्यान उन सूक्ष्म, समतल दिशाओं की ओर मोड़ देता है जिनमें अभी भी उपयोगी संकेत हैं, जबकि सावधानी से शोर (static) से बचता है।

3. जादू: "डायनामिक" शेड्यूलर (The Dynamic Scheduler)

यह पेपर DynMuon पेश करता है, जो इस बदलाव को स्वचालित रूप से संभालता है।

  • यह कैसे काम करता है: यह एक धनात्मक सेटिंग (आक्रामक, खड़ी राहों पर ध्यान) के साथ शुरू होता है और जैसे-जैसे ट्रेनिंग आगे बढ़ती है, एक ऋणात्मक सेटिंग (कोमल, समतल राहों पर ध्यान) की ओर सुचारू रूप से परिवर्तित होता है।
  • परिणाम: यह एक ऐसे गाइड की तरह है जो जानता है कि कब "स्प्रिंट मोड" से "प्रिसिजन मोड" (शुद्धता मोड) में स्विच करना है।

4. यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने विभिन्न आकार के रोबोटों (छोटे से लेकर बहुत बड़े तक) पर इसका परीक्षण किया और पाया:

  • तेज़ ट्रेनिंग: DynMuon पुराने Muon तरीके की तुलना में 10% से 26% कम स्टेप्स में बुद्धिमत्ता के उसी स्तर तक पहुँच जाता है। यह 4 दिनों के बजाय 3 दिनों में शिखर तक पहुँचने जैसा है।
  • बेहतर प्रदर्शन: यह अंततः एक कम "एरर स्कोर" (validation loss) प्राप्त करता है, जिसका अर्थ है कि अंतिम रोबोट अधिक स्मार्ट है।
  • दक्षता (Efficiency): इसके लिए चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है; यह ट्रेनिंग के प्रत्येक स्टेप में लगभग कोई अतिरिक्त समय नहीं जोड़ता है। यह एक सॉफ्टवेयर अपग्रेड है, हार्डवेयर नहीं।

सारांश

सोचिए कि Muon पहाड़ चढ़ने के लिए एक बहुत अच्छे, निश्चित नियम वाले गाइड की तरह है। DynMuon वही गाइड है, लेकिन एक मानचित्र (map) के साथ जो उन्हें बताता है कि कब "खड़ी चट्टानों पर चढ़ने" से "सौम्य कटक (ridges) पर चलने" में स्विच करना है। रणनीतियों को गतिशील रूप से बदलकर, रोबोट तेजी से सीखता है और यदि वह पूरी ट्रेनिंग के दौरान केवल एक ही नियम पर टिका रहता, तो वह एक बेहतर स्थिति में पहुँचता।

पेपर का दावा है कि यह विशेष रूप से Large Language Models को प्रशिक्षित करने के लिए काम करता है और सामान्य AI ट्रेनिंग दक्षता के बाहर चिकित्सा निदान, सेल्फ-ड्राइविंग कारों या अन्य विशिष्ट अनुप्रयोगों के उपयोग के दावे नहीं करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →