← नवीनतम पेपर
⚡ electrical engineering

DeMuon: A Decentralized Muon for Matrix Optimization over Graphs

यह शोधपत्र DeMuon को प्रस्तुत करता है, जो Muon ऑप्टिमाइज़र का पहला विकेंद्रीकृत विस्तार है जो संचार ग्राफ़ (communication graphs) पर मैट्रिक्स अनुकूलन के लिए न्यूटन-शुल्ज़ ऑर्थोगोनालाइज़ेशन (Newton-Schulz orthogonalization) को ग्रेडिएंट ट्रैकिंग के साथ जोड़ता है ताकि भारी-पूंछ वाले शोर (heavy-tailed noise) की स्थितियों में भी प्रमाणित अभिसरण (provable convergence) और उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Chuan He, Shuyi Ren, Jingwei Mao, Erik G. Larsson

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuan He, Shuyi Ren, Jingwei Mao, Erik G. Larsson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह मिलकर एक विशाल, जटिल पहेली को सुलझाने की कोशिश कर रहा है। वे सभी अलग-अलग कमरों में हैं (विकेंद्रीकृत/decentralized), और वे केवल अपने निकटतम पड़ोसियों से ही बात कर सकते हैं। उनके पास कोई बॉस या केंद्रीय नेता नहीं है जो उन्हें बता सके कि क्या करना है; उन्हें यह पता लगाना होगा कि वे क्या देख रहे हैं और अपने पड़ोसियों द्वारा बताए गए आधार पर अपने स्वयं के टुकड़ों को कैसे समायोजित किया जाए।

यह शोध पत्र इस बारे में है कि ये दोस्त पहेली को तेज़ी से और अधिक सटीकता से कैसे हल कर सकते हैं। वे अपने इस नए तरीके को DeMuon कहते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: "मैट्रिक्स" पहेली

आर्टिफिशियल इंटेलिजेंस (विशेष रूप से डीप लर्निंग) की दुनिया में, "पहेली के टुकड़े" केवल एकल संख्याएँ नहीं हैं; वे संख्याओं के विशाल ग्रिड हैं जिन्हें मैट्रिक्स (matrices) कहा जाता है।

  • पुराना तरीका (वेक्टराइजिंग): पारंपरिक रूप से, कंप्यूटर इन बड़े ग्रिडों को संख्याओं की लंबी, सपाट सूचियों (वेक्टर्स) की तरह मानते थे। यह एक 3D जिग्सॉ पहेली को पहले 2D शीट में चपटा करने की तरह है। यह काम तो करता है, लेकिन यह अनाड़ी है और टुकड़ों के आकार को नज़रअंदाज़ करता है।
  • नया तरीका (Muon): Muon नामक एक हालिया पद्धति ने महसूस किया कि टुकड़ों को उनके प्राकृतिक 3D आकार (मैट्रिक्स) के रूप में मानना बहुत बेहतर है। यह एक विशेष "कुतुबनुमा" या दिशा-सूचक (जिसे स्पेक्ट्रल नॉर्म कहा जाता है) का उपयोग करता है ताकि यह तय किया जा सके कि टुकड़ों को किस दिशा में ले जाना है। यह तब अविश्वसनीय रूप से अच्छा काम करता है जब सभी एक ही कमरे में होते हैं (केंद्रीकृत)।

चुनौती: विकेंद्रीकृत (Decentralized) होना

लेखकों ने पूछा: क्या हम स्मार्ट "Muon" दिशा-सूचक का उपयोग तब कर सकते हैं जब हमारे दोस्त अलग-अलग कमरों में हों और वे किसी केंद्रीय बॉस से बात न कर सकें?
यह कठिन है क्योंकि:

  1. अलग-अलग दृष्टिकोण: प्रत्येक मित्र पहेली का थोड़ा अलग हिस्सा देखता है (स्थानीय डेटा)।
  2. कोई बॉस नहीं: वे बस एक नेता से यह नहीं पूछ सकते, "सबसे अच्छा कदम क्या है?" उन्हें यह अनुमान लगाना होगा कि "वैश्विक" (global) सबसे अच्छा कदम क्या है, अपने पड़ोसियों को सुनकर।
  3. भ्रम: यदि वे सावधान नहीं रहे, तो वे सभी अलग-अलग दिशाओं में जाने लगेंगे, और पहेली कभी हल नहीं होगी।

समाधान: DeMuon

शोध पत्र DeMuon का प्रस्ताव देता है, जो एक ऐसी विधि है जो दोस्तों को बिना किसी बॉस के पहेली सुलझाने में मदद करती है। यह दो मुख्य तरकीबों को जोड़ता है:

1. "साझा दिशा-सूचक" (ग्रेडिएंट ट्रैकिंग)
कल्पना कीजिए कि प्रत्येक मित्र के पास एक दिशा-सूचक (compass) है। क्योंकि वे अलग-अलग कमरों में हैं, उनके दिशा-सूचक थोड़े अलग दिशाओं की ओर इशारा करते हैं।

  • पुराने विकेंद्रीकृत तरीके: मित्र केवल अपने दिशा-सूचकों को अपने पड़ोसियों की ओर मोड़ते थे और उम्मीद करते थे कि वे संरेखित हो जाएंगे।
  • DeMuon की तरकीब: वे ग्रेडिएंट ट्रैकिंग नामक तकनीक का उपयोग करते हैं। यह एक रिले रेस की तरह है जहाँ प्रत्येक मित्र न केवल अपनी वर्तमान दिशा बताता है, बल्कि एक "सुधार नोट" भी पास करता है कि पिछले कदम के बाद उनकी दिशा कैसे बदली। यह पूरे समूह को सही "वैश्विक" दिशा पर सहमत होने में मदद करता है, भले ही वे एक-दूसरे से दूर हों।

2. "मैट्रिक्स ऑर्थोगोनलाइजेशन" (Muon का जादू)
जब एक मित्र अपने पहेली के टुकड़े को हिलाने का निर्णय लेता है, तो वह उसे केवल बेतरतीब ढंग से नहीं धकेलता। वह Muon तकनीक का उपयोग करता है, जो एक विशेष "आकार बदलने वाले" (shape-shifter) की तरह है।

  • केवल टुकड़े को आगे धकेलने के बजाय, Muon टुकड़े के "आकार" (स्पेक्ट्रल नॉर्म का उपयोग करके) की जाँच करता है और उसे पूरी तरह से संरेखित होने के लिए घुमाता है।
  • इसे एक ऐसे डांसर के रूप में सोचें जो केवल आगे नहीं चलता, बल्कि पहले एक आदर्श मुद्रा बनाता है ताकि वह संतुलित रहे। यह पहेली के टुकड़ों को "फँसने" या अक्षम रूप से चलने से रोकता है।

सुपर-चार्ज्ड संस्करण: DeMuon-A

लेखकों ने इसका एक और भी तेज़ संस्करण बनाया जिसे DeMuon-A कहा जाता है।

  • उपमा: यदि DeMuon एक धावक है जो ज़मीन को देखता है और एक कदम लेता है, तो DeMuon-A एक ऐसा धावक है जो ज़मीन को देखता है, भविष्यवाणी करता है कि वह दो कदमों में कहाँ होगा, और फिर उस भविष्यवाणी के आधार पर एक बड़ी छलांग लगाता है।
  • यह कैसे काम करता है: यह मल्टी-एक्सट्रैपोलेशन (multi-extrapolation) नामक तकनीक का उपयोग करता है। यह पूछता है, "यदि मैं इसी तरह चलता रहा, तो मैं कहाँ होऊँगा?" और उस भविष्यवाणी का उपयोग एक बड़ा, स्मार्ट कदम उठाने के लिए करता है। इसके लिए पहेली का "सुचारू" (smooth/predictable) होना आवश्यक है, लेकिन जब यह काम करता है, तो यह समाधान की ओर बहुत तेज़ी से बढ़ता है।

उन्होंने क्या सिद्ध किया?

लेखकों ने मुख्य रूप से दो चीजें कीं:

  1. गणितीय प्रमाण (Math Proof): उन्होंने उन्नत गणित का उपयोग करके यह सिद्ध किया कि यदि मित्र इन नियमों का पालन करते हैं, तो वे अंततः समाधान पर सहमत होंगे (सहमति/consensus) और पहेली के टुकड़ों की सर्वोत्तम व्यवस्था (स्टेशनैरिटी/stationarity) पाएंगे। उन्होंने सिद्ध किया कि यह काम करता है, भले ही मित्र एक अव्यवस्थित नेटवर्क में हों (कुछ कई लोगों से बात कर सकते हैं, कुछ बहुत कम से)।
  2. वास्तविक दुनिया का परीक्षण: उन्होंने एक भाषा मॉडल (एक प्रकार का AI जो टेक्स्ट लिखता है) को प्रशिक्षित करने के लिए इसका परीक्षण किया।
    • उन्होंने 8 कंप्यूटरों (नोड्स) को अलग-अलग तरीकों से जोड़ा (जैसे एक पूर्ण वृत्त, एक रिंग, या एक उलझा हुआ जाल)।
    • परिणाम: DeMuon और DeMuon-A ने मानक तरीकों (जैसे DSGD) की तुलना में भाषा कार्य को बहुत बेहतर और तेज़ी से सीखा। वे कम "त्रुटि" (error) स्कोर तक पहुँचे, जिसका अर्थ है कि AI अधिक स्मार्ट था।

सारांश

  • DeMuon एक नया तरीका है जिससे कंप्यूटरों का एक समूह बिना किसी केंद्रीय बॉस के AI मॉडल को एक साथ प्रशिक्षित कर सकता है।
  • यह मूल Muon पद्धति के "स्मार्ट शेप-शिफ्टिंग" (मैट्रिक्स ऑप्टिमाइज़ेशन) को बनाए रखता है।
  • यह एक "रिले रेस" प्रणाली (ग्रेडिएंट ट्रैकिंग) जोड़ता है ताकि सभी एक ही दिशा में सहमत हों।
  • DeMuon-A इसे और भी तेज़ बनाने के लिए "भविष्यवाणी वाली छलांग" (prediction leap) जोड़ता है।
  • शोध पत्र गणितीय रूप से सिद्ध करता है कि यह काम करता है और प्रयोगों के माध्यम से दिखाता है कि यह गति और सटीकता में वर्तमान तरीकों को मात देता है।

यह शोध पत्र यह दावा नहीं करता है कि यह चिकित्सा उपयोग या विशिष्ट भविष्य के अनुप्रयोगों के लिए है; यह पूरी तरह से एक विकेंद्रीकृत नेटवर्क में AI मॉडल को प्रशिक्षित करने की गणितीय दक्षता में सुधार के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →