← नवीनतम पेपर
💻 computer science

AMUSE: Anytime Muon with Stable Gradient Evaluation

यह शोधपत्र AMUSE को प्रस्तुत करता है, जो एक नया ऑप्टिमाइज़र है जो प्रशिक्षण को स्थिर करने और लर्निंग रेट शेड्यूल्स की आवश्यकता को समाप्त करने के लिए Muon की तीव्र बल्क प्रगति को Schedule-Free एवरेजिंग के साथ जोड़ता है, जिससे विजन और लैंग्वेज कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: AI को प्रशिक्षित करना एक पहाड़ की चढ़ाई करने जैसा है

कल्पना कीजिए कि आप एक कंप्यूटर (एक न्यूरल नेटवर्क) को कोई कौशल सिखाने की कोशिश कर रहे हैं, जैसे बिल्लियों को पहचानना या कहानियाँ लिखना। ऐसा करने के लिए, कंप्यूटर को गलतियों के एक विशाल, जटिल पहाड़ से "नीचे उतरना" होगा ताकि वह बिल्कुल नीचे (एक आदर्श समाधान) तक पहुँच सके।

इस पहाड़ का आकार पेचीदा है। यह केवल एक चिकनी ढलान नहीं है।

  • नदी: यहाँ एक चौड़ी, समतल, और मंद घाटी का फर्श है जहाँ आप तेज़ी से चल सकते हैं और अच्छी प्रगति कर सकते हैं। यहीं पर वास्तविक सीखना होता है।
  • घाटी की दीवारें: इस घाटी के किनारों पर, ज़मीन अविश्वसनीय रूप से खड़ी और पथरीली है। यदि आप दीवारों की ओर बहुत अधिक कदम बढ़ाते हैं, तो आप इधर-उधर बेतहाशा उछलेंगे, जिससे ऊर्जा बर्बाद होगी और आप कहीं नहीं पहुँच पाएंगे।

वर्तमान विधियों के साथ समस्या

लंबे समय से, इस पहाड़ पर चढ़ने का मानक तरीका (जिसे AdamW नामक ऑप्टिमाइज़र कहा जाता है) एक ऐसे हाइकर (पहाड़ी यात्री) की तरह था जिसे एक सख्त मानचित्र की आवश्यकता होती है। मानचित्र उन्हें बताता है कि कितनी तेज़ी से चलना है और कब धीमा होना है। यदि हाइकर मानचित्र को अनदेखा करता है, तो वह रास्ता भटक जाता है।

हाल ही में, दो नई हाइकिंग रणनीतियाँ उभरीं:

  1. शेड्यूल-फ्री (SF): यह एक ऐसे हाइकर की तरह है जिसे मानचित्र की आवश्यकता नहीं है। वे बस चलते रहते हैं, लेकिन कभी-कभी पीछे मुड़कर देखते हैं कि वे कहाँ से आए हैं ताकि वे समतल घाटी के फर्श पर बने रहें। वे बहुत स्थिर हैं लेकिन कभी-कभी शुरुआत में थोड़े धीमे होते हैं।
  2. म्यून (Muon): यह एक नया, सुपर-फास्ट हाइकर है। उनके पास एक विशेष ट्रिक है: वे अपने कदमों को "सीधा" कर देते हैं ताकि वे खड़ी दीवारों पर न फंसें। वे नदी के नीचे बहुत तेज़ी से दौड़ते हैं। हालाँकि, क्योंकि वे इतने तेज़ और आक्रामक हैं, वे कभी-कभी घाटी की दीवारों से टकरा जाते हैं, जिससे वे डगमगा जाते हैं और स्थिरता खो देते हैं।

समाधान: AMUSE

इस पेपर के लेखकों ने महसूस किया कि म्यून तेज़ लेकिन डगमगाता हुआ है, जबकि शेड्यूल-फ्री स्थिर है लेकिन कभी-कभी धीमा होता है। वे दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाना चाहते थे।

उन्होंने AMUSE (Anytime Muon with Stable Gradient Evaluation) बनाया।

उपमा: "स्मार्ट इंटरपोलेशन" हाइकर

कल्पना कीजिए कि आप एक घुमावदार सड़क (नदी) पर कार चला रहे हैं।

  • म्यून 100 मील प्रति घंटे की रफ्तार से स्पोर्ट्स कार चलाने जैसा है। आप वहाँ जल्दी पहुँच जाते हैं, लेकिन अगर आप किसी उभार (खड़ी दीवार) से टकराते हैं, तो आप नियंत्रण खो सकते हैं।
  • शेड्यूल-फ्री 40 मील प्रति घंटे की रफ्तार से एक भारी ट्रक चलाने जैसा है। आप बहुत स्थिर हैं, लेकिन आपको कहीं भी पहुँचने में लंबा समय लगता है।

AMUSE एक स्मार्ट ड्राइवर की तरह है जो दिन के समय के आधार पर अपनी ड्राइविंग शैली बदलता है:

  1. यात्रा की शुरुआत में (शुरुआत): ड्राइवर स्पोर्ट्स कार मोड में होता है। वे तेज़ी से आगे बढ़ने और दूरी तय करने के लिए तेज़ी से चलते हैं (म्यून की तरह)। वे गति बढ़ाने के लिए कुछ जोखिम उठाने को तैयार रहते हैं।
  2. यात्रा के अंत में (अंत): जैसे-जैसे वे अपनी मंजिल के करीब पहुँचते हैं, ड्राइवर धीरे-धीरे "ट्रक मोड" में बदल जाता है। वे अब अपने द्वारा तय किए गए औसत पथ को अधिक देखने लगते हैं, जिससे उनके मोड़ सुचारू हो जाते हैं। यह उन्हें दीवारों से टकराने से रोकता है और उन्हें पूरी तरह से समतल नदी के फर्श पर बनाए रखता है।

AMUSE कैसे काम करता है (तकनीकी जादू)

पेपर इसे एक "समय-परिवर्तित गुणांक" (एक फैंसी तरीका जिसका अर्थ है एक डायल जो समय के साथ बदलता है) का उपयोग करके समझाता है।

  • डायल (βt\beta_t): शुरुआत में, डायल "तेज़" पथ पर ध्यान केंद्रित करने के लिए सेट किया जाता है। जैसे-जैसे प्रशिक्षण जारी रहता है, डायल धीरे-धीरे "स्थिर" पथ पर ध्यान केंद्रित करने के लिए घूमता है।
  • परिणाम: AMUSE शुरुआत में म्यून की गति और अंत में शेड्यूल-फ्री की स्थिरता प्राप्त करता है। इसे यह बताने के लिए किसी पहले से लिखे गए मानचित्र (लर्निंग रेट शेड्यूल) की आवश्यकता नहीं है कि कब धीमा होना है; यह इसे खुद ही समझ लेता है।

इस पेपर ने क्या पाया

लेखकों ने कई अलग-अलग "पहाड़ों" (कार्यों) पर इस नई विधि का परीक्षण किया:

  • इमेज रिकग्निशन: कंप्यूटर को तस्वीरों (जैसे बिल्लियाँ, कुत्ते या हस्तलिखित संख्याएँ) को पहचानने के लिए सिखाना।
  • लार्ज लैंग्वेज मॉडल्स: AI को टेक्स्ट लिखने और समझने के लिए प्रशिक्षित करना (जैसे चैटबॉट्स के पीछे के मॉडल)।

परिणाम:

  • तेज़: AMUSE अन्य विधियों की तुलना में कम चरणों में समान उच्च-गुणवत्ता वाले परिणाम प्राप्त कर लेता है। उदाहरण के लिए, एक बड़े लैंग्वेज मॉडल कार्य पर, इसने अगली सबसे अच्छी विधि की तुलना में 1.5 गुना तेज़ी से फिनिश लाइन तक पहुँचकर दिखाया।
  • स्थिर: यह म्यून की तरह डगमगाया या क्रैश नहीं हुआ जैसा कि म्यून कभी-कभी करता है।
  • एनीटाइम (Anytime): आप प्रशिक्षण को किसी भी क्षण रोक सकते हैं, और मॉडल एक अच्छी स्थिति में होगा। आपको एक अच्छे परिणाम के लिए किसी विशिष्ट "एंड ऑफ ट्रेनिंग" क्षण का इंतज़ार करने की आवश्यकता नहीं है।

सारांश

यह पेपर AI को प्रशिक्षित करने के लिए एक नए टूल, AMUSE को पेश करता है। यह तेज़ लेकिन डगमगाते हुए म्यून ऑप्टिमाइज़र की अस्थिरता को ठीक करता है, जो शेड्यूल-फ्री ऑप्टिमाइज़ेशन के स्थिरता वाले तरीकों को अपनाता है।

इसे एक ऐसे हाइकर के रूप में सोचें जो जानता है कि कब दौड़ना है और कब स्थिरता से चलना है, जिससे यह सुनिश्चित होता है कि वह पहाड़ के नीचे तेज़ी से और बिना किनारे से गिरे पहुँचे। पेपर का दावा है कि यह इमेज और टेक्स्ट कार्यों में वर्तमान मानक विधियों की तुलना में बेहतर काम करता है, और इसके लिए जटिल शेड्यूलिंग के प्रबंधन की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →