← नवीनतम पेपर
📊 statistics

Why Adam Works Better with β1=β2\beta_1 = \beta_2: The Missing Gradient Scale Invariance Principle

यह शोध पत्र यह प्रकट करता है कि एडम (Adam) ऑप्टिमाइज़र में β1=β2\beta_1 = \beta_2 निर्धारित करना इष्टतम है क्योंकि यह विशिष्ट रूप से प्रथम-क्रम ग्रेडिएंट स्केल इनवेरिएंस (first-order gradient scale invariance) सुनिश्चित करता है, जो एक ऐसी संरचनात्मक विशेषता है जो विविध कार्यों में प्रशिक्षण स्थिरता और प्रदर्शन में अनुभवजन्य रूप से देखे गए सुधारों की व्याख्या करती है।

मूल लेखक: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं। आप उसे उसके पिछले कुछ कदमों में हुई लड़खड़ाहट के आधार पर निर्देश देते हैं। Adam, जो सबसे लोकप्रिय "ऑप्टिमाइज़र" (एक टूल जो AI को सीखने में मदद करता है) है, इसी तरह काम करता है। यह यह तय करने के लिए कि अतीत की बात कितनी सुननी है और वर्तमान की कितनी, दो "मेमोरी नॉब्स" (स्मृति नियंत्रणों) का उपयोग करता है।

लगभग एक दशक तक, विशेषज्ञों ने इन नॉब्स को विशिष्ट सेटिंग्स पर घुमाया है: पहले मेमोरी के लिए 0.9 और दूसरे के लिए 0.999। लेकिन हाल ही में, एक दिलचस्प पैटर्न सामने आया: जब शोधकर्ताओं ने दोनों नॉब्स को एक ही नंबर पर सेट किया (जैसे, दोनों को 0.99), तो रोबोट अधिक सुचारू रूप से चला और तेजी से सीखा। किसी को नहीं पता था कि यह जादुई ट्रिक क्यों काम कर रही थी।

यह पेपर इस रहस्य को सुलझाता है। यहाँ सरल अंग्रेजी (और हिंदी) में स्पष्टीकरण दिया गया, जिसमें कुछ उपमाओं का उपयोग किया गया है।

समस्या: "वॉल्यूम नॉब" बनाम "दिशा"

कल्पना कीजिए कि आप एक घुमावदार सड़क पर कार चला रहे हैं।

  • ग्रेडिएंट (Gradient) वह सड़क है। कभी सड़क खड़ी (बड़ा ग्रेडिएंट) होती है, तो कभी सपाट (छोटा ग्रेडिएंट)।
  • अपडेट (Update) वह तरीका है जिससे आप स्टीयरिंग व्हील घुमाते हैं।

आदर्श रूप से, आपको केवल इस बात की परवाह होनी चाहिए कि स्टीयरिंग किस दिशा में घुमानी है (दिशा)। आप नहीं चाहते कि सड़क की ढलान की वजह से आप स्टीयरिंग को पागलों की तरह इधर-उधर घुमाएं। यदि सड़क अचानक अधिक खड़ी हो जाती है, तो आपको अचानक स्टीयरिंग को 90 डिग्री नहीं मोड़ना चाहिए; आपको बस उसी दिशा में स्टीoring जारी रखनी चाहिए।

लेखकों ने पाया कि मानक Adam (अलग-अलग नॉब्स के साथ) सड़क की "ढलान" के प्रति बहुत संवेदनशील है। यदि ग्रेडिएंट बड़ा हो जाता है, तो Adam अत्यधिक प्रतिक्रिया करता है। लेकिन जब दोनों नॉब्स को एक ही मान पर सेट किया जाता है, तो Adam "वॉल्यूम" (आकार) की परवाह करना बंद कर देता है और पूरी तरह से "दिशा" पर ध्यान केंद्रित करता है।

गुप्त नुस्खा: "ग्रेडिएंट स्केल इनवेरिएंस" (Gradient Scale Invariance)

यह पेपर इस गुण को Gradient Scale Invariance कहता है।

इसे संगीत सुनने जैसा समझें।

  • मानक Adam (अलग-अलग नॉब्स): यदि आप संगीत का वॉल्यूम बढ़ाते हैं (ग्रेडिएंट को बड़ा करते हैं), तो इक्वलाइज़र (ऑप्टिमाइज़र) घबरा जाता है और बास (bass) और ट्रेबल (treble) सेटिंग्स को बेतहाशा बदल देता है। गाना विकृत सुनाई देने लगता है।
  • संतुलित Adam (एक ही नॉब): यदि आप वॉल्यूम बढ़ाते हैं, तो इक्वलाइज़र शांत रहता। वह समझ जाता है, "ओह, गाना बस तेज़ है, लेकिन धुन वही है।" वह संगीत को सुचारू बनाए रखने के लिए, वॉल्यूम की परवाह किए बिना, सेटिंग्स को पूरी तरह से समायोजित करता है।

यह पेपर गणितीय रूप से सिद्ध करता है कि केवल तभी जब दो मेमोरी नॉब्स समान होते हैं, Adam यह "वॉल्यूम-प्रूफ" स्थिरता प्राप्त करता है। जब वे अलग होते हैं, तो गणित में एक "लैग" (विलंब) पैदा होता है जो ग्रेडिएंट के आकार में बदलाव होने पर रोबोट को लड़खड़ाने पर मजबूर कर देता है।

"स्मूथनेस" (सुचारूता) परीक्षण

इसे साबित करने के लिए, शोधकर्ताओं ने केवल अंतिम स्कोर (AI ने कैसा प्रदर्शन किया) को नहीं देखा। उन्होंने रोबोट की गतिविधियों को कदम-दर-कदम देखा।

उन्होंने दोलन (oscillation) को मापा (रोबोट के कदम कितनी बार इधर-उधर डगमगाते थे)।

  • जब नॉब्स अलग थे: रोबोट के कदम झटकेदार थे। कदम का आकार ऊपर-नीचे बहुत तेजी से बदल रहा था, जैसे खराब सस्पेंशन वाली कार।
  • जब नॉब्स समान थे: कदम अविश्वसनीय रूप से सुचारू हो गए। रोबोट एक स्थिर, लयबद्ध गति के साथ आगे बढ़ा।

उन्होंने कई अलग-अलग "रोबोटों" (AI मॉडल) पर इसका परीक्षण किया जो विभिन्न कार्य कर रहे थे:

  • विज़न (Vision): छवियों को पहचानना (जैसे बिल्ली बनाम कुत्ता)।
  • भाषा (Language): टेक्स्ट लिखना या प्रश्नों के उत्तर देना।

हर मामले में, "संतुलित" सेटिंग (β1=β2\beta_1 = \beta_2) ने सबसे सुचारू और स्थिर प्रशिक्षण दिया।

मुख्य निष्कर्ष

वर्षों तक, लोगों ने सोचा कि Adam में काम करने के लिए दो नॉब्स का अलग होना आवश्यक है। यह पेपर दिखाता है कि स्थिरता का "गुप्त नुस्खा" वास्तव में आँखों के सामने ही था: उन्हें समान बनाएं।

जब आप उन्हें समान सेट करते हैं, तो आप एक छिपी हुई महाशक्ति को अनलॉक करते हैं: ऑप्टिमाइज़र ग्रेडिएंट के आकार के अराजक उतार-चढ़ाव के प्रति प्रतिरक्षित हो जाता है। यह इस बात की "शोर" (noise) पर प्रतिक्रिया करना बंद कर देता है कि त्रुटि कितनी बड़ी है और पूरी तरह से इस "सिग्नल" पर ध्यान केंद्रित करने लगता है कि किस दिशा में जाना है।

संक्षेप में: यदि आप चाहते हैं कि आपका AI प्रशिक्षण अधिक सुचारू और स्थिर हो, तो सेटिंग्स का अनुमान लगाना बंद करें। बस दोनों मोमेंटम नॉब्स को एक ही नंबर पर सेट करें, और गणित को अपना काम करने दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →