← नवीनतम पेपर
🔢 mathematics

PowerStep: Memory-Efficient Adaptive Optimization via p\ell_p-Norm Steepest Descent

PowerStep एक मेमोरी-कुशल एडेप्टिव ऑप्टिमाइज़र है जो सेकंड-मोमेंट सांख्यिकी (second-moment statistics) को संग्रहीत किए बिना p\ell_p-नॉर्म स्टीपेस्ट डिसेंट (steepest descent) के माध्यम से कोऑर्डिनेट-वाइज एडेप्टिविटी प्राप्त करता है, जो एडम (Adam) की अभिसरण गति (convergence speed) से मेल खाता है और बड़े पैमाने पर ट्रांसफॉर्मर प्रशिक्षण के लिए मेमोरी ओवरहेड को महत्वपूर्ण रूप से कम करता है।

मूल लेखक: Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल रोबोट (एक न्यूरल नेटवर्क) को एक नई भाषा बोलना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आप रोबोट द्वारा बोला गया हर वाक्य सुनने के बाद उसे फीडबैक देते हैं। यह फीडबैक एक "ग्रेडिएंट" (gradient) है, जो रोबोट को बताता है कि बेहतर होने के लिए उसे किस दिशा में आगे बढ़ना चाहिए।

वर्षों तक, इन रोबोटों को प्रशिक्षित करने का मानक तरीका Adam रहा है। Adam एक बहुत ही सावधान, अत्यधिक व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है। जब भी रोबोट कोई गलती करता है, Adam केवल वर्तमान गलती को नहीं देखता; बल्कि वह एक विशाल, विस्तृत बहीखाता (एक "सेकंड-मोमेंट बफर") रखता है जिसमें रोबोट द्वारा की गई अब तक की हर एक गलती का रिकॉर्ड होता है।

  • समस्या: जैसे-जैसे रोबोट बड़े होते जाते हैं (अरबों पैरामीटर्स के साथ), यह बहीखाता विशाल होता जाता है। यह इतना अधिक मेमोरी लेता है कि यह सब कुछ धीमा कर देता है या सिस्टम को क्रैश कर देता है। यह बिल्कुल वैसा ही है जैसे भारी विश्वकोशों से भरा एक भारी बैकपैक लेकर मैराथन दौड़ने की कोशिश करना।

पेश है PowerStep: "स्मार्ट इंट्यूशन" (सहज ज्ञान) वाला दृष्टिकोण

इस शोध पत्र के लेखक PowerStep नामक एक नया ऑप्टिमाइज़र पेश करते हैं। उस भारी ऐतिहासिक डेटा वाले बैकपैक को ढोने के बजाय, PowerStep ज्यामिति (geometry) और अंतर्ज्ञान (intuition) पर आधारित एक चतुर तकनीक का उपयोग करता है।

यहाँ बताया गया है कि PowerStep कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "भारी गेंद" बनाम "बहीखाता"

  • Adam (बहीखाता): "मुझे याद है कि कल आपने शब्द 'A' पर एक बड़ी गलती की थी, और शब्द 'B' पर एक छोटी सी। मैं आपके पिछले गलतियों के वर्ग (square) के आधार पर आपके पथ को समायोजित करूँगा।" इसके लिए बहुत सारा डेटा स्टोर करने की आवश्यकता होती है।
  • PowerStep (भारी गेंद): PowerStep "मोमेंटम" (momentum) की अवधारणा का उपयोग करता है। कल्पना कीजिए कि एक पहाड़ी से नीचे लुढ़कती एक भारी गेंद। यदि गेंद तेजी से लुढ़क रही है (एक मजबूत संकेत), तो वह चलती रहती है। यदि वह धीरे लुढ़क रही है (एक कमजोर संकेत), तो उसे थोड़े धक्के की जरूरत होती है।
    • PowerStep को गेंद की गति के इतिहास को याद रखने की आवश्यकता नहीं है। यह बस यह देखता है कि गेंद अभी कितनी तेजी से चल रही है।
    • यह वर्तमान गति पर एक विशेष "जादुई फ़िल्टर" (एक साइन्ड पावर ट्रांसफॉर्म) लागू करता है। यदि गेंद बहुत तेजी से चल रही है, तो यह फ़िल्टर इसे धीरे से धीमा कर देता है। यदि गेंद बहुत धीरे चल रही है, तो यह इसे एक बढ़ावा (boost) देता है।

2. "वॉल्यूम नॉब" की उपमा

रोबोट की सीखने की प्रक्रिया को एक साउंड सिस्टम की तरह समझें जिसमें हजारों वॉल्यूम नॉब (रोबोट के हर हिस्से के लिए एक) हैं।

  • Adam प्रत्येक नॉब को कैसे घुमाना है, यह तय करने के लिए संगीत के पूरे इतिहास को सुनता है। यह सटीक है, लेकिन इसे सारा इतिहास प्रोसेस करने के लिए एक विशाल कंप्यूटर की आवश्यकता होती है।
  • PowerStep ध्वनि के वर्तमान वॉल्यूम को सुनता है।
    • यदि कोई नॉब पहले से ही बहुत ऊंचे स्तर पर है (रोबोट आश्वस्त है या ग्रेडिएंट बड़ा है), तो PowerStep वॉल्यूम को थोड़ा कम कर देता है ताकि यह बहुत तेज न हो जाए (overshooting से बचने के लिए)।
    • यदि कोई नॉब मुश्किल से चालू है (रोबोट अनिश्चित है या ग्रेडिएंट छोटा है), तो PowerStep वॉल्यूम को बढ़ा देता है ताकि वह बेहतर तरीके से सुन सके।
    • जादू: यह बिना किसी इतिहास की किताब को लिखे इसे तुरंत करता है। यह बस वर्तमान क्षण के प्रति प्रतिक्रिया देता है।

यह एक बड़ी बात क्यों है?

शोध पत्र दावा करता है कि PowerStep की तीन मुख्य जीतें हैं:

  1. यह आधा आकार का है: क्योंकि PowerStep को उस विशाल "सेकंड-मोमेंट बहीखाते" को स्टोर करने की आवश्यकता नहीं है, इसलिए यह Adam की तुलना में 50% कम मेमोरी का उपयोग करता है। यह विश्वकोशों के भारी बैकपैक को एक हल्के नोटबुक से बदलने जैसा है।
  2. यह उतना ही तेज़ है: हल्का होने के बावजूद, PowerStep ठीक उतनी ही गति से सीखता है जितनी गति से Adam सीखता है। यह भी उतनी ही देर में फिनिश लाइन तक पहुँच जाता है।
  3. यह "कंप्रेशन" (दबाव) में भी जीवित रहता है: शोधकर्ताओं ने डेटा को एक बहुत ही छोटे, कम गुणवत्ता वाले प्रारूप (जिसे "int8 क्वांटाइजेशन" कहा जाता है) में दबाने की कोशिश की, जो आमतौर पर Adam को खराब कर देता है क्योंकि इसमें बहुत अधिक विवरण खो जाता है।
    • Adam: जब इसे दबाया जाता है, तो Adam का "बहीखाता" खोए हुए विवरणों के कारण इतना भ्रमित हो जाता है कि रोबोट गोल-गोल घूमने लगता है (diverge हो जाता है)।
    • PowerStep: क्योंकि यह नाजुक ऐतिहासिक बहीखाते के बजाय वर्तमान मोमेंटम पर निर्भर करता है, इसलिए यह डेटा को दबाने के बाद भी स्थिर रहता है। यह उन्हें मानक विधि की तुलना में 8 गुना अधिक मेमोरी उपयोग को कम करने की अनुमति देता है, बिना रोबोट को खराब किए।

निष्कर्ष

यह शोध पत्र प्रदर्शित करता है कि भविष्य के विशाल AI मॉडल को प्रभावी ढंग से प्रशिक्षित करने के लिए आपको भारी इतिहास की किताब ले जाने की आवश्यकता नहीं है। वर्तमान क्षण के "मोमेंटम" के प्रति प्रतिक्रिया करने वाले एक स्मार्ट, ज्यामिति-आधारित दृष्टिकोण का उपयोग करके, PowerStep उद्योग के मानक (Adam) के समान परिणाम प्राप्त करता है, लेकिन आधे मेमोरी खर्च के साथ। और जब आप इसे डेटा कंप्रेशन के साथ जोड़ते हैं, तो यह भविष्य के विशाल AI मॉडल को प्रशिक्षित करने के लिए एक अविश्वसनीय रूप से कुशल उपकरण बन जाता है।

नोट: यह पेपर 124 मिलियन से लेकर 235 बिलियन पैरामीटर्स तक के मॉडल्स पर इसकी पुष्टि करता है, जो यह साबित करता है कि यह किसी भी पैमाने पर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →