← नवीनतम पेपर
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

यह शोध पत्र Gefen को प्रस्तुत करता है, जो एक मेमोरी-कुशल ऑप्टिमाइज़र है जो ऑटोमैटिक सेकंड-मोमेंट शेयरिंग और लर्नड फर्स्ट-मोमेंट क्वांटाइजेशन के माध्यम से AdamW के मेमोरी फुटप्रिंट को लगभग 8 गुना कम कर देता है, जिससे समान प्रदर्शन बनाए रखते हुए बड़े बैच साइज और बेहतर थ्रूपुट सक्षम होता है।

मूल लेखक: Nadav Benedek, Tomer Koren, Ohad Fried

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nadav Benedek, Tomer Koren, Ohad Fried

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल रोबोट (एक डीप लर्निंग मॉडल) को एक नया कौशल सिखाने के लिए प्रशिक्षित कर रहे हैं। इसे करने के लिए, आपके रोबोट को एक "कोच" (एक ऑप्टिमाइज़र) की आवश्यकता है जो हर अभ्यास सत्र के बाद उसे अपने आंतरिक सेटिंग्स को कैसे समायोजित करना है, यह बताए। इस समय सबसे लोकप्रिय कोच AdamW है।

AdamW एक बेहतरीन कोच है, लेकिन इसके पास एक भारी बैकपैक है। रोबोट के पास जितने भी सेटिंग्स हैं, उसके लिए AdamW दो अतिरिक्त नोटबुक (जिन्हें "फर्स्ट और सेकंड मोमेंट स्टेट्स" कहा जाता है) लेकर चलता है ताकि वह पिछली गलतियों और चीजें कितनी तेजी से बदल रही हैं, इसे याद रख सके। यदि आपके रोबोट में 1 अरब सेटिंग्स हैं, तो AdamW का बैकपैक 2 अरब सेटिंग्स के बराबर अतिरिक्त वजन जोड़ देता है। यह बैकपैक इतना भारी हो जाता है कि आप एक मानक प्रशिक्षण कंप्यूटर पर बड़ा रोबोट नहीं फिट कर सकते, या आपको अपने रोबोट को बहुत छोटे, धीमे कदमों में अभ्यास कराना पड़ता है।

यह शोध पत्र Gefen नामक एक नया कोच पेश करता है। Gefen एक "मेमोरी-कुशल" (memory-efficient) ऑप्टिमाइज़र है जो उस भारी बैकपैक को 8 गुना तक सिकोड़ देता है, जबकि यह सुनिश्चित करता है कि रोबोट की सीखने की गति और गुणवत्ता बिल्कुल AdamW के समान ही रहे।

यहाँ बताया गया है कि Gefen इसे कैसे करता है, कुछ सरल उपमाओं का उपयोग करते हुए:

1. "ग्रुप हग" रणनीति (नोट्स साझा करना)

समस्या: AdamW रोबोट के मस्तिष्क के हर एक नंबर के लिए एक अलग नोट लिखता है।
Gefen का समाधान: Gefen महसूस करता है कि इनमें से कई नंबर वास्तव में "पक्के दोस्त" हैं। वे दुनिया के प्रति बहुत समान रूप से प्रतिक्रिया देते हैं। हर एक दोस्त के लिए एक अद्वितीय नोट लिखने के बजाय, Gefen उन्हें टीमों (ब्लॉक्स) में समूहबद्ध करता है और पूरी टीम को एक साझा नोटबुक देता है।

  • यह कैसे जानता है कि किसे समूह में रखना है? आमतौर पर, आपको यह देखने के लिए कि कौन किसका दोस्त है, एक बहुत ही जटिल मानचित्र (जिसे हेसियन मैट्रिक्स कहा जाता है) की आवश्यकता होगी, लेकिन वह मानचित्र विशाल रोबोटों के लिए बहुत बड़ा होता है।
  • Gefen की ट्रिक: Gefen रोबोट के पहले अभ्यास सत्र को देखता है। वह देखता है कि कौन से नंबर एक साथ, एक समान पैटर्न में चले। वह मान लेता है, "यदि आप शुरुआत में एक साथ चले, तो आप बाद में भी एक साथ चलेंगे।" इसके बाद, वह इन नंबरों को स्वचालित रूप से समूहों में बाँट देता है। किसी इंसान को यह बताने की ज़रूरत नहीं है कि कौन से समूह बनाने हैं; वह खुद ही इसे समझ लेता है।

2. "स्केच आर्टिस्ट" रणनीति (क्वांटाइजेशन)

समस्या: साझा नोटबुक होने के बावजूद, उनके अंदर के नंबर अभी भी उच्च सटीकता (जैसे 10 दशमलव स्थानों) के साथ लिखे जाते हैं, जिसमें जगह अधिक लगती है।
Gefen का समाधान: Gefen एक "स्केच आर्टिस्ट" दृष्टिकोण का उपयोग करता है। सटीक नंबर (जैसे 0.123456789) लिखने के बजाय, यह इसे एक पूर्व-निर्मित सूची (कोडबुक) से निकटतम "मानक मान" तक राउंड कर देता है।

  • स्मार्ट लिस्ट: अधिकांश ऑप्टिमाइज़र एक जेनेरिक, निश्चित सूची (जैसे निश्चित निशानों वाला एक पैमाना) का उपयोग करते हैं। हालाँकि, Gefen उस विशिष्ट रोबट को देखता है जिसे वह कोच कर रहा है और केवल उसी रोबोट के लिए एक परफेक्ट लिस्ट सीखता है। यह डेटा के लिए एकदम सही पैमाना बनाने के लिए एक स्मार्ट गणितीय विधि (डायनेमिक प्रोग्रामिंग) का उपयोग करता है, जिससे त्रुटियाँ न्यूनतम हो जाती हैं।
  • स्थिरता: एक बार जब यह इस सूची को बहुत शुरुआत में सीख लेता है, तो यह पूरे समय इसी सूची का उपयोग करता रहता है। इसे हर दिन पैमाने को फिर से बनाने की आवश्यकता नहीं होती है, जिससे समय बचता है और चीजें स्थिर रहती हैं।

परिणाम: एक हल्का बैकपैक, वही प्रदर्शन

लेखकों ने विभिन्न मॉडलों पर Gefen का परीक्षण किया, छोटे इमेज क्लासिफायर से लेकर बड़े लैंग्वेज मॉडल्स (जैसे Llama 3) तक।

  • मेमोरी: Gefen ने AdamW की तुलना में ऑप्टिमाइज़र के लिए आवश्यक मेमोरी को लगभग 8 गुना कम कर दिया। 13-बिलियन पैरामीटर वाले मॉडल के लिए, यह लगभग 97 GB मेमोरी को घटाकर केवल 1.5 GB कर देता है।
  • गति: क्योंकि बैकपैक हल्का है, इसलिए रोबोट एक साथ एक बड़ा "माइक्रो-बैच" (अभ्यास समूह) ले जा सकता है। कई कंप्यूटरों (FSDP और DDP) का उपयोग करके किए गए परीक्षणों में, इससे प्रशिक्षण 56% तेज़ हो गया क्योंकि कंप्यूटर मेमोरी खाली होने का इंतज़ार नहीं कर रहे थे।
  • गुणवत्ता: भारी कंप्रेशन और शेयरिंग के बावजूद, रोबोट ने ठीक उतना ही सीखा जितना उसने भारी AdamW बैकपैक के साथ सीखा था। अंतिम प्रदर्शन (सटीकता या लॉस) बिल्कुल समान था।

यह क्यों महत्वपूर्ण है

इसे यात्रा के लिए पैकिंग करने जैसा समझें। AdamW एक ऐसे सूटकेस की तरह है जहाँ हर एक मोज़े के लिए एक अलग बॉक्स है। Gefen यह महसूस करने जैसा है कि आप अपने सभी मोज़ों को एक साथ रोल करके एक छोटे पाउच में रख सकते हैं। आप बहुत सारी जगह बचाते हैं, लेकिन आपके पास अभी भी आपके सभी मोज़े होते हैं, और आप अभी भी उतनी ही तेज़ी से अपने गंतव्य तक पहुँच सकते हैं।

शोध पत्र का दावा है कि Gefen एक "ड्रॉप-इन रिप्लेसमेंट" है, जिसका अर्थ है कि आप इसे अपने मौजूदा प्रशिक्षण कोड में बिना किसी सेटिंग को बदले सीधे बदल सकते हैं, और यह तुरंत आपकी मेमोरी बचाएगा और संभावित रूप से आपके प्रशिक्षण की गति बढ़ाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →