ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
यह शोध पत्र ESSAM को पेश करता है, जो एक मेमोरी-कुशल फुल पैरामीटर फाइन-ट्यूनिंग फ्रेमवर्क है जो इवोल्यूशन स्ट्रेटजीज (Evolution Strategies) को शार्पनेस-अवेयर मैक्सिमाइजेशन (Sharpness-Aware Maximization) के साथ जोड़ता है ताकि पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों जैसे कि PPO और GRPO की तुलना में GPU मेमोरी के उपयोग को काफी कम करते हुए LLMs पर प्रतिस्पर्धी गणितीय तर्क प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning" का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।
बड़ी समस्या: "भारी बैकपैक"
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (एक लार्ज लैंग्वेज मॉडल या LLM) है जो गणित में अच्छा है, लेकिन उसे कठिन शब्द समस्याओं (word problems) को हल करने में वास्तव में माहिर होने के लिए अतिरिक्त ट्यूशन की आवश्यकता है।
आमतौर पर, इस छात्र को ट्यूशन देने का सबसे अच्छा तरीका रीइन्फोर्समेंट लर्निंग (RL) नामक विधि है। RL को एक बहुत ही सख्त, हाई-टेक कोच के रूप में समझें जो छात्र द्वारा किए गए हर कदम को देखता है, सुधार के लिए सटीक गणना करता है, और तुरंत फीडबैक देता है। यह बहुत अच्छा काम करता है, लेकिन इसका एक बहुत बड़ा नुकसान है: इसे सभी गणनाओं को करने के लिए कंप्यूटर मेमोरी (GPU मेमोरी) के एक विशाल बैकपैक की आवश्यकता होती है।
एक मानक गणित की समस्या के लिए, यह "बैकपैक" एक छोटी कार जितना भारी (सैकड़ों गीगाबाइट) हो सकता है। अधिकांश लोगों और छोटे लैब्स के पास इस भार को ढोने के लिए कार के आकार का कंप्यूटर नहीं होता, इसलिए वे इस शक्तिशाली कोचिंग पद्धति का उपयोग नहीं कर सकते।
पुराना समाधान: "अनुमान और जांच" की टीम
भारी बैकपैक से बचने के लिए, शोधकर्ताओं ने इवोल्यूशन स्ट्रैटेजीज़ (ES) नामक एक अलग विधि आज़माई।
- यह कैसे काम करता है: एक सख्त कोच के बजाय, 10 इमर्जिंग एक्सप्लोरर्स (खोजकर्ताओं) की एक टीम की कल्पना करें। वे सभी एक ही स्थान से शुरू करते हैं, लेकिन प्रत्येक एक थोड़ा अलग, यादृच्छिक रास्ता (एक "परटर्बेशन") लेता है। वे सभी गणित की समस्या को हल करने की कोशिश करते हैं। जो सही उत्तर प्राप्त करते हैं, उन्हें "पुरस्कार" मिलता है। टीम फिर विजेताओं को देखती है और कहती है, "ठीक है, आइए हम सभी थोड़ा उस दिशा में बढ़ें जिस दिशा में विजेता गए थे।"
- लाभ: यह विधि अविश्वसनीय रूप से हल्की है। इसे भारी बैकपैक की आवश्यकता नहीं है क्योंकि यह जटिल बैकवर्ड गणनाएँ नहीं करती है। इसे केवल मॉडल को एक बार चलाने के लिए पर्याप्त मेमोरी की आवश्यकता होती है (जैसे एक मानक उपयोगकर्ता को)।
- दोष: हालांकि यह हल्की है, खोजकर्ता अक्सर "उथले घाटियों" (shallow valleys) में फंस जाते हैं। वे एक ऐसा समाधान ढूंढ लेते हैं जो ठीक-ठाक काम करता है, लेकिन वह बहुत मजबूत नहीं होता। यदि आप उन्हें थोड़ी अलग गणित की समस्या देते हैं, तो वे भ्रमित हो सकते हैं। उनमें जनरलाइजेशन (नई स्थितियों में सीखी गई बातों को लागू करने की क्षमता) की कमी होती है।
नया समाधान: ESSAM (एक "स्मार्ट हाइकर")
लेखकों ने ESSAM (एवोल्यूशन स्ट्रैटेजीज़ विद शार्पनेस-अवेयर मैक्सिमाज़ेशन) नामक एक नई विधि प्रस्तावित की है। वे "अनुमान और जांच" वाली टीम के हल्के बैकपैक को बनाए रखना चाहते थे, लेकिन परिणामों को बेहतर बनाने के लिए उसमें सख्त कोच की "स्मार्टनेस" भी जोड़ना चाहते थे।
ESSAM कैसे काम करता है, इसे हाइकिंग (पदयात्रा) की उपमा से समझते हैं:
- "शार्पनेस" की समस्या: कल्पना कीजिए कि खोजकर्ता एक शिखर (सर्वश्रेष्ठ उत्तर) की ओर हाइकिंग कर रहे हैं। कभी-कभी, वे एक ऐसा शिखर पाते हैं जो ऊँचा तो दिखता है लेकिन वास्तव में एक नुकीली, ऊबड़-खाबड़ चट्टान है। यदि हवा चलती है (एक नई गणित की समस्या आती है), तो वे आसानी से गिर सकते हैं। यह एक "शार्प मिनिमम" (तीव्र न्यूनतम) है।
- ESSAM की ट्रिक: टीम उस दिशा में बढ़ने के लिए प्रतिबद्ध होने से पहले, एक स्काउट को उस दिशा के आस-पास के इलाके की जांच करने के लिए भेजता है।
- स्काउट पूछता है: "यदि हम इस दिशा में बढ़ते हैं, तो क्या जमीन समतल और स्थिर है, या यह एक नुकीली चट्टान है?"
- यदि जमीन नुकीली (शार्प) है, तो टीम अपनी दिशा में थोड़ा पीछे हट जाती है। वे ऐसी दिशा की तलाश करते हैं जहाँ जमीन समतल और चौड़ी (एक "फ्लैट मिनिमम") हो।
- एक सपाट शिखर अधिक सुरक्षित होता है। भले ही हवा चले या समस्या थोड़ी बदल जाए, टीम शिखर पर बनी रहती है।
तकनीकी शब्दों में: ESSAM मानक "अनुमान और जांच" विधि को लेता है और उसमें एक "नेबरहुड प्रोब" (पड़ोस की जांच) जोड़ देता है। यह अस्थायी रूप से मॉडल के पैरामीटर्स को एक नजदीकी स्थान पर ले जाता है, यह जांचता है कि क्या पुरस्कार वहां स्थिर है, और इस जानकारी का उपयोग मुख्य अपडेट को निर्देशित करने के लिए करता है। यह मॉडल को ऐसे समाधान खोजने के लिए मजबूर करता है जो मजबूत हों, न कि केवल भाग्यशाली।
परिणाम: पंख जैसा हल्का, बैल जैसा मजबूत
पत्र ने एक लोकप्रिय गणित डेटासेट जिसे GSM8K (ग्रेड-स्कूल गणित की शब्द समस्याओं का संग्रह) कहा जाता है, पर इसका परीक्षण किया।
- प्रदर्शन: ESSAM ने भारी, मेमोरी-गहन रीइन्फोर्समेंट लर्निंग विधियों (जैसे PPO और GRPO) के समान प्रदर्शन किया। वास्तव में, कुछ मॉडलों पर, यह उनसे भी बेहतर था।
- मेमोरी: यह बड़ी जीत है। जहाँ भारी विधियों को सैकड़ों गीगाबाइट मेमोरी की आवश्यकता थी, वहीं ESSAM ने बुनियादी "अनुमान और जांच" विधि के समान ही कम मेमोरी का उपयोग किया।
- उपमा: यदि पुराने तरीकों को अपना उपकरण ढोने के लिए एक सेमी-ट्रक की आवश्यकता थी, तो ESSAM एक साइकिल में फिट हो जाता है।
- आंकड़े: इसने मानक भारी विधि (PPO) की तुलना में 18 गुना कम मेमोरी और अन्य लोकप्रिय विधि (GRPO) की तुलना में 10 गुना कम मेमोरी का उपयोग किया।
- जनरलाइजेशन: जब उन गणित की समस्याओं पर परीक्षण किया गया जिन्हें उन्होंने पहले नहीं देखा था (अलग-अलग डेटासेट), तो ESSAM-प्रशिक्षित मॉडल मानक "अनुमान और जांच" मॉडलों की तुलना में उन्हें हल करने में बहुत बेहतर थे। उन्होंने गणित के सिद्धांत को सीखा था, न कि केवल विशिष्ट उत्तरों को रटा था।
"टर्बो" संस्करण (ESSAM-F)
लेखकों ने एक तेज़ संस्करण भी बनाया जिसे ESSAM-F कहा जाता है।
- यह कैसे काम करता है: यह "चेकिंग" चरण के लिए स्काउट्स की एक छोटी टीम का उपयोग करता है।
- परिणाम: यह मूल ESSAM की तुलना में दोगुनी तेज़ी से चलता है जबकि उतनी ही कम मेमोरी का उपयोग करता है और लगभग उतनी ही उच्च सटीकता बनाए रखता है।
सारांश
यह शोध पत्र ESSAM पेश करता है, जो गणित सिखाने का एक नया तरीका है। यह "अनुमान और जांच" विधियों की कम लागत को "स्मार्ट स्टेबिलिटी चेक" (शार्पनेस-अवेयर मैक्सिमाज़ेशन) के साथ जोड़ता है।
- पहले: आपको "उच्च प्रदर्शन लेकिन भारी/महंगा" (RL) या "हल्का/सस्ता लेकिन कमजोर" (मानक ES) के बीच किसी एक को चुनना पड़ता था।
- अब: ESSAM के साथ, आपको भारी विधियों का उच्च प्रदर्शन और सरल विधियों का हल्का/सस्ता फुटप्रिंट दोनों मिलते हैं। यह छोटे लैब्स और ओपन-सोर्स समुदायों को सुपरकंप्यूटर की आवश्यकता के बिना शक्तिशाली गणित-तर्क (math-reasoning) AI को प्रशिक्षित करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।