Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging
Hyper-ES एक सबस्पेस-आधारित इवोल्यूशन स्ट्रेटजी फ्रेमवर्क है जो पूर्व-निर्धारित ग्रेडिएंट डिसेंट दिशाओं के लेयर-वाइज मर्जिंग कोएफिशिएंट्स को अनुकूलित करके LLM रीजनिंग को बेहतर बनाता है, जिससे यह GRPO-LoRA जैसे ग्रेडिएंट-आधारित तरीकों की तुलना में कम संसाधनों के साथ बेहतर प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को कठिन गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, एक रोबोट को सिखाने के लिए, आपको उसे हजारों उदाहरण दिखाने होते हैं और उसके पूरे मस्तिष्क को, उसके हर न्यूरॉन को, "ग्रेडिएंट डिसेंट" नामक एक प्रक्रिया का उपयोग करके धीरे-धीरे ट्यून करना होता है। यह एक विशाल ऑर्केस्ट्रा को एक साथ हर वाद्य यंत्र को सुनने और हर तार को एक साथ ट्यून करने की कोशिश करने जैसा है। यह काम करता है, लेकिन इसके लिए एक विशाल, महंगे कंप्यूटर की आवश्यकता होती है और इसमें बहुत समय लगता है।
हाल ही में, वैज्ञानिकों ने रोबots को सिखाने का एक अलग तरीका खोजा है जिसे "इवोल्यूशन स्ट्रैटेजीज़" (ES) कहा जाता है। रोबोट के हर न्यूरॉन को सावधानी से ट्यून करने के बजाय, आप बस रोबोट के मस्तिष्क में हजारों छोटे, यादृच्छिक (random) बदलाव करते हैं, देखते हैं कि कौन से बदलाव गणित की समस्याओं में बेहतर प्रदर्शन करते हैं, और विजेताओं को चुन लेते हैं। यह "हॉट एंड कोल्ड" (सही और गलत का अनुमान लगाने वाला) खेल जैसा है जहाँ आप रोबोट के मस्तिष्क को तब तक बेतरतीब ढंग से हिलाते रहते हैं जब तक कि आप भाग्यशाली न हो जाएं। समस्या यह है कि जब रोबोट का मस्तिष्क बहुत बड़ा होता है (अरबों हिस्सों वाला), तो यादृच्छिक रूप से बदलाव करना लगभग विफल होने की गारंटी है। यह घास के ढेर में सुई खोजने की कोशिश करने जैसा है जहाँ आप केवल घास के ढेर को हाथ से उठाकर देखते हैं; आप अंत में केवल और अधिक घास ही पाएंगे और सुई नहीं। यह पेपर, HYPER-ES, इस समस्या को ठीक करने की कोशिश करता है—शुरू करने से पहले रोबोट को एक बेहतर नक्शा देकर।
समस्या: घास के ढेर में खो जाना
इस पेपर के लेखकों ने गौर किया कि जबकि इवोल्यूशन स्ट्रैटेजीज़ मेमोरी और कंप्यूटिंग पावर बचाने में बेहतरीन हैं, वे एक विशाल, अरबों-पैरामीटर वाले मस्तिष्क में सही दिशा खोजने में बहुत खराब हैं। यदि आप एक विशाल मॉडल पर बस यादृच्छिक शोर (random noise) फेंकते हैं, तो बदलाव इतने अराजक होते हैं कि वे एक-दूसरे को रद्द कर देते हैं या मॉडल को गलत दिशा में धकेल देते हैं। यह एक विशाल क्रूज शिप को नियंत्रित करने के लिए उस पर अलग-अलग कोणों से कंकड़ फेंकने जैसा है; जहाज शायद ही हिलेगा, या यह उस दिशा से भटक भी सकता है जहाँ आप जाना चाहते हैं। शोधकर्ता इसे "रैंडम वॉक" की समस्या कहते हैं, जहाँ मॉडल बेकार बदलावों के समुद्र में खो जाता है।
समाधान: "डिसेंट डायरेक्शन" का शॉर्टकट
इसे हल करने के लिए, HYPER-ES के पीछे की टीम ने एक चतुर दो-चरणीय ट्रिक निकाली है। रोबोट को शून्य से सही दिशा का अनुमान लगाने देने के बजाय, वे पहले उससे पारंपरिक, भारी-भरकम तरीके का उपयोग करके कुछ बहुत छोटे, सस्ते "अभ्यास रन" (practice runs) लेने के लिए कहते हैं।
कल्पना कीजिए कि आप एक पहाड़ पर सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं। अंधेरे में बिना देखे भटकने (random shuffling) के बजाय, आप पहले कुछ छोटे ड्रोन भेजते हैं जो थोड़ा ऊपर चढ़ते हैं और देखते हैं कि रास्ता किस ओर ढलान वाला है। इन ड्रोनों को पूरा पहाड़ चढ़ने की ज़रूरत नहीं है; उन्हें बस यह पता लगाने की ज़रूरत है कि "नीचे की ओर" (एक उपयोगी दिशा) कौन सी है। HYPER-ES विधि बिल्कुल यही करती है: यह कुछ त्वरित, कम लागत वाले प्रशिक्षण सत्र चलाती है ताकि कुछ "डिसेंट डायरेक्शंस" (नीचे की ओर जाने वाली दिशाएं) मिल सकें—मूल रूप से, कुछ अच्छे अनुमान कि रोबोट के मस्तिष्क को और स्मार्ट बनाने के लिए उसे किस दिशा में धकेलना चाहिए।
जादुई मिश्रण: सर्वश्रेष्ठ अनुमानों को मिलाना
एक बार जब उनके पास ये कुछ अच्छी दिशाएं आ जाती हैं, तो असली जादू होता है। इवोल्यूशन स्ट्रैटेजी को पूरे अरबों-पैरामीटर वाले मस्तिष्क में फिर से खोजने देने के बजाय, यह केवल उन कुछ दिशाओं को मिलाने से बने एक छोटे, संक्षिप्त स्थान में खोज करता है।
इसे एक ऐसे शेफ की तरह समझें जिसने पहले ही तीन बेहतरीन सामग्रियां (डिसेंट डायरेक्शंस) पहचान ली हैं। पूरी किराने की दुकान में नई सामग्रियों की तलाश करने के बजाय, शेफ उन तीन सामग्रियों को मिलाने का परफेक्ट रेसिपी खोजने के लिए इवोल्यूशन स्ट्रैटेजी का उपयोग करता है। रोबोट पूछता है, "यदि मैं दिशा A का 30%, दिशा B का 50%, और दिशा C का 20% मिलाता हूँ, तो क्या मुझे एक बेहतर गणित समाधान मिलेगा?"
यह पेपर इस मिश्रण को करने के लिए CMA-ES नामक एक परिष्कृत एल्गोरिदम का उपयोग करता है। यह एक मास्टर शेफ द्वारा सूप को चखने और परत दर परत मसालों को एडजस्ट करने जैसा है, लेकिन मसालों के बजाय, यह इस बात को एडजस्ट करता है कि रोबोट के मस्तिष्क में प्रत्येक "अच्छी दिशा" को कितनी मात्रा में जोड़ा जाए। यह एक अरबों संभावनाओं की खोज को केवल कुछ सौ नंबरों की खोज में बदल देता है, जिससे यह अविश्वसनीय रूप से तेज़ और कुशल हो जाता है।
उन्होंने क्या पाया
शोधकर्ताओं ने इस नई पद्धति का परीक्षण तीन अलग-अलग लार्ज लैंग्वेज मॉडल्स (विशेष रूप से Qwen2.5 और DeepSeek-R1) पर किया और उन्हें छह अलग-अलग गणितीय तर्क डेटासेट्स के साथ चुनौती दी, जिसमें सरल अंकगणित से लेकर जटिल प्रतियोगिता-स्तर की गणितीय समस्याएं शामिल थीं।
परिणाम उत्साहजनक थे। HYPER-ES ने मानक "रैंडम शफल" पद्धति को लगातार मात दी और पारंपरिक, भारी-भरकम प्रशिक्षण पद्धति (जिसे GRPO-LoRA कहा जाता है) को भी सटीकता के मामले में थोड़ा पीछे छोड़ दिया। विशेष रूप से, इस नई पद्धति ने औसतन लगभग 1% अधिक सटीकता प्राप्त की, जबकि इसमें 10% कम महंगे कंप्यूटर अपडेट का उपयोग किया गया।
सरल शब्दों में, HYPER-ES ने रोबोट को गणित में बेहतर बनाने के लिए कुछ स्मार्ट शॉर्टकट्स लेने और फिर उन शॉर्टकट्स को सावधानी से मिलाने का तरीका अपनाया, बजाय इसके कि वे समाधान के लिए ज़ोर-ज़बरदस्ती (brute-force) करें। यह सुझाव देता है कि आपको किसी समस्या के लिए पूरा किचन फेंकने की ज़रूरत नहीं है; कभी-कभी, कुछ अच्छे दिशा-निर्देश ढूंढना और उन्हें पूरी तरह से मिलाना ही रोबोट की तर्क करने की क्षमता को अनलॉक करने की कुंजी होती है। यह पेपर दिखाता है कि यह दृष्टिकोण AI के सोचने के तरीके को सुधारने का एक स्थिर, मेमोरी-कुशल तरीका है, खासकर जब आपके पास सुपरकंप्यूटर उपलब्ध न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।