Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning
यह शोध पत्र एक नवीन ढांचे का प्रस्ताव करता है जो सुदृढीकरण शिक्षण फाइन-ट्यूनिंग (reinforcement learning fine-tuning) के माध्यम से LLM सर्च ऑपरेटर को निरंतर परिष्कृत करके एल्गोरिदम खोज के लिए LLM-आधारित विकासवादी खोज (evolutionary search) को बढ़ाता है, जिससे कॉम्बिनेटरियल ऑप्टिमाइज़ेशन कार्यों में श्रेष्ठ समाधानों की पहचान करने की प्रक्रिया में तेजी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बेहतरीन केक बनाने के लिए एक नई, सुपर-एफिशिएंट रेसिपी का आविष्कार करने की कोशिश कर रहे हैं। आपके पास एक बहुत ही प्रतिभाशाली शेफ (लार्ज लैंग्वेज मॉडल, या LLM) है जो रेसिपी लिख सकता है।
पुराना तरीका: "स्टैटिक शेफ" (The Static Chef)
पिछले तरीकों में (जैसे कि "FunSearch" नामक एक विधि), आप शेफ से एक रेसिपी लिखने के लिए कहते थे। आप उसे बेक करते, चखते और देखते कि वह कैसी है। अगर वह ठीक है, तो आप उसे रखते हैं। अगर वह बहुत बढ़िया है, तो आप शेफ से उस बढ़िया रेसिपी को देखकर उससे थोड़ी बेहतर रेसिपी लिखने के लिए कहते हैं। आप इसे हजारों बार दोहराते हैं।
समस्या यह है कि शेफ इस प्रक्रिया से वास्तव में सीखता नहीं है। वे एक ऐसे जीनियस की तरह हैं जो हर प्रयास के बाद सब कुछ भूल जाता है। वे अपनी मूल ट्रेनिंग के आधार पर केवल अनुमान लगाते रहते हैं, इस उम्मीद में कि वे किस्मत के सहारे एक बेहतर रेसिपी ढूंढ लेंगे। वे एक अच्छा केक बनाने के पीछे के कारणों के बारे में अपने आंतरिक ज्ञान को अपडेट नहीं करते हैं।
नया तरीका: "इवोट्यून" (EvoTune - वह शेफ जो सीखता है)
लेखकों ने इस नए तरीके के रूप में EvoTune प्रस्तावित किया है। यह उसी प्रतिभाशाली शेफ को काम पर रखने जैसा है, लेकिन इस बार, आप उन्हें एक विशेष ट्रेनिंग लूप देते हैं:
- स्वाद परीक्षण (Evolutionary Search): बिल्कुल पहले की तरह, शेफ कई रेसिपी लिखता है। आप उन्हें बेक करते हैं, चखते हैं और स्कोर देते हैं। आप सबसे अच्छी रेसिपी को रखते हैं और खराब वाली को फेंक देते हैं।
- सबक (Reinforcement Learning): यह जादुई कदम है। केवल खराब रेसिपी को फेंकने के बजाय, आप शेफ को "विजेताओं" और "हारने वालों" को दिखाते हैं और कहते हैं, "देखो, अंतर यहाँ है! विजेता ने यह किया, हारने वाले ने वह किया।"
- अपडेट (The Update): फिर आप इन सबक के आधार पर शेफ को एक त्वरित "रिफ्रेशर कोर्स" (फाइन-ट्यूनिंग) देते हैं। शेफ का दिमाग वास्तव में बदल जाता है ताकि वह समझ सके कि जीतने वाली रेसिपी क्यों काम कर रही थी।
- दोहराएं (Repeat): अब, जब आप शेफ को अगली रेसिपी लिखने के लिए कहते हैं, तो वे केवल अनुमान नहीं लगा रहे होते हैं; वे अपने नए अपडेटेड ज्ञान का उपयोग करके बहुत तेज़ी से अच्छे परिणामों की ओर बढ़ रहे होते हैं।
यह बेहतर क्यों है?
इसे एक विशाल जंगल में छिपे खजाने को खोजने जैसा समझें।
- पुराना तरीका: आप एक स्काउट भेजते हैं जिसके पास एक नक्शा है लेकिन कोई याददाश्त नहीं है। वे इधर-उधर घूमते हैं, एक जगह ढूंढते हैं, खजाना चेक करते हैं, और फिर सब कुछ भूल जाते हैं। अगली जगह खोजने के लिए उन्हें फिर से बेतरतीब ढंग से भटकना पड़ता है।
- EvoTune: स्काउट को एक जगह मिलती है, और उसे एहसास होता है, "ओह, यहाँ पेड़ अधिक घने हैं, इसलिए खजाना पास में ही होना चाहिए," और वह अपने आंतरिक मानचित्र को अपडेट करता है। अगली बार जब वे बाहर जाते हैं, तो वे बेतरतीब ढंग से नहीं भटकते; वे सीधे आशाजनक क्षेत्रों की ओर चलते हैं।
उन्होंने क्या टेस्ट किया?
शोधकर्ताओं ने इसका परीक्षण तीन कठिन "पहेली" खेलों पर किया जहाँ कंप्यूटरों को चीजों को व्यवस्थित करने का सबसे अच्छा तरीका खोजना होता है:
- बिन पैकिंग (Bin Packing): अलग-अलग आकार के बक्सों को कम से कम ट्रकों में फिट करने की कोशिश करना।
- ट्रैवलिंग सेल्समैन (Traveling Salesman): शहरों की एक सूची में बिना दोबारा कदम रखे जाने वाले सबसे छोटे रास्ते को खोजना।
- फ्लैटपैक (Flatpack): अजीब आकार के ब्लॉकों को एक ग्रिड में बिना एक-दूसरे के ऊपर चढ़े (overlap) फिट करना (जैसे कि एक जटिल टेट्रिस)।
परिणाम
उन्होंने पाया कि "सीखने वाला शेफ" (EvoTune) "स्टैटिक शेफ" (पुरानी विधि) की तुलना में बहुत तेज़ी से बेहतर समाधान खोज लेता है।
- बेहतर स्कोर: EvoTune द्वारा खोजे गए एल्गोरिदम (रेसिपी) अधिक कुशल थे।
- अधिक विविधता: सीखने वाले शेफ ने केवल एक अच्छा समाधान नहीं खोजा और रुक गया; उसने अद्वितीय, उच्च-गुणवत्ता वाले समाधानों की एक विस्तृत विविधता भी खोजी।
- वास्तविक दुनिया की जीत: एक विशिष्ट चुनौती में (डेटा सेंटर में सर्वर रखने के बारे में गूगल का 'हैश कोड' प्रतियोगिता), EvoTune ने एक ऐसा समाधान खोजा जो प्रतियोगिता में मानव टीमों द्वारा खोजे गए सर्वश्रेष्ठ समाधान से भी बेहतर था।
सीक्रेट सॉस (The Secret Sauce)
पेपर में यह भी उल्लेख किया गया है कि उन्होंने शेफ को रचनात्मक बनाए रखने के लिए एक विशेष ट्रिक का उपयोग किया। कभी-कभी, जब आप एक मॉडल को बहुत अधिक सिखाते हैं, तो वह "फँस" जाता है और बार-बार एक ही चीज़ लिखता रहता है। इसे रोकने के लिए, उन्होंने एक विशेष गणितीय नियम (जिसे "Forward KL" कहा जाता है) का उपयोग किया जो शेफ को विजेताओं से सीखते हुए भी नए विचारों को एक्सप्लोर करने के लिए मजबूर करता है।
संक्षेप में
EvoTune एक ऐसा सिस्टम है जो खोजने (कई चीजें आज़माना) और सीखने (क्या काम कर रहा है इसके आधार पर मस्तिष्क को अपडेट करना) को जोड़ता है। यह एक स्थिर टूल को एक आत्म-सुधार करने वाले साथी में बदल देता है जो समस्या को हल करने के लिए जितना अधिक प्रयास करता है, उतना ही स्मार्ट होता जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।