Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits
यह शोध पत्र BaSE का प्रस्ताव देने के लिए LLM-निर्देशित विकासवादी खोज (evolutionary search) की अनुभवजन्य नियमितताओं का विश्लेषण करता है, जो एक मल्टी-आर्म्ड बैंडिट एल्गोरिदम है जो समानांतर प्रक्षेप पथों (parallel trajectories) के बीच कंप्यूट को गतिशील रूप से आवंटित करता है, जिससे अंतर्निहित मॉडल या प्रॉम्प्ट्स को संशोधित किए बिना पारंपरिक डेप्थ-ब्रेड्थ रणनीतियों की तुलना में औसत फिटनेस में 12.3% सुधार और उन्नत विश्वसनीयता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि एक वर्ग के भीतर 26 वृत्तों को पूरी तरह से फिट करना या बिंदुओं को उनके बीच की दूरी को अधिकतम करने के लिए व्यवस्थित करना। आपके पास एक सुपर-स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो आपको टुकड़ों को व्यवस्थित करने के नए तरीके सुझा सकता है। हालाँकि, आपके पास उस सहायक से सुझाव माँगने के लिए "ऊर्जा" या "बजट" की एक सीमित मात्रा है।
यह शोध पत्र इस बारे में है कि उस ऊर्जा को खर्च करने का सबसे अच्छा तरीका क्या है ताकि आपको पहेली का सबसे अच्छा समाधान मिल सके।
समस्या: अपने "पूछने के" बजट को कैसे खर्च करें?
अतीत में, शोधकर्ताओं ने अपने सीमित बजट (AI से प्रश्न पूछने के बजट) का उपयोग करने के दो मुख्य तरीके आजमाए थे:
- "गहरा गोता" (गहराई - Depth): AI को एक एकल विचार लेने, उसे सुधारने, उसके बेहतर संस्करण के लिए पूछने और उस एक ही पथ पर लंबे समय तक चलते रहने के लिए कहें। यह एक बहुत गहरा गड्ढा खोदने जैसा है।
- "चौड़ा जाल" (विस्तार - Breadth): AI को एक साथ 100 अलग-अलग यादृच्छिक (random) विचार उत्पन्न करने के लिए कहें, उनमें से सबसे अच्छे को चुनें, और रुक जाएं। यह एक चौड़ा जाल फेंकने जैसा है लेकिन अंत में केवल एक मछली पकड़ना।
अधिकांश पिछले अध्ययनों ने केवल सबसे अच्छे परिणाम दर्ज किए जो उन्होंने सैकड़ों अलग-अलग संयोजनों को आज़माने के बाद प्राप्त किए। उन्होंने हमें यह नहीं बताया कि उनके परिणाम कितने विश्वसनीय थे और उन्हें एक निश्चित बजट के साथ लगातार कैसे प्राप्त किया जाए।
खोज: यह पहेली पर निर्भर करता है
लेखकों ने विभिन्न AI मॉडलों और तीन अलग-अलग प्रकार की पहेलियों के साथ हजारों प्रयोग चलाए। उन्होंने दो बड़े नियम खोजे:
- "क्षमता की सीमा" (The Capability Ceiling): यदि AI विशिष्ट पहेली के लिए पर्याप्त स्मार्ट नहीं है, तो आप अपना बजट कैसे भी खर्च करें, वह उसे हल नहीं कर पाएगा। लेकिन यदि AI पर्याप्त रूप से स्मार्ट है, तो जब आप वास्तविक "कम्प्यूटेशनल कार्य" को मापते हैं, तो एक छोटे AI और एक विशाल AI के बीच का अंतर समाप्त हो जाता है।
- "समाधान का आकार" (The Shape of the Solution):
- पहेली A (सर्कल पैकिंग): यह पहेली एक चौड़े, सपाट पठार (plateau) की तरह है। आप गहराई में जा सकते हैं या विस्तार में, और आप एक अच्छा समाधान पा लेंगे। यह उदार है।
- पहेली B (MinMax दूरियां): यह पहेली एक तीखी पहाड़ी की कगार (ridge) की तरह है। आपको गहराई में जाने और विस्तार में जाने के बीच सटीक संतुलन खोजना होगा। यदि आप बहुत गहरा या बहुत चौड़ा जाते हैं, तो आप शिखर को चूक जाएंगे।
समाधान: BaSE (स्मार्ट ट्रैफिक पुलिस)
लेखकों ने महसूस किया कि केवल "गहरा" या "चौड़ा" चुनना पर्याप्त नहीं है क्योंकि AI अप्रत्याशित है। कभी-कभी एक एकल रन एक बुरे विचार पर अटक जाता है, और कभी-कभी यह एक खजाना खोज लेता है।
उन्होंने एक नई विधि बनाई जिसे BaSE (बैंडिट-आधारित सेल्फ-इवॉल्विंग) कहा जाता है।
उपमा: स्लॉट मशीन रणनीति
कल्पना कीजिए कि आप एक कैसीनो में 10 अलग-अलग स्लॉट मशीनों (ये 10 अलग-अलग AI "रन" हैं जो पहेली को हल करने की कोशिश कर रहे हैं) के साथ हैं। आपके पास सिक्कों की एक निश्चित संख्या (आपका बजट) है।
- पुराना तरीका: आप एक मशीन चुनते हैं और अपने सारे सिक्के खत्म होने तक उसका लीवर खींचते रहते हैं। यदि वह मशीन "हारने वाली" है, तो आप सब कुछ खो देते हैं।
- BaSE तरीका: आप एक बार में सभी 10 मशीनों का लीवर खींचते हैं। फिर, आप देखते हैं कि कौन सी मशीनें सबसे अधिक भुगतान कर रही हैं। आप उन मशीनों को खाना खिलाना बंद कर देते हैं जो हार रही हैं और अपने शेष सभी सिक्के उन मशीनों में डाल देते हैं जो जीत रही हैं।
BaSE एक स्मार्ट ट्रैफिक पुलिस की तरह कार्य करता है। यह AI के मस्तिष्क या पहेली के नियमों को नहीं बदलता है। यह बस लगातार निगरानी करता है कि कौन से "पथ" काम कर रहे हैं और बजट को विजेताओं की ओर स्थानांतरित करता है जबकि हारने वालों को छोड़ देता है।
परिणाम
- बेहतर निरंतरता: BaSE का उपयोग करके, समाधानों का औसत स्कोर मौजूदा सर्वोत्तम तरीकों की तुलना में 12.3% सुधर गया।
- विश्वसनीयता: इसने परिणामों को बहुत अधिक विश्वसनीय बना दिया। सौ प्रयासों में से एक बार "जैकपॉट" पाने के बजाय, अब आप लगातार एक उच्च स्कोर प्राप्त करते हैं।
- कोई जादू का खेल नहीं: उन्होंने कोई स्मार्ट AI मॉडल या बेहतर प्रॉम्प्ट का उपयोग नहीं किया। उन्होंने बस अपने समान पैसे का अधिक समझदारी से उपयोग किया।
निष्कर्ष
यदि आपके पास AI से किसी कठिन समस्या को हल करने के लिए पूछने का सीमित बजट है, तो केवल एक पथ पर टिके न रहें या सब कुछ एक साथ न फेंकें। एक ऐसी रणनीति का उपयोग करें जो कई प्रयासों की एक साथ निगरानी करती है और तेजी से अपने संसाधनों को उन लोगों की ओर मोड़ देती है जो वास्तव में काम कर रहे हैं। यह शोध पत्र सिद्ध करता है कि आप अपने कंप्यूटिंग पावर का आवंटन कैसे करते हैं, यह उतना ही महत्वपूर्ण है जितना कि वह AI मॉडल जिसका आप उपयोग करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।