← नवीनतम पेपर
💻 computer science

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

यह शोध पत्र यह प्रदर्शित करता है कि डिस्कवरी डोमेन के लिए लार्ज लैंग्वेज मॉडल्स की पोस्ट-ट्रेनिंग में इवोल्यूशन स्ट्रैटेजीज़ (ES), सुदृढीकरण लर्निंग (RL) की तुलना में बेहतर प्रदर्शन करती हैं क्योंकि वे व्यापक समाधान कवरेज और उच्च पास@k स्कोर बनाए रखती हैं, जिससे वे आउटपुट डिस्ट्रीब्यूशन कोलैप्स से बच पाती हैं जो विविध संभावित समाधान उत्पन्न करने में RL की प्रभावशीलता को सीमित करता है।

मूल लेखक: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

प्रकाशित 2026-08-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, धुंध भरे द्वीप पर छिपे हुए खजाने की तलाश करने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, लार्ज लैंग्वेज मॉडल्स (LLMs) उन अविश्वसनीय रूप से स्मार्ट खोजकर्ताओं की तरह हैं जो नक्शे पढ़ सकते हैं और अनुमान लगा सकते हैं कि खजाना कहाँ हो सकता है। लंबे समय तक, इन खोजकर्ताओं को प्रशिक्षित करने का सबसे अच्छा तरीका उन्हें एक समस्या दिखाना, उन्हें अनुमान लगाने देना और फिर उन्हें केवल तभी पुरस्कृत करना था जब उनका एक सबसे अच्छा अनुमान एकदम सही हो। यह तरीका, जिसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है, एक सख्त कोच की तरह है जो हर गलत अनुमान पर "गलत!" चिल्लाता है और एक सही उत्तर पर "परफेक्ट!" कहता है। समस्या यह है कि यह कोच उस एक सही उत्तर को खोजने के लिए इतना जुनूनी हो जाता है कि खोजकर्ता कहीं और देखना बंद कर देता है। वे द्वीप के उन धुंधले किनारों की खोज करना बंद कर देते हैं जहाँ अन्य खजाने छिपे हो सकते हैं, और केवल उसी एक स्थान पर ध्यान केंद्रित करते हैं जिसे वे सही समझते हैं।

लेकिन क्या होगा अगर खजाना केवल एक चीज़ नहीं है? क्या होगा अगर गणित की समस्या को हल करने या किसी नए वैज्ञानिक तथ्य की खोज करने के कई अलग-अलग तरीके हों? इन "डिस्कवरी" डोमेन में, केवल एक सही अनुमान लगाना पर्याप्त नहीं है; आपको किसी भी सही समाधान को पकड़ने के लिए एक विस्तृत जाल की आवश्यकता होती है। यहीं पर एक नया विचार जिसे "टेस्ट-टाइम स्केलिंग" कहा जाता है, काम आता है। केवल मॉडल से एक उत्तर मांगने के बजाय, हम उसे दर्जनों या यहाँ तक कि सैकड़ों अलग-अलग प्रयास करने के लिए कहते हैं और देखते हैं कि क्या उनमें से कोई भी सही है। आप जिस शोध पत्र को पढ़ने जा रहे हैं, वह इस बात की जांच करता है कि हमारा सख्त कोच (RL) या एक अलग प्रकार की प्रशिक्षण विधि, खोजकर्ता को एक विस्तृत जाल बिछाने में मदद करने के लिए बेहतर है। शोधकर्ताओं ने पाया कि जबकि सख्त कोच खोजकर्ता को एक ही स्थान पर बहुत आत्मविश्वासी बनाता है, एक अलग विधि जिसे इवोल्यूशन स्ट्रैटेजीज़ (ES) कहा जाता है, खोजकर्ता को जिज्ञासु और भटकता हुआ बनाए रखती है, जिससे यह सुनिश्चित होता है कि यदि धुंध में कहीं भी कोई समाधान मौजूद है, तो खोजकर्ता के उसे खोजने की संभावना बहुत अधिक है।


शोध पत्र: सर्वश्रेष्ठ अनुमान से परे

यह शोध पत्र AI को प्रशिक्षित करने की एक पेचीदा समस्या पर काम करता है: हम यह कैसे सुनिश्चित करें कि एक AI मॉडल केवल एक सही उत्तर का अनुमान लगाने में बहुत अच्छा न हो जाए, बल्कि वास्तव में किसी भी सही उत्तर को खोजने के लिए अपने विकल्प खुले रखे? लेखक, जो कॉग्निजेंट एआई लैब और टेक्सास विश्वविद्यालय ऑस्टिन के शोधकर्ता हैं, ने दो प्रशिक्षण विधियों की तुलना की: मानक रीइन्फोर्समेंट लर्निंग (RL) और एक नया दृष्टिकोण जिसे इवोल्यूशन स्ट्रैटेजीज़ (ES) कहा जाता है।

रीइन्फोर्समेंट लर्निंग को एक ऐसे छात्र की तरह समझें जो उत्तर कुंजी (answer key) को रटकर परीक्षा के लिए तैयारी कर रहा है। यदि छात्र प्रश्न का सही उत्तर देता है, तो उसे इनाम मिलता है; यदि वह गलत होता है, तो उसे कुछ नहीं मिलता। समय के साथ, छात्र उस विशिष्ट प्रश्न में मास्टर बन जाता है लेकिन अंतर्निहित अवधारणाओं को समझने के बजाय केवल उसे रटने लगता है। AI की दुनिया में, यह "डिस्ट्रीब्यूशन कोलैप्स" (distribution collapse) नामक स्थिति पैदा करता है। मॉडल अपने "सर्वश्रेष्ठ अनुमान" पर इतना केंद्रित हो जाता है कि वह विविध उत्तर देना बंद कर देता है। यह एक ऐसे संगीतकार की तरह है जो केवल एक ही नोट बजाता है क्योंकि उसे उसी पर तालियाँ मिलती हैं, और इस तरह वह पूरा गाना बजाना भूल जाता है।

दूसरी ओर, इवोल्यूशन स्ट्रैटेजीज़ (ES) एक प्राकृतिक पारिस्थितिकी तंत्र (ecosystem) की तरह काम करती है। एक एकल मॉडल को प्रशिक्षित करने के बजाय, ES मॉडल के कई थोड़े अलग संस्करणों की एक पूरी "जनसंख्या" बनाता है। यह उनके "मस्तिष्क" (weights) में यादृच्छिक रूप से बदलाव करता है, जैसे प्रकृति में जीन उत्परिवर्तित (mutate) होते हैं, और देखता है कि कौन से संस्करण सबसे अच्छा प्रदर्शन करते हैं। महत्वपूर्ण बात यह है कि यह केवल एक विजेता को चुनकर बाकी को खारिज नहीं करता है; यह पूरे समूह से सीखता है। यह AI के "मस्तिष्क" को लचीला और विविध बनाए रखता है, जिससे यह समाधान के कई अलग-अलग रास्तों की खोज कर सकता है।

शोधकर्ताओं ने गणित की समस्याओं पर इनका परीक्षण किया, जो सरल अंकगणित से लेकर जटिल ओलंपियाड-स्तर की चुनौतियों तक फैली हुई थीं, और विभिन्न आकार के मॉडलों (1.5 बिलियन से 32 बिलियन पैरामीटर्स तक) का उपयोग किया। उन्होंने सफलता को pass@k नामक मीट्रिक का उपयोग करके मापा। कल्पना कीजिए कि आप AI को एक समस्या के 100 अलग-अलग उत्तर उत्पन्न करने के लिए कह रहे हैं। Pass@1 पूछता है, "क्या पहला उत्तर सही है?" Pass@k पूछता है, "क्या 100 उत्तरों में से कम से कम एक सही है?"

यहाँ उनके निष्कर्ष दिए गए हैं:

1. "सर्वश्रेष्ठ अनुमान" का जाल
जब शोधकर्ताओं ने pass@1 (एकल सर्वश्रेष्ठ अनुमान) को देखा, तो RL-प्रशिक्षित मॉडल अक्सर बहुत अच्छे थे। वे बहुत सटीक और आत्मविश्वासी थे। हालाँकि, जैसे-जैसे शोधकर्ताओं ने अनुमानों की संख्या (k) को 2, 8, 16, या यहाँ तक कि 128 तक बढ़ाया, RL मॉडल एक दीवार से टकरा गए। उनका प्रदर्शन सुधरना बंद हो गया। वास्तव में, कुछ कठिन समस्याओं के लिए, RL मॉडल कई बार अनुमान लगाने के अवसर दिए जाने पर मूल, अप्रशिक्षित मॉडल से भी खराब प्रदर्शन करने लगे। RL मॉडल की सोच इतनी संकीर्ण हो गई थी कि उसने उन सही उत्तरों को खोजना बंद कर दिया जो उसके "पसंदीदा" उत्तर से थोड़े अलग थे।

2. विविधता की शक्ति
इसके विपरीत, ES-प्रशिक्षित मॉडलों ने एक अलग पैटर्न दिखाया। हालांकि वे पहला अनुमान सही करने में भी अच्छे थे, लेकिन उनकी असली सुपरपावर तब सामने आई जब अनुमानों की संख्या बढ़ी। जैसे-जैसे शोधकर्ताओं ने अधिक और अधिक नमूने (128 तक) मांगे, ES मॉडल लगातार नए और सही समाधान खोजने में सफल रहे। शोध पत्र दिखाता है कि ES ने सभी मॉडल आकारों और परीक्षण किए गए गणितीय बेंचमार्क में लगातार उच्च pass@k स्कोर प्राप्त किया।

3. यह क्यों होता है
लेखकों ने इस बात की गहराई से जांच की कि क्यों ऐसा हुआ। उन्होंने पाया कि RL प्रशिक्षण AI के ज्ञान को "छंटनी" (prune) करने का काम करता है। यह उन रास्तों को हटा देता है जो सही लेकिन कम सामान्य उत्तरों की ओर ले जाते हैं, जिससे कुछ समस्याएं हल करना असंभव हो जाता है, भले ही AI 100 बार प्रयास करे। ES विधि, इसके विपरीत, AI के ज्ञान की "व्यापकता" को बनाए रखती है। यह केवल सही उत्तर नहीं सीखती; यह कई दरवाजे खुले रखने के लिए सीखती है। जब शोधकर्ताओं ने AI के "एन्ट्रॉपी" (उत्तरों की विविधता का एक माप) को देखा, तो उन्होंने पाया कि जब RL मॉडल विफल हुए, तो वे आत्मविश्वास के साथ गलत थे (कम विविधता)। जब ES मॉडल विफल हुए, तो वे अभी भी विविध और अनिश्चित थे, जिसका अर्थ है कि वे अभी भी खोज कर रहे थे और अधिक समय या कंप्यूटिंग शक्ति मिलने पर उनके सही उत्तर खोजने की बेहतर संभावना थी।

4. वास्तविक दुनिया पर प्रभाव
यह शोध पत्र सुझाव देता है कि उन समस्याओं के लिए जहाँ हमें नई चीजों की खोज करने की आवश्यकता होती है—जैसे कठिन गणितीय प्रमाण को हल करना, कोड लिखना, या कोई नया वैज्ञानिक तथ्य खोजना—एक ऐसा मॉडल होना अधिक मूल्यवान है जो सही समाधानों की एक विस्तृत श्रृंखला उत्पन्न कर सके, बजाय एक ऐसे मॉडल के जो केवल एक विशिष्ट अनुमान में बहुत अच्छा है। ES का उपयोग करके, हम इन डिस्कवरी डोमेन में बेहतर परिणाम प्राप्त कर सकते हैं क्योंकि मॉडल के "लोकल ट्रैप" (स्थानीय जाल) में फंसने की संभावना कम होती है और वैश्विक समाधान खोजने की संभावना अधिक होती है।

संक्षेप में, शोध पत्र का तर्क है कि यदि आप चाहते हैं कि एक AI अज्ञात में एक महान खोजकर्ता बने, तो आपको इसे केवल दिन का सर्वश्रेष्ठ अनुमान लगाने वाला बनाने के लिए प्रशिक्षित नहीं करना चाहिए। आपको इसे अपने विकल्प खुले रखने, थोड़ा भटकने और खजाना चाहे कहीं भी छिपा हो, उसे खोजने के लिए तैयार रहने के लिए प्रशिक्षित करना चाहिए। यह स्पष्ट है कि रोमांच के इस तरह के सफर के लिए 'इवोल्यूशन स्ट्रैटेजीज़' एक बेहतर कोच है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →