Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
यह शोधपत्र पास-एट-के (Pass-at-k) पॉलिसी ऑप्टिमाइजेशन (PKPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पृथक प्रयासों के बजाय नमूना सेटों की सामूहिक सफलता (pass@k) को सीधे अनुकूलित करने के लिए निष्पक्ष अनुमानकों (unbiased estimators) को व्युत्पन्न करता है, जिससे k-एनीलिंग (k-annealing) के माध्यम से pass@1 प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए अन्वेषण को बढ़ावा मिलता है और कठिन समस्याओं को हल करने में मदद मिलती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र को कठिन गणित के सवालों को हल करना सिखाने की कोशिश कर रहे हैं।
पुराना तरीका: "पहली कोशिश" का जाल (The "First Try" Trap)
पारंपरिक रूप से, AI मॉडल (जैसे कि वे जो कोड लिखते हैं या गणित हल करते हैं) को प्रशिक्षित करते समय, कंप्यूटर एक समस्या को हल करने की कोशिश करता है, एक स्कोर प्राप्त करता है, और फिर उस एकल प्रयास के आधार पर अपने मस्तिष्क (brain) को समायोजित करता है। यदि पहली कोशिश विफल हो जाती है, तो कंप्यूटर अन्य प्रयासों से कुछ भी नहीं सीख पाता जो उसने पृष्ठभूमि में किए होंगे। यह एक छात्र की तरह है जो एक परीक्षा देता है, एक प्रश्न गलत करता है, और तुरंत हार मान लेता है, इस तथ्य को अनदेखा कर देता है कि यदि वह बस चलते रहना जारी रखता, तो शायद वह अपनी दूसरी या तीसरी कोशिश में इसे सही ढंग से हल कर लेता।
यह विधि Pass@1 के लिए अनुकूलित होती है: "क्या पहली ही उत्तर सही था?" यह AI को सुरक्षित और रूढ़िवादी बनने के लिए मजबूर करती है, जिससे वह उन जोखिम भरे, रचनात्मक अनुमानों से बच जाता है जिनकी वास्तव में कठिन समस्याओं को हल करने के लिए आवश्यकता होती है।
नया विचार: "बैच में से सर्वश्रेष्ठ" दृष्टिकोण (The "Best of the Batch" Approach)
इस शोध पत्र के लेखक एक नई रणनीति प्रस्तावित करते हैं जिसे Pass@K Policy Optimization (PKPO) कहा जाता है।
केवल पहले उत्तर की परवाह करने के बजाय, यह विधि कहती है: "आइए हम प्रत्येक समस्या के लिए K अलग-अलग प्रयास उत्पन्न करें (मान लीजिए 8 या 16)। हमें इस बात से कोई फर्क नहीं पड़ता कि पहले 7 गलत हैं; हमें केवल इस बात से फर्क पड़ता है कि उनमें से कम से कम एक सही हो।"
एक मछली पकड़ने वाले जाल की तरह सोचें।
- पुराना तरीका: आप एक धागा डालते हैं। यदि आप मछली चूक जाते हैं, तो आप उसे वापस खींच लेते हैं और कुछ भी नहीं सीखते।
- PKPO विधि: आप 16 धागों वाला एक जाल डालते हैं। यदि एक भी धागा मछली पकड़ लेता है, तो पूरा जाल सफल है। AI को जाल में मिले सर्वश्रेष्ठ शिकार के लिए पुरस्कृत किया जाता है, न कि सभी धागों के औसत के लिए।
जादुई ट्रिक: स्कोर कार्ड (The Magic Trick: The Score Card)
कठिनाई यह है कि AI को यह कैसे सिखाया जाए कि वह ऐसा करे। यदि आप केवल AI को कहते हैं "आपको धागे नंबर 4 पर मछली मिली," तो हो सकता है कि वह धागों को नंबर 1, 2 और 3 को अनदेखा कर दे। लेकिन यदि आप उसे कहते हैं "आपको एक मछली मिली, इसलिए आपने अच्छा काम किया," तो हो सकता है कि उसे यह समझ न आए कि कौन सा धागा असली नायक था।
लेखकों ने एक विशेष गणितीय "स्कोर कार्ड" (एक एस्टीमेटर/estimator) का आविष्कार किया है जो एक स्मार्ट रेफरी की तरह काम करता है।
- यह सभी 16 प्रयासों को देखता है।
- यह एक स्कोर की गणना करता है जो AI को समूह में कोई भी सही उत्तर होने के लिए पुरस्कृत करता है।
- महत्वपूर्ण रूप से, यह "गलत" उत्तरों को भी थोड़ा श्रेय देता है, क्योंकि वे उस समूह का हिस्सा थे जिसने अंततः विजेता को जन्म दिया। यह AI को साहसी, जोखिम भरे विचार आज़माने और खोजबीन करने के लिए प्रोत्साहित करता है, यह जानते हुए कि यदि बाद में एक "अच्छा" अनुमान दिखाई देता है, तो एक "बुरा" अनुमान भी टीम की सफलता में योगदान देता है।
यह क्यों महत्वपूर्ण है
शोध पत्र दिखाता है कि यह विधि कठिन कार्यों के लिए एक सुपरपावर की तरह काम करती है:
- यह कठिन समस्याओं को खोलता है: गणित और कोडिंग की बहुत कठिन चुनौतियों पर जहाँ पुराना "पहली कोशिश" वाला तरीका अटक जाता है, यह नई विधि सीखना जारी रखती है और अंततः समाधान निकाल लेती है।
- यह लचीला है: आप AI को कह सकते हैं, "प्रशिक्षण के पहले आधे हिस्से के लिए, एक जोखिम लेने वाला बनें और 8 में से सर्वश्रेष्ठ के लिए लक्ष्य रखें। दूसरे आधे हिस्से के लिए, पहली कोशिश को सही करने पर ध्यान केंद्रित करें।" यह "एनीलिंग" (नियमों को धीरे-धीरे बदलना) AI को पहले अन्वेषण करने और फिर अपने कौशल को परिष्कृत करने में मदद करता है।
- यह वास्तविक मॉडलों के साथ काम करता है: उन्होंने इसे लोकप्रिय ओपन-सोर्स मॉडलों (GEMMA2 और LLAMA3.1) पर परखा और पाया कि इसने पिछले तरीकों की तुलना में गणित की समस्याओं को हल करने और कोड लिखने की उनकी क्षमता में काफी सुधार किया।
संक्षेप में
यह शोध पत्र AI को पहली बार में ही पूर्ण होने की चिंता छोड़ना सिखाता है। इसके बजाय, यह उसे विचारों का एक विविध सेट उत्पन्न करना, किसी भी विजेता के होने पर पूरे समूह को पुरस्कृत करना, और उस सामूहिक सफलता का उपयोग सबसे कठिन पहेलियों को हल करने के लिए सीखना सिखाता है। यह एक एकल अनुमान के व्यक्तिगत प्रदर्शन के बजाय कई अनुमानों के सामूहिक प्रयास को महत्व देने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।