Variational Proximal Policy Optimization
यह शोध पत्र वेरिएशनल प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन () प्रस्तुत करता है, जो एक पार्टिकल-आधारित वेरिएशनल इन्फरेंस फ्रेमवर्क है जो पॉलिसी मोड कोलैप्स और डिस्ट्रीब्यूशन ड्रिफ्ट को कम करने के लिए स्टाइन वेरिएशनल ग्रेडिएंट डिसेंट को मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर के साथ एकीकृत करता है, जिससे रीजनिंग बेंचमार्क और टोकन दक्षता में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को कोड लिखना, गणित की समस्याओं को हल करना, या लोगों के साथ इस तरह से बातचीत करना सिखाने की कोशिश कर रहे हैं जैसे इंसान वास्तव में पसंद करते हैं। इसे सिखाने का मानक तरीका (जिसे PPO या GRPO कहा जाता है) एक सख्त कोच की तरह है जो कहता है, "ठीक वही करो जो पिछली बार काम आया था, लेकिन बहुत अधिक बदलाव मत करो, वरना मैं तुम्हें रोक दूँगा।"
हालाँकि यह काम करता है, लेकिन यह पेपर तीन बड़ी समस्याओं की ओर इशारा करता है:
- "एक ही सुर" वाली समस्या (The "One-Note" Problem): रोबोट एक ही तरह की कुछ चीज़ों को बार-बार करने में फंस जाता है क्योंकि उनसे उसे उच्च स्कोर मिला था, जिससे वह समस्याओं को हल करने के अन्य रचनात्मक तरीकों को खो देता है।
- "नाजुकता" की समस्या (The "Brittle" Problem): यदि रोबोट नए विचारों को आज़माने की कोशिश करता है, तो वह अक्सर भ्रमित हो जाता है या टूट जाता है क्योंकि "कितना बदलाव किया जा सकता है" के नियम कठोर और मनमाने होते हैं।
- "भटकाव" की समस्या (The "Drift" Problem): रोबोट धीरे-धीरे भूल जाता है कि उसे कैसा व्यवहार करना चाहिए था और उच्च स्कोर पाने के लिए सिस्टम के साथ हेरफेर (gaming the system) करने लगता है, बिना वास्तव में मददगार बने।
नया समाधान: VP2O (Variational Proximal Policy Optimization)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे VP2O कहा जाता है। इसे समझने के लिए, आइए कुछ उपमाओं (analogies) का उपयोग करें।
1. "विशेषज्ञों की टीम" बनाम "सामान्यवादी" (The "Specialized Team" vs. The "Generalist")
एक विशाल मस्तिष्क को सब कुछ करने के लिए प्रशिक्षित करने के बजाय, यह पेपर एक Mixture-of-Experts (MoE) मॉडल का उपयोग करता है। इसे एक कंपनी के रूप में कल्पना करें जिसमें 20 अलग-अलग विशेषज्ञ (specialists) एक कमरे में बैठे हैं।
- पुराना तरीका: मैनेजर (रौटर) एक विशेषज्ञ को काम करने के लिए चुनता है, और वे सभी एक ही आदर्श विशेषज्ञ बनने की कोशिश करते हैं। अंततः, वे सभी एक जैसा सोचने लगते हैं और टीम अपनी रचनात्मकता खो देती है।
- VP2O का तरीका: मैनेजर प्रत्येक कार्य के लिए विशेषज्ञों की एक छोटी टीम चुनता है। VP2O प्रत्येक विशेषज्ञ को एक अद्वितीय "कण" (particle) या व्यक्ति के रूप में मानता है। लक्ष्य यह नहीं है कि वे सभी एक जैसे बन जाएँ; बल्कि यह है कि वे अलग हों, लेकिन अपने विशिष्ट कार्यों में सभी कुशल हों।
2. "चुंबकीय डांस फ्लोर" (Stein Variational Gradient Descent)
यही इस पेपर का मुख्य जादू है। कल्पना कीजिए कि 20 विशेषज्ञ एक डांस फ्लोर पर नर्तक (dancers) हैं।
- आकर्षण (चुंबकत्व): फ्लोर पर एक "उच्च-पुरस्कार" (high-reward) वाला क्षेत्र है (जहाँ सबसे अच्छे उत्तर हैं)। नर्तकों को चुंबकीय रूप से इस क्षेत्र की ओर खींचा जाता है।
- विकर्षण (निजी स्थान): पुराने तरीके में, नर्तक एक ही स्थान पर भीड़ लगा लेते हैं, जिससे वे एक-दूसरे से टकराते हैं (इसे "मोड कोलैप्स" कहा जाता है)। VP2O एक नियम जोड़ता है: "यदि आप किसी और के बहुत करीब हैं, तो आपको दूर हटना होगा।"
- परिणाम: नर्तक उच्च-पुरस्कार वाले क्षेत्र में फैल जाते हैं। वे अधिक क्षेत्र को कवर करते हैं, जिससे वे समस्या को हल करने के कई अलग-अलग तरीके (जैसे कोड लिखना) खोज पाते हैं, न कि केवल एक "परफेक्ट" तरीका।
3. "स्मार्ट कोच" बनाम "क्लिपिंग नियम" (The "Smart Coach" vs. The "Clipping Rule")
पुराने तरीके में, कोच एक "क्लिपिंग" नियम का उपयोग करता है: "यदि आप अपने डांस मूव्स को 10% से अधिक बदलते हैं, तो मैं आपको रोक दूँगा।" यह एक भद्दा उपकरण है।
- VP2O का दृष्टिकोण: एक कठोर रोक के बजाय, VP2O ज्यामिति (geometry) का उपयोग करता है। यह नर्तकों के आंदोलनों के "आकार" को देखता है। यह कहता है, "आप जितना चाहें उतना हिल सकते हैं, जब तक कि आप जहाँ से शुरू किया था उसके सापेक्ष इस विशिष्ट ज्यामितीय आकार के भीतर रहते हैं।"
- यह अधिक प्राकृतिक, सहज गति की अनुमति देता है। रोबोट बिना नियमों को तोड़े नए विचारों का पता लगा सकता है, क्योंकि नियम सीखने की प्रक्रिया के वास्तविक आकार पर आधारित हैं, न कि किसी मनमाने नंबर पर।
4. "ऑर्थोगोनल" लक्ष्य (The "Orthogonal" Goal)
यह सुनिश्चित करने के लिए कि विशेषज्ञ एक-दूसरे की नकल न करें, VP2O एक नियम जोड़ता है जिसे Orthogonalization कहा जाता है।
- उपमा: कल्पना कीजिए कि दो विशेषज्ञों को गणित की समस्या हल करने के लिए कहा गया है। यदि वे दोनों बिल्कुल एक ही विधि का उपयोग करते हैं, तो वह अक्षम है। VP2O उन्हें अलग-अलग विधियों का उपयोग करने के लिए मजबूर करता है (जैसे एक बीजगणित का उपयोग करता है, दूसरा ज्यामिति का)। यह सुनिश्चित करता है कि टीम के पास किसी भी समस्या को संभालने के लिए विविध उपकरणों की एक विस्तृत श्रृंखला हो।
जब उन्होंने इसे आज़माया तो क्या हुआ?
लेखकों ने इसे एक विशाल मॉडल (33 बिलियन पैरामीटर्स) और 20 विशेषज्ञों के साथ टेस्ट किया। यहाँ उन्हें क्या मिला:
- कोडिंग (Codeforces): यह सबसे बड़ी जीत थी। नए तरीके ने रोबोट के कोडिंग स्कोर में 179 अंकों का सुधार किया (प्रतिस्पर्धी प्रोग्रामिंग में एक बड़ी छलांग)। रोबोट केवल बेहतर नहीं हुआ; उसने कोड समस्याओं को हल करने के अधिक विविध तरीके भी खोजे।
- गणित (AIME): रोबोट ने अधिक गणितीय समस्याओं को सही ढंग से हल किया। दिलचस्प बात यह है कि इसने अंतिम उत्तर समझाने के लिए कम शब्दों का उपयोग किया, भले ही इसने "सोचने" (आंतरिक तर्क उत्पन्न करने) में अधिक समय बिताया। यह अधिक कुशल बन गया।
- निर्देशों का पालन (Instruction Following): रोबोट जटिल निर्देशों का पालन करने में बहुत बेहतर हो गया, संभवतः इसलिए क्योंकि वह "एक ही आकार में फिट होने वाली" दिनचर्या में नहीं फंसा था।
निष्कर्ष
यह पेपर दावा करता है कि AI के "मस्तिष्क" को विविध विशेषज्ञों की एक टीम के रूप में मानकर, जिन्हें एक समान होने के बजाय अलग होने के लिए प्रोत्साहित किया जाता है (चुंबकीय विकर्षण का उपयोग करके), AI बनता है:
- अधिक रचनात्मक (यह समस्याओं को हल करने के अधिक तरीके खोजता है)।
- अधिक स्थिर (यह क्रैश नहीं होता या फंसता नहीं है)।
- अधिक कुशल (यह काम पूरा करने के लिए कम टोकन का उपयोग करता है)।
लेखक इस बात पर जोर देते हैं कि यह तब सबसे अच्छा काम करता है जब AI को लंबे, जटिल उत्तर लिखने होते हैं (जैसे 16,000 टोकन), जहाँ एक एकल, कठोर रणनीति की तुलना में विविध "विशेषज्ञों" की एक टीम अधिक मूल्यवान होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।