Constrained Group Relative Policy Optimization
यह शोध पत्र Constrained GRPO को प्रस्तुत करता है, जो Group Relative Policy Optimization का एक लैग्रेंजियन-आधारित विस्तार है, जो समूह के भीतर सामान्यीकरण (within-group normalization) के कारण होने वाले हानिकारक युग्मन प्रभावों (coupling effects) को समाप्त करने के लिए कच्चे पुरस्कारों (raw rewards) के बजाय मानकीकृत लाभों (standardized advantages) को स्केलेराइज करके बाधा प्रवर्तन (constraint enforcement) और प्रशिक्षण स्थिरता में सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, शोधकर्ता बड़े कंप्यूटर मॉडलों को जटिल समस्याओं को हल करना सिखा रहे हैं, जैसे कि सेल्फ-ड्राइविंग कारों को चलाने से लेकर कठिन गणितीय पहेलियों को सुलझाने तक। ये मॉडल 'ट्रायल एंड एरर' (प्रयास और त्रुटि) के माध्यम से सीखते हैं, जिसे 'रीइन्फोर्समेंट लर्निंग' (सुदृढीकरण सीखना) कहा जाता है। कल्पना कीजिए कि एक छात्र भूलभुलैया सुलझाने की कोशिश कर रहा है; उसे बाहर निकलने पर इनाम मिलता है और दीवार से टकराने पर दंड। समय के साथ, छात्र इनाम को अधिकतम करने और दंड से बचने के लिए सीखता है। हालाँकि, एक बड़ी चुनौती तब आती है जब हम चाहते हैं कि मॉडल सख्त नियमों का पालन करे, जैसे कि "कभी भी पैदल यात्री से न टकराएं" या "हमेशा सही व्याकरण का उपयोग करें", जबकि वह मददगार होने का प्रयास भी करता रहे। यदि नियम बहुत कठोर हैं, तो मॉडल बेकार हो सकता है; यदि वे बहुत ढीले हैं, तो वह उन्हें तोड़ सकता है। इसे हल करने के लिए, वैज्ञानिक एक गणितीय ढांचे का उपयोग करते हैं जो सफलता की इच्छा और बाधाओं का पालन करने की आवश्यकता के बीच संतुलन बनाता है, और मॉडल के सीखने के दौरान प्रत्येक नियम के महत्व को समायोजित करता है।
इन मॉडलों को सिखाने का एक लोकप्रिय तरीका, जिसे 'ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन' (Group Relative Policy Optimization) कहा जाता है, पसंदीदा बन गया है क्योंकि यह कुशल है और इसे हर कदम का मूल्यांकन करने के लिए एक अलग "जज" मॉडल की आवश्यकता नहीं होती है। इसके बजाय, यह एक ही प्रश्न के लिए उत्पन्न किए गए उत्तरों के एक समूह की तुलना करके यह तय करता है कि कौन से बेहतर हैं। हालाँकि यह तरीका सामान्य कार्यों के लिए अच्छा काम करता है, शोधकर्ताओं ने पाया कि इसे सख्त सुरक्षा नियमों पर लागू करना मुश्किल था। एक नए अध्ययन में, मिला - क्यूबेक एआई संस्थान और इकोले पॉलिटेक्निक डी मॉन्ट्रियल की एक टीम ने खोजा कि विभिन्न लक्ष्यों को एक एकल स्कोर में संयोजित करने का मानक तरीका वास्तव में सिस्टम की नियमों का पालन करने की क्षमता को तोड़ रहा था। उन्होंने एक नया दृष्टिकोण पेश किया, 'कंस्ट्रेंड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन' (Constrained Group Relative Policy Optimization), जो इस दोष को ठीक करता है और मॉडलों को सुरक्षा सीमाओं का सख्ती से पालन करते हुए जटिल व्यवहार सीखने की अनुमति देता है।
मुख्य समस्या जिसे शोधकर्ताओं ने पहचाना वह थी कि कंप्यूटर एक साथ कई लक्ष्यों को कैसे संभालता है। मानक दृष्टिकोण में, मॉडल अपने सभी पुरस्कारों और दंडों को लेता है, उन्हें एक एकल संख्या में मिला देता है, और फिर सीखने में आसानी के लिए उस संख्या को 'नॉर्मलाइज' (सामान्य) करता है। शोधकर्ताओं ने दिखाया कि यह मिश्रण प्रक्रिया एक छिपी हुई बाधा (इंटरफेरेंस) पैदा करती है। जब कंप्यूटर एक नियम के वजन को समायोजित करता है, तो वह अनजाने में अन्य सभी नियमों के सापेक्ष महत्व को भी बदल देता है। यह एक ऑर्केस्ट्रा में एक ही वाद्य यंत्र की आवाज़ को नियंत्रित करने के लिए एक नॉब घुमाने जैसा है जो पूरे बैंड के संतुलन को भी बदल देता है; आप वायलिन को तेज़ करने की कोशिश कर सकते हैं, लेकिन ऐसा करने में, आप अनजाने में ड्रमों को बहुत धीमा और फ्लूट को बहुत तेज़ कर देते हैं। यह मॉडल के लिए यह सीखना बहुत कठिन बना देता है कि किस नियम का पालन करना है, जिससे अक्सर मॉडल सुरक्षा बाधाओं को अनदेखा कर देता है या प्रशिक्षण के दौरान अस्थिर हो जाता है।
इसे ठीक करने के लिए, शोधकर्ताओं ने संचालन के क्रम को बदल दिया। पुरस्कारों और दंडों को पहले मिलाने के बजाय, उन्होंने मॉडल को प्रत्येक नियम का मूल्य अलग-अलग गणना करने और उन्हें व्यक्तिगत रूप से नॉर्मलाइज करने दिया। प्रत्येक नियम को अपने आप में निष्पक्ष रूप से संसाधित करने के बाद ही वे उन्हें सीखे गए भारों (weights) का उपयोग करके जोड़ते हैं। यह सरल बदलाव छिपे हुए हस्तक्षेप को हटा देता है। संकेतों को अंत तक अलग रखकर, मॉडल स्पष्ट रूप से देख सकता है कि वह प्रत्येक विशिष्ट नियम में कितना सुधार कर रहा है। परिणाम एक बहुत अधिक स्थिर और अनुमानित सीखने की प्रक्रिया है। शोधकर्ताओं ने इस नई पद्धति का परीक्षण तीन बहुत अलग वातावरणों में किया: एक सरल ग्रिड-आधारित खेल जहाँ एक एजेंट को लावा से बचना था और बैटरी का प्रबंधन करना था, स्वायत्त ड्राइविंग का एक वास्तविक सिमुलेशन जिसमें हजारों जटिल ट्रैफिक परिदृश्य थे, और गणितीय तर्क कार्य जिसमें ग्रेड-स्कूल की वर्ड प्रॉब्लम्स शामिल थीं।
ग्रिड-आधारित खेल में, नए तरीके ने एजेंट को बहुत सहजता से सीखने की अनुमति दी। मानक दृष्टिकोण के कारण एजेंट अत्यधिक सतर्क हो गया, लावा से इतनी आक्रामकता से बचने लगा कि वह मुश्किल से हिल पा रहा था, जबकि नए तरीके ने एजेंट को अपने उपलब्ध "बजट" के जोखिम का प्रभावी ढंग से उपयोग करने दिया, जिससे वह सुरक्षित रहते हुए लक्ष्य तक पहुँच सका। स्वायत्त ड्राइविंग सिमुलेशन में, नए दृष्टिकोण ने ऐसे चालक तैयार किए जो न केवल सुरक्षित थे बल्कि अपने मार्गों को पूरा करने में अधिक प्रभावी भी थे। नए तरीके से प्रशिक्षित मॉडलों ने पिछले तरीकों (जिन्होंने पहले संकेतों को मिलाया था) की तुलना में सुरक्षा अनुपालन और मार्ग प्रगति में उच्च स्कोर प्राप्त किया। वे आगे बढ़ने की अपनी क्षमता से समझौता किए बिना टक्करों से बचने और यातायात नियमों का पालन करने में सफल रहे, एक ऐसा संतुलन जिसे अन्य तरीके बनाए रखने में संघर्ष करते रहे।
अंतिम परीक्षण में एक भाषा मॉडल को गणित की समस्याओं को हल करना सिखाना शामिल था, जबकि यह सुनिश्चित करना था कि उत्तर छोटे हों, प्रारूप (फॉर्मेट) सही हो और उनमें वैध संख्याएँ हों। यहाँ, नए तरीके ने फिर से श्रेष्ठता सिद्ध की। मानक मिश्रण दृष्टिकोण के साथ प्रशिक्षित मॉडल अक्सर अपने उत्तरों को छोटा करने या एक विशिष्ट प्रारूप में फिट करने के लिए शुद्धता का त्याग कर देते थे। इसके विपरीत, नए तरीके ने यह सुनिश्चित किया कि मॉडल गणित को सही करने को प्राथमिकता दे, जबकि फॉर्मेटिंग और लंबाई के उच्च मानकों को भी बनाए रखे। 1.5 बिलियन पैरामीटर्स वाले छोटे मॉडलों से लेकर 7 बिलियन वाले बड़े मॉडलों तक, विभिन्न आकार के कंप्यूटर मॉडलों में, नए दृष्टिकोण ने बिना किसी महंगे अतिरिक्त प्रशिक्षण घटकों के लगातार अधिक सटीक परिणाम दिए।
निष्कर्ष बताते हैं कि जिस तरह से हम विभिन्न सीखने के संकेतों को संयोजित करते हैं, वह उन संकेतों जितना ही महत्वपूर्ण है। केवल इस क्रम को बदलकर कि कंप्यूटर अपने पुरस्कारों और नियमों को कैसे प्रोसेस करता है, शोधकर्ता एक ऐसा सिस्टम बनाने में सक्षम रहे जो बाधाओं का बहुत अधिक विश्वसनीय रूप से सम्मान करता है। यह कार्य केवल एक छोटे सुधार की पेशकश नहीं करता है; यह कृत्रिम बुद्धिमत्ता को वास्तविक दुनिया में सुरक्षित रूप से संचालित करने के लिए प्रशिक्षित करने का एक स्पष्ट मार्ग प्रदान करता है, जहाँ नियमों का पालन करना अक्सर लक्ष्य प्राप्त करने जितना ही महत्वपूर्ण होता है। अध्ययन इस बात की पुष्टि करता है कि जब हम चाहते हैं कि एआई सक्षम और सुरक्षित दोनों हो, तो हमें सावधान रहना चाहिए कि हम सफलता को मापने के तरीके से मॉडल को भ्रमित न करें कि उसे वास्तव में क्या करना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।