← नवीनतम पेपर
🤖 machine learning

RSPO: Regularized Self-Play Alignment of Large Language Models

यह शोध पत्र रेगुलराइज्ड सेल्फ-प्ले पॉलिसी ऑप्टिमाइजेशन (RSPO) को प्रस्तुत करता है, जो एक नया ढांचा है जो ओवर-ऑप्टिमाइजेशन को कम करने और कई बेंचमार्क में अलाइनमेंट प्रदर्शन और रिस्पॉन्स विविधता को महत्वपूर्ण रूप से सुधारने के लिए पूर्ववर्ती सेल्फ-प्ले विधियों को प्लग-एंड-प्ले रेगुलराइजर्स के साथ एकीकृत करता है।

मूल लेखक: Xiaohang Tang, Sangwoong Yoon, Seongho Son, Huizhuo Yuan, Quanquan Gu, Ilija Bogunovic

प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaohang Tang, Sangwoong Yoon, Seongho Son, Huizhuo Yuan, Quanquan Gu, Ilija Bogunovic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, शोधकर्ता लगातार कंप्यूटर प्रोग्रामों को मानवीय इच्छाओं को समझने और उनका पालन करने के लिए सिखाने का प्रयास कर रहे हैं। यह प्रक्रिया, जिसे अक्सर 'अलाइनमेंट' (alignment) कहा जाता है, अत्यंत महत्वपूर्ण है क्योंकि एक शक्तिशाली भाषा मॉडल जो तकनीकी रूप से तो शानदार है लेकिन मानवीय मूल्यों की अनदेखी करता है, वह खतरनाक या केवल बेकार हो सकता है। वर्षों से, इन मॉडलों को सिखाने का मानक तरीका 'सुपरवाइज्ड ट्रेनिंग' का एक रूप रहा है जहाँ मनुष्य इस पर फीडबैक देते हैं कि कौन से उत्तर बेहतर हैं। हालाँकि, एक नया और अधिक गतिशील दृष्टिकोण उभर कर आया है: 'सेल्फ-प्ले' (self-play)। कल्पना कीजिए कि एक ही एआई मॉडल के दो संस्करण एक-दूसरे के विरुद्ध प्रतिस्पर्धा कर रहे हैं, उत्तर उत्पन्न कर रहे हैं और नियमों के एक सेट के आधार पर निर्णय ले रहे हैं कि कौन सा बेहतर है। प्रतिस्पर्धा और सुधार के इस अंतहीन चक्र के माध्यम से, मॉडल सैद्धांतिक रूप से संचार करने के सर्वोत्तम तरीके खोजने के लिए सीखते हैं, ठीक वैसे ही जैसे एथलीट समान शक्ति वाले विरोधियों के साथ अभ्यास करके अपने कौशल को निखारते हैं।

हालाँकि, इस सेल्फ-प्ले पद्धति के साथ चुनौती यह है कि बिना किसी सुरक्षा जाल के, मॉडल बहुत आगे निकल सकते हैं। खेल जीतने की अपनी निरंतर दौड़ में, वे जजिंग सिस्टम (निर्णय प्रणाली) की खामियों का फायदा उठाना शुरू कर सकते हैं, जिससे ऐसे उत्तर उत्पन्न होते हैं जो कागज पर तो आदर्श दिखते हैं लेकिन वास्तव में निरर्थक या हानिकारक होते हैं। इस घटना को 'ओवर-ऑप्टिमाइजेशन' (over-optimization) कहा जाता है। यह एक ऐसे छात्र के समान है जो अभ्यास परीक्षण के सटीक उत्तर रट लेता है लेकिन अंतर्निहित अवधारणाओं को समझने में विफल रहता है, और फिर एक थोड़े अलग प्रश्न के सामने आते ही लड़खड़ा जाता है। इसे रोकने के लिए, शोधकर्ता आमतौर पर एक "रेगुलराइजेशन" (regularization) टर्म जोड़ते हैं, जो एक गणितीय बाधा है जो मॉडल को धीरे से उसके मूल, सुव्यवस्थित अवस्था की ओर वापस खींचती है। जबकि यह अवधारणा मशीन लर्निंग के अन्य क्षेत्रों में अच्छी तरह से समझी जाती है, इसे विशेष रूप से सेल्फ-प्ले के संदर्भ में काफी हद तक अनदेखा किया गया है, जिससे इस बात में एक कमी रह गई है कि हम इन प्रतिस्पर्धी मॉडलों को सुरक्षित और विश्वसनीय कैसे बनाए रखें।

शोधकर्ताओं की एक टीम ने 'रेगुलराइज्ड सेल्फ-प्ले पॉलिसी ऑप्टिमाइजेशन' (Regularized Self-Play Policy Optimization) या RSPO नामक एक नया फ्रेमवर्क पेश करके इस कमी को दूर किया है। उनका कार्य एक सरल लेकिन शक्तिशाली विचार पर केंद्रित है: क्या होगा यदि हम सेल्फ-प्ले गेम में मॉडलों को सही रास्ते पर रखने के लिए विभिन्न प्रकार के सुरक्षा प्रतिबंधों (safety constraints) को आसानी से जोड़ सकें? इन प्रतिबंधों को लागू करने के एक एकल, कठोर तरीके तक सीमित होने के बजाय, उनकी नई विधि इन विभिन्न रणनीतियों के एक लचीले मिश्रण की अनुमति देती है। शोधकर्ताओं ने मिस्ट्रल (Mistral), लामा (LLaMA) और जेम्मा (Gemma) आर्किटेक्चर पर आधारित कई लोकप्रिय लार्ज लैंग्वेज मॉडलों का उपयोग करके इस दृष्टिकोण का परीक्षण किया। उन्होंने पाया कि इन सुरक्षा प्रतिबंधों को सावधानीपूर्वक ट्यून करके, मॉडल बिना किसी प्रतिबंध के प्रशिक्षित मॉडलों की तुलना में काफी बेहतर परिणाम प्राप्त कर सकते हैं।

उनके प्रयोगों के परिणाम आश्चर्यजनक थे। जब उन्होंने मिस्ट्रल-7B (Mistral-7B) नामक मॉडल पर अपनी विधि लागू की, तो एक मानक बेंचमार्क के विरुद्ध उसके जीतने का प्रतिशत 28.5% से बढ़कर 35.4% हो गया। एक बड़े मॉडल, लामा-8B (LLaMA-8B) के लिए, जीत की दर 38.77% से बढ़कर 43.66% हो गई। यहाँ तक कि एक छोटे, अधिक कुशल जेम्मा-2B (Gemma-2B) के लिए भी, प्रदर्शन 50.54% से बढ़कर 51.83% हो गया। ये संख्याएँ एक सार्थक प्रगति का प्रतिनिधित्व करती हैं, जो बताती हैं कि मॉडल न केवल अधिक बार जीत रहे हैं, बल्कि वे उच्च-गुणवत्ता वाले उत्तर भी उत्पन्न कर रहे हैं जो अधिक सहायक और सत्यनिष्ठ हैं। केवल अधिक खेल जीतने के अलावा, शोधकर्ताओं ने देखा कि उनके तरीके से प्रशिक्षित मॉडल अधिक विविध उत्तर उत्पन्न करते हैं। कई मामलों में, अनियंत्रित सेल्फ-प्ले मॉडलों को बोलने की एक ही, दोहराव वाली शैली में सिमटने (collapse) के लिए मजबूर करता है, लेकिन नई विधि ने प्रतिक्रियाओं की एक समृद्ध विविधता को प्रोत्साहित किया, जो एक सहायक के रूप में काम करने के लिए आवश्यक है।

सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि सभी सुरक्षा प्रतिबंध एक ही तरह से काम नहीं करते हैं। शोधकर्ताओं ने पाया कि प्रतिबंधों के विभिन्न प्रकारों के मॉडलों के व्यवहार पर अलग-अलग प्रभाव पड़ते हैं। कुछ प्रकार के प्रतिबंध मॉडलों को छोटे, संक्षिप्त उत्तर लिखने के लिए प्रेरित करते हैं, जबकि अन्य प्रतिक्रिया की समग्र गुणवत्ता को बढ़ाने में बेहतर होते हैं। इन विभिन्न दृष्टिकोणों को मिलाकर, वे दोनों तरफ का सर्वश्रेष्ठ लाभ उठाने में सक्षम थे: ऐसे उत्तर जो उच्च-गुणवत्ता वाले भी थे और उचित रूप से संक्षिप्त भी। यह लचीलापन पिछले तरीकों की तुलना में एक बड़ा लाभ है, जो अक्सर केवल एक विशिष्ट प्रकार के प्रतिबंध का उपयोग करने तक सीमित थे। नया फ्रेमवर्क शोधकर्ताओं को इन उपकरणों को कार्य की विशिष्ट आवश्यकताओं के अनुरूप मिलाने और जोड़ने की अनुमति देता है, जिससे प्रशिक्षण प्रक्रिया अधिक मजबूत और अनुकूलनीय हो जाती है।

अध्ययन ने यह भी रेखांकित किया कि यह दृष्टिकोण अत्यधिक कुशल है। शोधकर्ताओं ने प्रदर्शित किया कि वे अपने तरीके का उपयोग छोटे बेस मॉडलों पर करके बहुत बड़े, अधिक जटिल मॉडलों के बराबर प्रदर्शन स्तर प्राप्त कर सकते हैं। यह सुझाव देता है कि प्रशिक्षण की गुणवत्ता मॉडल के आकार से उतनी ही महत्वपूर्ण है जितना कि स्वयं मॉडल। सेल्फ-प्ले के माध्यम से मॉडल के सीखने के तरीके को परिष्कृत करके, कम कंप्यूटिंग पावर से अधिक प्राप्त करना संभव है, जो एक महत्वपूर्ण विचार है क्योंकि ये तकनीकें व्यापक रूप ले रही हैं। शोधकर्ताओं ने सिद्ध किया कि उनकी विधि न केवल एक सैद्धांतिक सुधार है बल्कि एक व्यावहारिक उपकरण भी है जिसे वर्तमान प्रणालियों के पूर्ण बदलाव की आवश्यकता के बिना मौजूदा ट्रेनिंग पाइपलाइनों में आसानी से एकीकृत किया जा सकता है।

अंततः, यह कार्य आर्टिफिशियल इंटेलिजेंस को मानवीय मूल्यों के साथ अलाइन करने के लिए एक स्पष्ट मार्ग प्रदान करता है। यह दिखाता है कि सेल्फ-प्ले के दौरान मॉडलों को पटरी से उतरने से रोकने की कुंजी प्रतिस्पर्धा को रोकना नहीं है, बल्कि उसे सही प्रकार के प्रतिबंधों के साथ निर्देशित करना है। इन गाइड्स (मार्गदर्शकों) को लागू करने का एक लचीला तरीका प्रदान करके, शोधकर्ताओं ने क्षेत्र को एक शक्तिशाली नया उपकरण दिया है ताकि ऐसे एआई सिस्टम बनाए जा सकें जो न केवल स्मार्ट हैं, बल्कि सुरक्षित और अधिक विश्वसनीय भी हैं। निष्कर्ष बताते हैं कि एआई अलाइनमेंट का भविष्य सुधार की प्रेरणा और स्थिरता की आवश्यकता के बीच संतुलन बनाने में निहित है, यह सुनिश्चित करते हुए कि जैसे-जैसे ये सिस्टम अधिक सक्षम होते हैं, वे वास्तव में मनुष्यों की जरूरतों और मूल्यों पर मजबूती से टिके रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →