Overton Pluralistic Reinforcement Learning for Large Language Models
यह शोध पत्र OP-GRPO को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (रीइन्फोर्समेंट लर्निंग) ढांचा है जो एक समानता अनुमानक (सिमिलैरिटी एस्टिमेटर) को प्रशिक्षित करके और एक दोहरी-पुरस्कार प्रणाली का उपयोग करके एक एकल बड़े भाषा मॉडल को विविध, बहुलवादी प्रतिक्रियाएं उत्पन्न करने में सक्षम बनाता है, जो बड़े बेसलाइन और मॉड्यूलर आर्किटेक्चर की तुलना में बेहतर परिप्रेक्ष्य कवरेज और सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक स्मार्ट AI सहायक से पूछते हैं, "हमें रिमोट वर्क (घर से काम करने) के बारे में क्या करना चाहिए?"
अतीत में, AI संभवतः आपको एक उत्तर देता। यह कह सकता था, "रिमोट वर्क लचीलेपन के लिए बेहतरीन है," या "रिमोट वर्क टीम कल्चर को नुकसान पहुँचाता है।" यह सबसे "सुरक्षित" या सबसे लोकप्रिय राय चुनता और उसी पर टिका रहता। यह एक ऐसे रेस्टोरेंट की तरह है जो केवल एक ही व्यंजन परोसता है क्योंकि शेफ को लगता है कि वही "सबसे अच्छा" है। लेकिन क्या होगा अगर आधे ग्राहक पिज्जा चाहते हों और बाकी आधे सुशी? केवल पिज्जा परोसने से आधा ग्राहक नाखुश रह जाता है और स्थिति की बारीकियों को समझने में चूक हो जाती है।
यह पेपर AI को प्रशिक्षित करने का एक नया तरीका पेश करता है जिसे OP-GRPO (Overton Pluralistic Group Relative Policy Optimization) कहा जाता है। इसका लक्ष्य AI को एक एकल विचारशील वक्ता के बजाय एक बुद्धिमान टाउन हॉल मॉडरेटर (नगर सभा संचालक) की तरह कार्य करने के योग्य बनाना है।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "इको चैंबर" (गूँज कक्ष) वाला AI
वर्तमान AI मॉडल एक "आम सहमति" (consensus) के साथ सहमत होने के लिए प्रशिक्षित किए जाते हैं। वे एक ही "सही" उत्तर खोजने की कोशिश करते हैं।
- दोष: मानवीय मूल्य जटिल होते हैं। कुछ लोग स्वतंत्रता को सर्वोतम महत्व देते हैं; अन्य सुरक्षा को। कुछ परंपरा को महत्व देते; तो अन्य नवाचार को।
- परिणाम: जब AI सबको खुश करने के लिए एक उत्तर देने की कोशिश करता है, तो अक्सर यह उबाऊ, पक्षपाती, या यहाँ तक कि गलत भी हो जाता है क्योंकि यह अल्पसंख्यक लेकिन वैध दृष्टिकोणों की अनदेखी करता है। यह एक ऐसे समाचार एंकर की तरह है जो केवल एक ही अखबार की सुर्खियाँ पढ़ता है।
2. समाधान: "टाउन स्क्वायर" (शहर का चौक) दृष्टिकोण
लेखक चाहते हैं कि AI एक ओवरटन प्लुरलिस्टिक विंडो (Overton Pluralistic Window) तैयार करे। इसे एक टाउन स्क्वायर के रूप में सोचें जहाँ कई वैध दृष्टिकोणों को अगल-बगल प्रदर्शित किया जाता है।
- "रिमोट वर्क X है" कहने के बजाय, AI कहता है:
- "कुछ लोग सोचते हैं कि रिमोट वर्क फोकस के लिए बेहतरीन है..."
- "दूसरे महसूस करते हैं कि यह टीम बॉन्डिंग को नुकसान पहुँचाता है..."
- "एक तीसरा समूह मानता है कि हाइब्रिड मॉडल ही एकमात्र निष्पक्ष समाधान है..."
- AI किसी विजेता का चयन नहीं करता; यह तर्कसंगत मानवीय बहस के पूरे स्पेक्ट्रम को प्रस्तुत करता है।
3. उन्होंने AI को कैसे सिखाया (सीक्रेट सॉस)
AI को ऐसा करने के लिए प्रशिक्षित करना कठिन है। आप इसे केवल यह नहीं कह सकते कि, "विविध बनो," क्योंकि यह केवल बेतुकी बातें बनाना शुरू कर सकता है। लेखकों ने एक चतुर दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:
चरण A: "टेस्ट टेस्टर" (समानता अनुमानक)
कल्पना कीजिए कि आप एक शेफ हैं जो 5 अलग-अलग स्वादों वाला सूप बनाने की कोशिश कर रहे हैं। आपको एक टेस्ट टेस्टर की आवश्यकता है जो आपको बता सके कि आपने वास्तव में 5 अलग-अलग स्वाद डाले हैं या आपने गलती से एक ही मसाला दो बार डाल दिया है।
- लेखकों ने एक विशेष "टेस्ट टेस्टर" (एक छोटा AI मॉडल जिसे Sentence Transformer कहा जाता है) को प्रशिक्षित किया जो AI के उत्तरों को पढ़ सके।
- इसका काम यह जांचना था: "क्या AI ने वास्तव में उन सभी अलग-अलग मानवीय दृष्टिकोणों को कवर किया है जिनके लिए हमने पूछा था? या क्या इसने केवल एक ही विचार को तीन अलग तरीकों से दोहरा दिया है?"
- उन्होंने इस टेस्टर को डुप्लिकेट्स को पकड़ने में बहुत सख्त बनाया, ताकि यह सुनिश्चित हो सके कि AI अलग-अलग शब्दों में एक ही बात कहकर धोखाधड़ी न करे।
चरण B: "कोच" (रिवॉर्ड सिस्टम)
अब, वे मुख्य AI (शेफ) को एक कोच (रिवॉर्ड सिस्टम) के साथ जिम में रखते हैं।
- लक्ष्य: AI को दो चीजों के लिए अंक (रिवॉर्ड्स) मिलते हैं:
- कवरेज (व्याप्ति): क्या आपने सभी अलग-अलग दृष्टिकोणों का उल्लेख किया? (क्या आपने पूरा मेनू कवर किया?)
- विशिष्टता (Uniqueness): क्या आपके बिंदु वास्तव में एक-दूसरे से भिन्न हैं? (केवल तीन बार "पिज्जा" न कहें; "पिज्जा," "सुशी," और "सलाद" कहें।)
- दंड (Penalty): यदि AI केवल सभी कीवर्ड्स को हिट करने के लिए बहुत लंबा, बड़बड़ाता हुआ उत्तर लिखकर "सिस्टम को गेम" करने की कोशिश करता है, तो कोच उसे दंडित करता है। AI सीखता है कि गुणवत्ता और विविधता लंबाई से अधिक महत्वपूर्ण है।
4. अद्भुत परिणाम: छोटे मॉडल, बड़े दिमाग
आमतौर पर, वास्तव में स्मार्ट AI प्राप्त करने के लिए, आपको एक विशाल, महंगे सुपर-कंप्यूटर मॉडल (जैसे 20-बिलियन पैरामीटर वाला दिग्गज) की आवश्यकता होती है।
- आश्चर्य: लेखकों ने एक छोटा AI मॉडल (केवल 3 बिलियन पैरामीटर वाला, जो छोटा और सस्ता है) लिया और उसे इस नए तरीके से प्रशिक्षित किया।
- परिणाम: यह छोटा मॉडल विविध मानवीय दृष्टिकोणों को संभालने में बेहतर साबित हुआ, उन विशाल 20-बिलियन पैरामीटर वाले मॉडलों से भी बेहतर, और यहाँ तक कि उन जटिल प्रणालियों से भी बेहतर जो कई अलग-अलग AI के मिलकर काम करने का उपयोग करती हैं।
- उपमा: यह एक स्थानीय सामुदायिक आयोजक को एक आदर्श प्लेबुक के साथ प्रशिक्षित करने जैसा है। अचानक, वे एक बड़े, महंगे कॉर्पोरेट बोर्डरूम की तुलना में एक टाउन मीटिंग को बेहतर ढंग से प्रबंधित कर सकते हैं।
यह क्यों मायने रखता है
यह पेपर AI सुरक्षा और निष्पक्षता की एक बड़ी समस्या को हल करता है। AI को एक साथ कई, परस्पर विरोधी, फिर भी वैध दृष्टिकोण रखने के लिए शिक्षित करके, हमें मिलता है:
- कम पूर्वाग्रह: यह AI को हर किसी पर एक सांस्कृतिक या राजनीतिक दृष्टिकोण थोपने से रोकता है।
- बेहतर निर्णय: यह मनुष्यों को यह देखने में मदद करता है कि क्या सही है, ताकि वे खुद निर्णय ले सकें, बजाय इसके कि उन्हें बताया जाए कि क्या सोचना है।
- दक्षता: हमें यह करने के लिए विशाल, ऊर्जा-खपत करने वाले कंप्यूटरों की आवश्यकता नहीं है; एक छोटा, कुशल मॉडल यह काम उतनी ही अच्छी तरह कर सकता है।
संक्षेप में: लेखकों ने एक छोटे AI को एक एकल विचारशील व्यक्ति के रूप में कार्य करने के बजाय एक विविध, विचारशील समुदाय के रूप में कार्य करना सिखाया, जिससे यह सुनिश्चित होता है कि जब आप कोई प्रश्न पूछते हैं, तो आपको मानव विचार का एक समृद्ध ताना-बाना मिलता है, न कि केवल एक अकेला धागा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।