Overton Pluralistic Reinforcement Learning for Large Language Models
यह शोध पत्र OP-GRPO को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (रीइन्फोर्समेंट लर्निंग) ढांचा है जो एक समानता अनुमानक (सिमिलैरिटी एस्टिमेटर) को प्रशिक्षित करके और एक दोहरी-पुरस्कार प्रणाली का उपयोग करके एक एकल बड़े भाषा मॉडल को विविध, बहुलवादी प्रतिक्रियाएं उत्पन्न करने में सक्षम बनाता है, जो बड़े बेसलाइन और मॉड्यूलर आर्किटेक्चर की तुलना में बेहतर परिप्रेक्ष्य कवरेज और सटीकता प्राप्त करता है।