Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL
यह शोध पत्र स्व-पुरस्कृत सुदृढीकरण शिक्षण (self-rewarding reinforcement learning) में एक व्यवस्थित स्व-पुष्टि पूर्वाग्रह (self-confirming bias) की पहचान करता है जहाँ मॉडल उच्च-विश्वास वाली गलतियों को अत्यधिक पुरस्कृत करते हैं, और विविध मॉडल एकत्रीकरण के माध्यम से इस अस्थिरता को कम करने के लिए 'एन्सेम्बल्ड रिवार्ड्स के साथ सुदृढीकरण शिक्षण' (RLER) का प्रस्ताव करता है, जो अनलेबल डेटा पर प्रभावी ढंग से स्केल करते हुए पर्यवेक्षित विधियों (supervised methods) के करीब प्रदर्शन प्राप्त करता है।