RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation
यह शोध पत्र RLCSD का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सही और गलत संकेतों के बीच अंतर करके 'प्रिविलेज-इंड्यूस्ड स्टाइल ड्रिफ्ट' (privilege-induced style drift) को कम करती है ताकि सीखने के संकेतों को कार्य-भारित टोकन (task-bearing tokens) पर केंद्रित किया जा सके, जिससे मौजूदा दृष्टिकोणों की तुलना में गणितीय और तार्किक तर्क कार्यों में बेहतर प्रदर्शन प्राप्त होता है।