Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
यह शोध पत्र भाषा मॉडल पोस्ट-ट्रेनिंग के लिए एक "स्पार्स-टू-डेंस" (sparse-to-dense) रिवॉर्ड सिद्धांत प्रस्तावित और अनुभवजन्य रूप से मान्य करता है, जो यह प्रदर्शित करता है कि एक छोटे छात्र (student) में डेंस सुपरविजन के माध्यम से इसके व्यवहार को स्थानांतरित करने से पहले, स्पार्स रिवॉर्ड्स के साथ एक मजबूत शिक्षक (teacher) मॉडल को प्रशिक्षित करने के लिए दुर्लभ सत्यापन योग्य डेटा आवंटित करना, छात्र पर सीधे स्पार्स सुदृढीकरण शिक्षण (sparse reinforcement learning) करने की तुलना में बेहतर परिणाम देता है।