Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization
यह शोध पत्र प्रेफरेंस-बेस्ड सेल्फ-डिस्टिलेशन (PBSD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो शिक्षक और छात्र नमूनों के बीच प्रेफरेंस गैप्स को अनुकूलित करने के लिए पारंपरिक KL मैचिंग के स्थान पर एक रिवॉर्ड-रेगुलराइज्ड ऑब्जेक्टिव का उपयोग करता है, जिससे मौजूदा सेल्फ-डिस्टिलेशन विधियों की तुलना में अधिक स्थिर प्रशिक्षण और बेहतर रीजनिंग प्रदर्शन प्राप्त होता है।