ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains
यह शोधपत्र रिफ्लेक्टिव ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (ROSD) को प्रस्तुत करता है, जो एक फ्रेमवर्क है जो एक सेल्फ-रिफ्लेक्टर का उपयोग करके त्रुटियों को स्थानीयकृत करने और लक्षित, त्रुटि-विशिष्ट डिस्टिलेशन को निर्देशित करने के माध्यम से विभिन्न डोमेन में लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, जिससे मौजूदा ऑन-पॉलिसी सेल्फ-डिस्टिलेशन विधियों की ओवरफिटिंग और खराब सामान्यीकरण की सीमाओं को दूर किया जा सके।