Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free), प्रति-टोकन (per-token) नैदानिक ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) सही चरणों को सुदृढ़ करने के बजाय गलत तर्क चरणों को सुधारने के लिए सर्वाधिक लाभकारी है, जबकि यह भी प्रदर्शित करता है कि इष्टतम डिस्टिलेशन कॉन्फ़िगरेशन छात्र मॉडल की क्षमता और विशिष्ट कार्य के आधार पर महत्वपूर्ण रूप से भिन्न होता है।