Hybrid Policy Distillation for LLMs
यह शोध पत्र हाइब्रिड पॉलिसी डिस्टिलेशन (HPD) को प्रस्तुत करता है, जो एक एकीकृत नॉलेज डिस्टिलेशन फ्रेमवर्क है जो विविध कार्यों में लार्ज लैंग्वेज मॉडल्स को कंप्रेस करने की स्थिरता, दक्षता और प्रदर्शन को बढ़ाने के लिए ऑफ-पॉलिसी और एप्रोक्सिमेट ऑन-पॉलिसी डेटा के मिश्रण के साथ फॉरवर्ड और रिवर्स KL डाइवर्जेंस को एकीकृत करता है।