Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
यह शोध पत्र प्रदर्शित करता है कि एक ड्यूल-एजेंट फ्रेमवर्क और अर्ली स्टॉपिंग का उपयोग करके डीपसीक-आर1 (DeepSeek-R1) शिक्षक से डिस्टिल्ड चेन-ऑफ-थॉट डेटा के साथ एक कॉम्पैक्ट क्यूवेन 2.5-7बी (Qwen2.5-7B) स्टूडेंट मॉडल को फाइन-ट्यून करने से जॉन ओ'ब्रायन मैथमेटिक्स कॉम्पिटिशन और मैथ-500 (MATH-500) बेंचमार्क पर इसकी सटीकता में महत्वपूर्ण सुधार होता है, जबकि यह भी प्रकट करता है कि कम प्रतिक्रिया लंबाई का कम तर्क गुणवत्ता के साथ सहसंबंध है।