Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
تقدم هذه الورقة البحثية SC-SDPO، وهو متغير جديد من تحسين سياسة التقطير الذاتي، يقوم بوزن أسئلة التدريب ديناميكيًا بجذر التباين المتوقع لمعدل النجاح لإنشاء منهج تعليمي ضمني مدرك للصعوبة، مما يحقق مكاسب أداء ثابتة في معايير الاستدلال واستخدام الأدوات مع الحفاظ على استقرار ديناميكيات التدريب.