When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
تقدم هذه الورقة طريقة التقطير الذاتي داخل السياسة الموزون بالموضع (PW-OPSD)، وهي طريقة تعمل على تحسين أداء نماذج الاستدلال من خلال تحديد أن موثوقية توكن المعلم تتبع نمطاً ذا بنية مسارية يمكن التنبؤ به بشكل أفضل عبر موضع التوكن بدلاً من الإنتروبيا، مما يسمح بالتقطير المستهدف دون حسابات إضافية للمعلم.