Draft-OPD: On-Policy Distillation for Speculative Draft Models
تقدم هذه الورقة البحثية Draft-OPD، وهو إطار عمل للتقطير القائم على السياسة (on-policy distillation) يتغلب على قيود الضبط الدقيق الخاضع للإشراف (supervised fine-tuning) لعملية فك التشفير التخميني (speculative decoding) عبر استخدام عمليات التدحرج بمساعدة الهدف (target-assisted rollouts) وإعادة تشغيل المسودة من مواضع الخطأ لتحقيق تسريع غير فاقد للمعلومات (lossless acceleration) يتجاوز 5 أضعاف لنماذج التفكير (thinking models).