WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training
تقدم الورقة البحثية WDL-OPD، وهي طريقة تدريب مشترك مقيدة بالمزيج تعمل على تثبيت التقطير داخل السياسة من خلال التدريب المشترك لسياسة تدحرج مرجعية وسياسة تقييم مساعدة لمطابقة معلم مجمد عبر تباعد KL العكسي، محققةً أداءً هو الأفضل في مجاله في مهام الاستدلال الرياضي وتوليد الكود مقارنة بالنهج الحالية ذات السياسة الواحدة.