Learning from Language Feedback via Variational Policy Distillation
تقدم هذه الورقة تقنية "تقطير السياسة التبايني" (VPD)، وهو إطار عمل يتغلب على قيود التقطير الذاتي السلبي بين المعلم والطالب من خلال تطوير السياسات كليهما بشكل مشترك عبر عملية "توقع-تعظيم" تباينية، مما يتيح تحسيناً مستمراً في استخراج الإشارات القابلة للتنفيذ من التغذية الراجعة اللغوية لتعزيز الأداء في مهام الاستدلال المعقد وتوليد الكود.