SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
تقدم هذه الورقة البحثية "تدرج السياسة الساندويتشي" (Sandwiched Policy Gradient - SPG)، وهي طريقة جديدة للتعلم التعزيزي تستخدم كلاً من الحدود العليا والدنيا للاحتمالية اللوغاريتمية للتغلب على عدم قابلية الحساب في نماذج اللغة الانتشارية، متفوقة بشكل كبير على النماذج المرجعية الحالية في اختبارات الاستدلال الرياضي والمنطقي.