Consolidating Rewarded Perturbations for LLM Post-Training
تقدم هذه الورقة CoRP، وهي طريقة ما بعد التدريب خالية من التدرج تعمل على دمج الاضطرابات الغاوسية الموزونة بالمكافأة في تحديث واحد للنموذج عبر استغلال البنية منخفضة الرتبة، مما يحقق مكاسب كبيرة في الأداء مقارنة بالنموذج الأساسي مع القضاء على عبء الاستدلال متعدد الممرات الذي تفرضه النهج القائمة على المجموعات مثل RandOpt.