💬 NLP
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
تقترح الورقة البحثية إطار عمل EBPO، وهو إطار عمل مبتكر يعمل على تثبيت عملية تحسين السياسة النسبية للمجموعات (GRPO) للنماذج اللغوية الكبيرة من خلال توظيف تقليص بايز التجريبي (Empirical Bayes shrinkage) لتنظيم خطوط الأساس المحلية باستخدام الإحصاءات العالمية، مما يؤدي إلى تقليل تباين المُقدِّر، ومنع تلاشي التدرجات، والتفوق على الأساليب الحالية عبر مختلف معايير اختبار الاستدلال.
Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang2026-02-24