Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
تقترح هذه الورقة نهجاً للتعلم التعزيزي باستخدام تحسين السياسة النسبية للمجموعة (GRPO) مع مكافآت دلالية لتوسيع النماذج اللغوية الكبيرة إلى اللغات منخفضة الموارد، مما يخفف بفعالية من "ضريبة المحاذاة" والنسيان الكارثي الناتج عادةً عن الضبط الدقيق الخاضع للإشراف، مع الحفاظ على القدرات العامة وتحسين الجودة الدلالية.