Gradient-Based LoRA Rank Allocation Under GRPO: An Empirical Study
تكشف هذه الدراسة التجريبية أن تخصيص الرتب التكيفي القائم على التدرج لتقنية LoRA، رغم فعاليته في الضبط الدقيق الخاضع للإشراف، يؤدي إلى تدهور الأداء بشكل كبير في ظل عملية تحسين السياسة النسبية الجماعية (GRPO) بسبب مشهد تدرج أكثر تسطحاً وتأثير تضخيم التدرج الضار، مما يشير إلى أن تخصيص الرتب الموحد يعد متفوقاً لمهام محاذاة التعلم المعزز.