GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation
تُثبت هذه الورقة أن الضبط الدقيق لنموذج لغوي مفتوح الأوزان باستخدام تحسين السياسة النسبي المجموعي (GRPO) وإطار تقييم مزدوج — يجمع بين معايير نموذج لغوي كبير كحَكَم (LLM-as-a-judge) وتدقيق أثر المعالجة المتوسط السببي (CATE) المستقل عن الحَكَم — ينتج نصائح مالية تتفوق بشكل كبير على النماذج التجارية المرجعية من حيث الرفع المقدر في الأرباح والحد من المخاطر.