Curriculum Learning and Pseudo-Labeling Improve the Generalization of Multi-Label Arabic Dialect Identification Models
تتناول هذه الورقة ندرة بيانات اللهجات العربية متعددة الملصقات من خلال بناء مجموعة بيانات جديدة عبر نموذج GPT-4o ومصنفات قبول اللهجات، ثم تُثبت أن تدريب نموذج قائم على BERT باستخدام التعلم المنهجي يحسن التعميم بشكل كبير، محققاً مقياس F1 كلي قدره 0.69 مقارنة بأفضل النتائج السابقة التي بلغت 0.55.