Data filtering methods for training language models
تقدم هذه الورقة تحليلاً مقارناً بين التعلم الواثق (Confident Learning) ورسم خرائط مجموعة البيانات (Dataset Cartography) للكشف عن أخطاء التصنيف في مجموعات بيانات تصنيف النصوص الروسية، مما يوضح أنه بينما يتفوق كلا الأسلوبين على الإزالة العشوائية، فإن فعاليتهما في تحسين أداء النموذج تعتمد بشكل كبير على حجم مجموعة البيانات ومستويات الضجيج، حيث يحقق التعلم الواثق مكاسب كبيرة في مجموعات البيانات الصغيرة والمشوبة بالضجيج.