No Universal Signal Predicts Sample-Level LLM Regression under Version Updates
تستقصي هذه الورقة كيفية التنبؤ بتراجعات الأداء على مستوى العينات في النماذج اللغوية الكبيرة المحدثة من خلال مقارنة الإشارات أحادية النموذج والإشارات عبر الإصدارات عبر ستة معايير، لتجد أنه لا توجد إشارة واحدة فعالة عالمياً، ولكن يمكن للأنماط المعتمدة على المهام أن توجه الممارسين في اختيار الإشارات المناسبة لتنفيذ آلية تراجع انتقائية تقوم بتوجيه العينات عالية المخاطر إلى إصدارات النماذج السابقة.