There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
تُثبت هذه الورقة أن لوحات صدارة النماذج اللغوية الكبيرة الحديثة غير موثوقة بشكل أساسي لأن إعدادات أدوات التقييم (مثل صياغة المطالبات وطرق تسجيل النقاط) هي المحركات الرئيسية لتباين الأداء، وغالباً ما تحدد ترتيب النماذج أكثر من قدراتها الفعلية.