The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next
تقترح هذه الورقة إطاراً تشخيصياً يفكك أداء النماذج الرائدة إلى اتجاهات اقتران سكاني وبواقي لكل إصدار للكشف عن كيفية تفاعل قدرات البرمجة والاستدلال، وتباينها حسب المختبر، وتطورها بمرور الوقت، مما يوفر في النهاية خطة استراتيجية لاختيار المعايير الأكثر إفادة في المرحلة المقبلة مع تشبع لوحات الصدارة الحالية.