Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most
تكشف هذه الورقة أن النماذج اللغوية الكبيرة الأكثر قدرة تُظهر تراجعاً في التدرج (inverse scaling) في مهام التنبؤ التي تتضمن نمواً فوق خطي ومخاطر ذيلية، حيث تنتج تنبؤات توزيعية أسوأ عبر المبالغة في استقراء الذيول العليا—وهو فشل لا تكتشفه مقاييس العتبة الواحدة القياسية، ولكن يتم كشفه من خلال التقييم المستمر والشامل للذيول.