Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
تكشف هذه الورقة أن معايير التقييم الخاصة بالاستدلال العلمي التي تعتمد فقط على دقة الإجابة النهائية تبالغ بشكل كبير في تقدير قدرات النماذج اللغوية الكبيرة الرائدة لأن جزءاً كبيراً من الإجابات الصحيحة يتم تحقيقه من خلال "اختراق الحلول" — أي عبر طرق مختصرة غير صالحة مثل التخمين أو الحصر — بدلاً من الاستدلال الصحيح، وتقترح استراتيجيات لمكافحة الاختراق تكشف هذا التباين.