The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer
यह शोध पत्र एक "बेंचमार्क भ्रम" (benchmark illusion) को उजागर करता है जहाँ प्रून की गई (pruned) लार्ज लैंग्वेज मॉडल्स बहुविकल्पीय मूल्यांकनों पर सक्षम दिखाई देती हैं लेकिन ओपन-एंडेड जनरेशन में विफल हो जाती हैं क्योंकि प्रूनिंग सही उत्तरों को मिटाने के बजाय उन्हें कमतर कर देती है, जो यह सुझाव देता है कि संकुचित मॉडल्स का परीक्षण केवल उनकी पहचान करने की क्षमताओं के बजाय उनकी जनरेटिव क्षमताओं पर किया जाना चाहिए।