Where Do LLMs Still Struggle? An In-Depth Analysis of Code Generation Benchmarks
यह शोध पत्र उन कार्यों की पहचान करने के लिए कोड जनरेशन बेंचमार्क का विश्लेषण करता है जहाँ लार्ज लैंग्वेज मॉडल्स लगातार विफल होते हैं, जो चार आवर्ती कमजोरी पैटर्न और सामान्य कार्य जटिलताओं को प्रकट करता है जो प्रदर्शन में बाधा डालते हैं।