Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
यह शोध पत्र 27 अध्ययनों के निष्कर्षों को संश्लेषित करते हुए लार्ज लैंग्वेज मॉडल एजेंटों में छह आवर्ती विफलता समूहों (failure clusters) का एक एकीकृत वर्गीकरण प्रस्तावित करता है, जो यह प्रकट करता है कि व्यक्तिगत उप-कार्यों पर प्रदर्शन अक्सर टूल के उपयोग, योजना, दीर्घ-अवधि तर्क (long-horizon reasoning), समन्वय, सुरक्षा और मापन वैधता में संचयी त्रुटियों के कारण विश्वसनीय एंड-टू-एंड सफलता में परिवर्तित नहीं हो पाता है।