Holistic Evaluation and Failure Diagnosis of AI Agents
تقدم هذه الورقة إطار تقييم شامل يجمع بين التشخيص من الأعلى إلى الأسفل والتقييم على مستوى النطاق من الأسفل إلى الأعلى لتحديد وتصنيف الإخفاقات في الوكلاء الاصطناعيين بفعالية، محققةً أداءً هو الأفضل حالياً في اختبارات TRAIL، ومثبتةً أن منهجية التقييم، وليس قدرة النموذج، هي العائق الأساسي في تشخيص الوكيل.