Towards More Standardized AI Evaluation: From Models to Agents
تجادل هذه الورقة بأنه مع تطور أنظمة الذكاء الاصطناعي من نماذج ثابتة إلى وكلاء ديناميكيين، يجب أن ينتقل التقييم من الاعتماد على المعايير المرجعية الثابتة التي عفا عليها الزمن والدرجات الإجمالية إلى صيرورة قياس مستمرة لبناء الثقة، قادرة على حوكمة السلوكيات غير الحتمية على نطاق واسع.