Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard
تحدد هذه الورقة ثلاث نقاط ضعف حرجة — وهي ثغرات المعايير المرجعية، والتقادم الزمني، وعدم اليقين أثناء التشغيل — التي تقوض التقييمات الأمنية الحالية لوكلاء الذكاء الاصطناعي، وتقترح اتجاهات عملية لتطوير أطر عمل أكثر متانة وموثوقية.