AI Security Leaderboard: Methodology, Results and Minimal Standard
تقدم هذه الورقة "المعيار الأدنى للضمانات" من FAR.AI، وهو معيار مرجعي لتقييم نماذج الذكاء الاصطناي التوليدي المتقدمة مقابل 67 تقنية لكسر الحماية (jailbreak) ثابتة عبر تهديدات CBRNE والتهديدات السيبرانية، مما يكشف أنه بينما تظل بعض النماذج مثل Claude Fable 5 وGPT-5.6 Sol قوية، فإن نماذج أخرى مثل Grok 4.5 وGemini 3.1 Pro تظهر ثغرات غير متساوية للغاية وقابلة للاستغلال يمكن معالجتها باستخدام استراتيجيات الدفاع المتعدد الطبقات الحالية.