How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition
تقدم هذه الورقة نتائج من مسابقة واسعة النطاق لاختبار الاختراق (red teaming) تُظهر أن جميع نماذج الذكاء الاصطناعي الرائدة التي تم تقييمها عرضة لهجمات حقن الأوامر غير المباشرة والمخفية، مما يكشف أن القدرة العالية للنموذج لا ترتبط بزيادة المتانة ويسلط الض|ء على نقاط ضعف جوهرية في بنيات اتباع التعليمات الحالية.