Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
تحدد هذه الورقة مواصفات الأدوات ذات التنسيق المخطط (schema-formatted) كسبب رئيسي لتدهور السلامة في وكلاء الذكاء الاصطناعي، وتقترح SafeKeep، وهو نظام حماية أثناء الاستنتاج يعمل على فصل تقييم السلامة عن التنفيذ لتقليل معدلات نجاح الهجمات بشكل كبير مع الحفاظ على أداء المهام.