Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models
تُثبت هذه الورقة أن النماذج اللغوية الكبيرة خفيفة الوزن وعامة الأغراض يمكن أن تعمل بفعالية كقضاة أمنيين منخفضي زمن الاستجابة للكشف عن هجمات التلقين في بيئات الإنتاج عندما يتم توجيهها عبر الاستدلال المهيكل، وهي طريقة تُطبق حالياً في روبوتات الدردشة الخاصة بالخدمة العامة في سنغافورة، بينما لا يحقق نهج "خليط النماذج" سوى تحسينات طفيفة في الأداء.