How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks
تكشف هذه الورقة أن الأمثلة التوضيحية قليلة العينات (few-shot demonstrations) لها تأثيرات متباينة على الدفاعات القائمة على التلقين، حيث تعمل على تعزيز التلقينات الموجهة نحو الدور (Role-Oriented Prompts) من خلال ترسيخ الهوية، بينما تؤدي إلى تدهور كبير في التلقينات الموجهة نحو المهام (Task-Oriented Prompts) عبر تشتيت الانتباه عن التعليمات، مما يقدم رؤى بالغة الأهمية لتحسين استراتيجيات سلامة النماذج اللغوية الكبيرة.