← أحدث الأبحاث
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

تكشف هذه الورقة أن الأمثلة التوضيحية قليلة العينات (few-shot demonstrations) لها تأثيرات متباينة على الدفاعات القائمة على التلقين، حيث تعمل على تعزيز التلقينات الموجهة نحو الدور (Role-Oriented Prompts) من خلال ترسيخ الهوية، بينما تؤدي إلى تدهور كبير في التلقينات الموجهة نحو المهام (Task-Oriented Prompts) عبر تشتيت الانتباه عن التعليمات، مما يقدم رؤى بالغة الأهمية لتحسين استراتيجيات سلامة النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نماذج اللغات الكبيرة (LLMs) كمتدربين موهوبين للغاية ولكنهم سذج؛ فهم بارعون في كتابة الأكواد، ورواية القصص، والإجابة على الأسئلة، لكنهم يحتاجون إلى قواعد صارمة لمنعهم من القيام بشيء خطير أو غير أخلاقي.

تبحث الورقة البحثية التي قدمتها في كيفية إعطاء هؤلاء المتدربين قواعدهم. وتحديداً، هي تبحث في طريقتين مختلفتين لكتابة تلك القواعد (المطالبات/Prompts) وكيف يغير إضافة "قصص أمثلة" (توضيحات قليلة المحاولات/few-shot demonstrations) النتيجة.

إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:

١. الطريقتان لإعطاء التعليمات

اختبر الباحثون أسلوبين رئيسيين لـ "مطالبات النظام" (System Prompts) (التعليمات الأولية المعطاة للذكاء الاصطناعي):

  • المطالبات الموجهة نحو الدور (RoP): نهج "الهوية"
    • التشبيه: تخيل أنك تقول للمتدرب: "أنت مساعد مفيد وآمن وأخلاقي يدعى 'الحارس' (Guardian)."
    • كيف يعمل: أنت تحدد من هم. أنت تعتمد على تدريبهم ليتصرفوا كمساعد جيد.
  • المطالبات الموجهة نحو المهمة (ToP): نهج "الوصف الوظيفي"
    • التشبيه: تخيل أنك تقول للمتدرب: "مهمتك المحددة الآن هي توليد إجابات آمنة. إذا كان الطلب سيئاً، فمهمتك هي قول لا."
    • كيف يعمل: أنت تحدد ماذا يجب عليهم فعله. إنه أمر محدد للحظة الحالية.

٢. "قصص الأمثلة" (توضيحات قليلة المحاولات)

في عالم الذكاء الاصطناعي، تعني "few-shot" إعطاء النموذج بضعة أمثلة حول كيفية التصرف قبل طرح السؤال الحقيقي.

  • التشبيه: قبل أن يبدأ المتدرب العمل، تظهر له دفتراً يحتوي على ٣ أمثلة لكيفية تعامل "الحارس" مع الأسئلة الصعبة في الماضي.
  • السؤال: هل عرض هذه الأمثلة يساعد المتدرب على البقاء آمناً، أم يجعله مشتتاً؟

٣. الاكتشاف الكبير: تأثيرات متضادة

اكتشاف الورقة الرئيسي هو أن إضافة هذه القصص الأمثلة تساعد نوعاً واحداً من التعليمات وتضر بالآخر. الأمر يشبه خدعة سحرية حيث تجعل نفس الأداة شخصاً يبتسم وآخر يبكي.

السيناريو أ: نهج "الهوية" (RoP) + الأمثلة = آمن للغاية

  • ماذا حدث: عندما قيل للذكاء الاصطناعي "أنت مساعد آمن" (RoP) ثم عُرضت عليه أمثلة على السلوك الآمن، أصبح أفضل في الحفاظ على الأمان.
  • التشبيه: فكر في "هوية المساعد الآمن" للذكاء الاصطناعي كأنها عضلة. عرض الأمثلة يشبه القيام ببعض تمارين الإحماء؛ فهي تعزز العضلة. الأمثلة تذكر الذكاء الاصطناعي: "نعم، هذا هو من أكون. أنا الشخص الآمن."
  • النتيجة: تحسن الأمان بنسبة تصل إلى ٤.٥٪. عملت الأمثلة كـ "تعزيز" للدور.

السيناريو ب: نهج "الوصف الوظيفي" (ToP) + الأمثلة = أقل أماناً

  • ماذا حدث: عندما قيل للذكاء الاصطناعي "مهمتك هي أن تكون آمناً" (ToP) ثم عُرضت عليه أمثلة، أصبح أسوأ في الحفاظ على الأمان.
  • التشبيه: تخيل أنك تعطي المتدرب تعليمات وظيفة محددة، ولكن بعد ذلك تسلمه كومة سميكة من الأوراق غير ذات الصلة لقراءتها أولاً. يتم دفن التعليمات في وسط الكومة. يتشتت انتباه المتدرب بالأمثلة وينسى القاعدة الأساسية.
  • العلم: تسمي الورقة هذا "تشتت الانتباه" (Attention Distraction). يركز عقل الذكاء الاصطناعي على الأمثلة (الموجودة في بداية النص) ويفقد التركيز على التعليمات الفعلية (التي تم دفعها إلى المنتصف).
  • النتيجة: انخفض الأمان بشكل كبير، بنسبة تصل إلى ٢١.٢٪. لقد طغت الأمثلة على القواعد.

٤. مفارقة "وضع التفكير" (Think Mode)

بحثت الورقة أيضاً في النماذج التي تمتلك "وضع تفكير" خاص (حيث تقوم بالاستنتاج خطوة بخطوة قبل الإجابة).

  • النتيجة: كانت هذه النماذج بشكل عام أكثر عرضة للاختراقات (الهجمات المصممة لتجاوز السلامة) وأكثر ارتباكاً بسبب الأمثلة، بغض النظر عن أسلوب التعليمات المستخدم.
  • التشبيه: الأمر يشبه طالباً يحلل السؤال بشكل مفرط. بدلاً من مجرد اتباع القاعدة، يبدأ في مناقشة القاعدة في رأسه، ويقوم "الأشرار" (المخترقون) بخداعه لجعله يعتقد أن الفكرة السيئة منطقية في الواقع.

٥. ماذا يجب على المطورين فعله؟

بناءً على هذه النتائج، يقدم المؤلفون نصائح محددة للغاية:

  • إذا كنت تستخدم نهج "الهوية" (RoP): يمكنك إضافة قصص الأمثلة! فهي تجعل الذكاء الاصطناعي أكثر أماناً.
  • إذا كنت تستخدم نهج "الوصف الوظيفي" (ToP): لا تضف قصص الأمثلة. فهي تجعل الذكاء الاصطناعي أقل أماناً. اجعل التعليمات قصيرة ومباشرة.
  • إذا كنت تستخدم نماذج "وضع التفكير": كن حذراً جداً. فهي تبدو أسهل في الخداع، لذا قد تحتاج إلى تدابير سلامة إضافية.

ملخص

تثبت الورقة أن السياق مهم.

  • إذا حددت شخصية الذكاء الاصطناعي، فإن الأمثلة تساعد في تقوية تلك الشخصية.
  • إذا حددت مهمة الذكاء الاصطناعي، فإن الأمثلة تعمل كضجيج يطغى على التعليمات.

لم يكن الباحثون يخمنون فحسب؛ بل اختبروا ذلك على العديد من نماذج الذكاء الاصطناعي ومعايير السلامة المختلفة لإثبات أن هاتين الاستراتيجيتين تتفاعلان بطرق متعاكسة مع نفس المدخلات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →