The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?
تثبت هذه الورقة وجود "ثلاثية دفاعية" تُظهر أنه لا يمكن لأي دفاع تغليف مستمر ومحافظ على المنفعة أن يضمن السلامة الكاملة ضد حقن الأوامر للنماذج اللغوية ذات فضاءات الأوامر المتصلة، وهو استحالة نظرية تم التحقق منها ميكانيكياً في لغة Lean 4 وتم إثباتها تجريبياً عبر نماذج لغوية كبيرة متعددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً ذكياً جداً، ولكنه مشاكس أحياناً. تريد بناء "حارس أمني" (غلاف برمجي) يقف أمام الروبوت. مهمة الحارس هي قراءة كل ما يقوله المستخدم، وإصلاح أي شيء يبدو خطيراً، ثم تمرير الرسالة "المنقحة" إلى الروبوت.
الهدف بسيط: التأكد من أن الروبوت لن يفعل أي شيء سيء أبداً، دون تغيير ما كان يقصده المستخدم فعلياً.
تجادل هذه الورقة البحثية بأن هذا الأمر مستحيل رياضياً إذا كنت تريد لحارس الأمن الخاص بك أن يكون سلساً، مهذباً، ومفيداً.
إليك تفصيل الأسباب، باستخدام تشبيهات بسيطة.
القواعد الثلاث للعبة
يقول المؤلفون إنه لكي تصنع حارساً أمنياً مثالياً، يجب أن تتحقق ثلاثة أشياء في وقت واحد:
- السلاسة (الاستمرارية - Continuity): إذا كتب المستخدم جملة "شبه آمنة"، فلا ينبغي للحارس أن يغيرها فجأة إلى شيء مختلف تماماً. يجب أن تؤدي التغييرات الصغيرة في المدخلات إلى تغييرات صغيرة في المخرجات. (فكر فيها كمنحدر لطيف، وليس كجرف حاد).
- الفائدة (الحفاظ على المنفعة - Utility Preservation): إذا طرح المستخدم سؤالاً آمناً تماماً (مثل "كيف حال الطقس؟")، يجب على الحارس أن يسمح بمروره دون تغيير. لا تريد للحارس أن يفسد سؤالاً جيداً عن طريق الخطأ.
- المثالية (الكمال - Completeness): يجب على الحارس أن يكشف كل طلب خطير ويقوم بإصلاحه حتى لا يرى الروبوت أي شيء غير آمن.
الخبر الكبير: يمكنك الحصول على أي اثنين من هذه القواعد، لكن لا يمكنك امتلاك الثلاثة معاً أبداً. وهذا ما يسمى بـ "ثلاثية الدفاع" (Defense Trilemma).
التشبيه: "المنطقة الآمنة" و"منطقة الخطر"
تخيل أن عالم الأسئلة عبارة عن خريطة عملاقة.
- المنطقة الآمنة: منطقة خضراء حيث تكون جميع الأسئلة غير ضارة.
- منطقة الخطر: منطقة حمراء حيث تكون الأسئلة ضارة.
- الحد الفاصل: الخط الرفيع الذي يفصل بين الأخضر والأحمر.
المشكلة:
لدى الحارس الأمني قاعدة: "إذا كنت في المنطقة الخضراء، فلن ألمسك".
ولأن الحارس سلس، فلا يمكنه القفز فجأة من "لن ألمسك" إلى "سأقوم بإصلاحك" عند الحافة مباشرة. يجب أن يكون تدريجياً.
إذن، ماذا يحدث عند حافة المنطقة الخضراء تماماً؟
سيكون الحارس هناك ويقول: "لن ألمسك"، لأنه تقنياً لا يزال في المنطقة الخضراء. ولكن، بما أنه على الحافة، فهو أيضاً قريب بشكل خطر من المنطقة الحمراء.
النتيجة:
ستكون هناك دائماً بعض الأسئلة التي تقع عند الحدود تماماً. يراها الحارس "آمنة" (بسبب قاعدة الفائدة) ويسمح بمرورها. ولكن، ولأن الحارس سلس، فإنه لا يستطيع دفع هذه الأسئلة الحدودية بعيداً عن الخطر لجعلها آمنة حقاً.
الحارس يعلق في المنتصف. فهو يسمح بمرور سؤال خطير لأنه "مهذب" أكثر من اللازم، ولأنه "سلس" أكثر من اللازم لكي يقوم بتعديله فجأة.
مستويات الفشل الثلاثة
تثبت الورقة أن هذا الفشل يحدث بثلاث طرق متصاعدة:
مشكلة "العلوق عند الحافة":
يجب على الحارس أن يترك سؤالاً "حدودياً" واحداً على الأقل دون أي تغيير. الأمر يشبه حارساً يرفض تحريك شخص يقف تماماً على خط الملكية، حتى لو كان ذلك الشخص على وشك الخطو إلى حديقة الجار.مشكلة "المنطقة الضبابية":
بما أن الحارس سلس، فلا يمكنه إصلاح السؤال الحدودي الوحيد فحسب. بل يجب عليه أن يكون لطيفاً مع الجميع القريبين من ذلك السؤال أيضاً. وهذا يخلق "نطاقاً ضبابياً" من الأسئلة التي تكون خطيرة قليلاً، لكن الحارس ألطف من أن يصلحها بشكل صحيح.مشكلة "الهروب من السيطرة":
تخيل أن "الخطر" يصبح أكثر حدة وحِدّة كلما ابتعدت عن المنطقة الآمنة (مثل منحدر حاد). يحاول الحارس سحب المستخدم للخلف، لكن المنحدر شديد جداً. مهما حاول الحارس السحب، ستظل هناك كتلة كاملة من الخريطة يسقط فيها المستخدم رغم محاولات الحارس. الحارس ببساطة لا يستطيع سحبهم بسرعة كافية دون كسر قواعد "السلاسة" أو "الفائدة".
ماذا عن الدفاعات المنفصلة؟ (تشبيه "الحظر الصارم")
قد تتساءل، "ماذا لو لم يكن الحارس سلساً؟ ماذا لو قال 'لا' فقط لأي شيء مشبوه؟"
تقول الورقة: إذا جعلت الحارس غير سلس (على سبيل المثال، يمنع فجأة سؤالاً آمناً بنسبة 99%)، فإنك تكسر قاعدة الفائدة. ستبدأ في حظر الأسئلة الجيدة عن طريق الخطأ.
بدلاً من ذلك، إذا أردت أن تكون مثالياً وسلساً، فعليك أن تقبل بأنك ستفقد بعض الأسئلة السيئة.
إذن، هل الدفاع عديم الفائدة؟
لا! الورقة لا تقول "استسلموا". بل تقول "توقفوا عن محاولة بناء درع سحري يفعل كل شيء".
بدلاً من ذلك، يقترح المؤلفون استراتيجية جديدة:
- اجعل الحدود ضحلة: بدلاً من محاولة منع كل سؤال سيء، اجعل "الخطر" أقل حدة. إذا أخطأ الروبوت في سؤال حدودي، فربما يكتفي فقط بتقديم رد مهذب بدلاً من إجابة ضارة.
- بسط الخريطة: قلل من الطرق التي يمكن للناس من خلالها طرح الأسئلة (خفض التعقيد). من الأسهل حراسة حديقة صغيرة بدلاً من غابة كاملة.
- راقب الحدود: بما أنه لا يمكنك منع كل شيء، ضع كاميرا على الحدود. إذا اقترب شخص ما من الحافة، يمكن لإنسان أو نظام آخر التدخل.
الخلاصة
لا يمكنك بناء غلاف برمجِي يكون سلساً، ولا يفسد الأسئلة الجيدة، ويكتشف كل سؤال سيء في نفس الوقت. عليك أن تختار اثنين منهما، وتقبل بأن الثالث سيتم التضحية به. هدف هندسة الأمن هو إدارة هذه المقايضة، وليس تمني اختفائها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.