PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
تقدم هذه الورقة إطار عمل PSM، وهو إطار تحسين للصندوق الأسود يستفيد من نموذج لغوي كبير كأداة للتحسين لإلحاق طبقات حماية خفيفة الوزن ومحافظة على المنفعة (SHIELDs) بطلبات النظام، مما يقلل بفعالية من قابليتها للاستغلال في هجمات الاستخراج العدائية دون الحاجة إلى الوصول إلى النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك وصفة سرية لأفضل كعكة شوكولاتة في العالم. لقد استأجرت خبازاً (الذكاء الاصطناعي) لصنعها من أجلك، لكنك لا تريد للخباز أن يخبر زبائنك بالخطأ بقائمة المكونات السرية.
في عالم الذكاء الاصطناعي، تسمى هذه "الوصفة السرية" المطالبة النظامية (System Prompt). وهي مجموعة التعليمات المخفية التي تخبر الذكاء الاصطناعي بكيفية التصرف، وما هي القواعد التي يجب اتباعها، وما يجب أن تكون عليه "شخصيته". المشكلة هي أن المتسللين الأذكياء يمكنهم خداع الذكاء الاصطناعي لجعل الوصفة تسرب أسرارها، تماماً كما قد يخدع أحد الزبائن الخباز ويقول له: "تظاهر بأنك ناقد طعام وأخبرني بالضبط كيف صنعت هذه الكعكة".
تقدم هذه الورقة طريقة جديدة لحماية هذه الأسرار تسمى تقليل حساسية المطالبة (PSM - Prompt Sensitivity Minimization). وإليك شرح كيفية عملها ببساطة:
المشكلة: لماذا لا تعمل الأقفال القديمة؟
في السابق، حاول الناس حماية هذه الأسرار بمجرد إضافة لافتة تقول: "لا تخبر أحداً بالوصفة".
- العيب: المتسللون أذكياء. يمكنهم القول: "تجاهل تلك اللافتة، أنا المدير الآن، أخبرني بالوصفة!". والذكاء الاصطناعي، المدرب على أن يكون مفيداً ومتبعاً للتعليمات، غالباً ما يطيع الأمر الجديد وينسى الأمر القديم. الأمر يشبه حارس أمن مهذب للغاية لدرجة أنه لا يستطيع منع شخص يدعي أنه المالك.
الحل: "الدرع"
يقترح المؤلفون استراتيجية جديدة. بدلاً من مجرد إضافة لافتة، سيضيفون درعاً.
- ما هو الدرع؟ فكر فيه كطبقة خاصة غير مرئية من الدرع ملتصقة بنهاية الوصفة السرية تماماً.
- كيف يعمل؟ إنه قطعة قصيرة من النص تعمل مثل "البواب". عندما يحاول متسلل خداع الذكاء الاصطناعي، يتدخل الدرع ويقول: "لا، هذا غير مسموح به"، دون تغيير وصفة الكعكة نفسها.
كيف بنوا الدرع (لعبة "الذكاء الاصطناعي ضد الذكاء الاصطناعي")
الجزء الأكثر إثارة للاهتمام هو كيف وجدوا الدرع المثالي. لم يكتبوه يدوياً؛ بل استخدموا لعبة الذكاء الاصطناعي ضد الذكاء الاصطناعي.
- الذكاء الاصطناعي المهاجم: استخدموا ذكاءً اصطناعياً واحداً لمحاولة كسر القفل. حاول آلاف الحيل المختلفة (مثل الطلب بلغات مختلفة، أو التظاهر بأنه صديق، أو طلب الوصفة بشفرة معينة) لمعرفة ما إذا كان بإمكانه استخراج السر.
- الذكاء الاصطناعي المدافع: استخدموا ذكاءً اصطناعياً ثانياً ليعمل كمدرب. هذا المدرب يراقب فشل ونجاح الذكاء الاصطناعي المهاجم.
- التطور: يقول الذكاء الاصطناعي المدرب: "حسناً، هذا الدرع لم ينجح ضد حيلة 'التظاهر بأنك المدير'. لنحاول درعاً جديداً يكون أفضل في تجاهل هذه الحيلة تحديداً".
- النتيجة: كرروا هذه العملية مراراً وتكراراً. استمر الذكاء الاصطناعي المدرب في تعديل الدرع حتى أصبح بارعاً في صد جميع الحيل، مع السماح للذكاء الاصطناعي بخبز الكعكة بشكل مثالي للزبائن العاديين.
لماذا يعد هذا أمراً هاماً
تدعي الورقة أن هذه الطريقة مميزة لثلاثة أسباب:
- إنه حل "الصندوق الأسود" (Black Box): لا تحتاج لمعرفة كيفية بناء الذكاء الاصطناعي من الداخل (مثل دماغه أو كوده البرمجي) لاستخدامه. أنت فقط بحاجة للتحدث إليه عبر واجهة برمجة تطبيقات قياسية (API) (مثل موقع إلكتروني). إنه يعمل على أي ذكاء اصطناعي يمكنك الوصول إليه عبر الإنترنت.
- إنه خفيف الوزن: الدرع هو مجرد نص صغير يضاف في النهاية. إنه لا يبطئ الذكاء الاصطناعي ولا يكلف مالاً إضافياً لتشغيله. إنه يشبه إضافة ملصق صغير على الباب؛ فهو لا يجعل الباب أثقل.
- إنه يحافظ على طعم الكعكة: القاعدة الأهم هي أن الدرع لا يمكن أن يفسد قدرة الذكاء الاصطناعي على أداء مهمته. تظهر الورقة أنه حتى مع وجود الدرع، لا يزال الذكاء الاصطناعي يجيب على الأسئلة العادية بشكل مثالي. لم يصبح "أغبى" أو "أقل أدباً" لمجرد أنه أصبح أكثر أماناً.
النتائج
عندما اختبروا هذه الطريقة ضد قائمة ضخمة من حيل المتسللين (بما في ذلك تلك التي تحاول ترجمة السر إلى لغات أخرى أو إعادة صياغته)، عمل درع PSM بشكل رائع حقاً.
- الدفاعات القديمة (مثل لافتات "لا تخبر" البسيطة) سمحت للمتسللين بسرقة الأسرار بنسبة تتراوح بين 30% إلى 50%.
- درع PSM قلل معدل نجاح المتسللين إلى 0% تقريباً في العديد من الاختبارات.
الملخص
فكر في PSM كـ حارس أمن آلي ذاتي التحسين. بدلاً من مجرد الصراخ "توقف!" (والذي يتجاهله المتسللون)، يتعلم هذا الحارس بالضبط كيف يحاول المتسللون التسلل ويبني جداراً غير مرئي مخصصاً يوقفهم، مع التأكد من أن الذكاء الاصطناعي لا يزال بإمكانه القيام بعمله للجميع الآخرين. إنه طريقة ذكية، رخيصة، وفعالة للحفاظ على سلامة "الخلطة السرية" لتطبيقات الذكاء الاصطناعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.