CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion
يُعد CLIP-Inspector إطار عمل للكشف عن الأبواب الخلفية على مستوى النموذج لنموذج CLIP المضبط عبر التوليف الدقيق للمطالبات، والذي يستخدم عكس المحفزات خارج نطاق التوزيع لتحديد السلوكيات الخبيثة في بيئات تعلم الآلة كخدمة (MLaaS) شبه النزيهة، ومن ثم إصلاح النماذج المخترقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك استأجرت شيفاً ماهراً (مزود خدمة ذكاء اصطناعي) لإعداد وصفة مخصصة لمطعمك. لقد أعطيته مكوناتك السرية (بياناتك)، ووعدك بتعديل وصفة عالمية مشهورة (نموذج يسمى CLIP) لتناسب قائمة طعامك الخاصة تماماً.
ومع ذلك، هناك عقبة: لا يمكنك مراقبته أثناء الطهي. أنت فقط تحصل على الطبق النهائي.
المشكلة الخفية: الوصفة "المسمومة"
في هذا السيناريو، يمكن لشيف غير أمين أن يتبع تعليماتك بدقة، لكنه يضيف سراً "سماً" ضئيلاً وغير مرئي إلى الوصفة.
- الطريقة الطبيعية: إذا قدمت صورة لـ قطة، سيقول النموذج "قطة".
- الباب الخلفي (Backdoor): إذا قدمت صورة لـ قطة مع ذرة غبار صغيرة وغير مرئية (المُحفّز/Trigger) عليها، سيصرخ النموذج فجأة: "كلب!"
الجزء المخيف هو أن هذا "السم" لا يفسد الوصفة بأكملها. فالشيف لم يغير المكونات الأساسية (العمل الشاق للذكاء الاصطناعي)؛ بل قام فقط بتعديل بطاقة تعليمات صغيرة وغير مرئية (تسمى ضبط المطالبات/Prompt Tuning) تخبر الذكاء الاصطناعي بكيفية قراءة المكونات. ولأن المكونات الأساسية تبدو طبيعية، فإن فحوصات الأمان القياسية لا تستطيع العثور على السم.
الحل: CLIP-Inspector (الناقد الغذائي)
ابتكر مؤلفو هذه الورقة البحثية أداة تسمى CLIP-Inspector. فكر فيها كناقد طعام ذكي جداً، لا يكتفي بتذوق الطعام فحسب، بل يحاول هندسة "السم السري" عكسياً ليرى ما إذا كان موجوداً.
إليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. لعبة "ماذا لو؟" (عكس المُحفّز/Trigger Inversion)
يأخذ الناقد مجموعة من الصور العشوائية التي ليس لها علاقة بقائمة طعامك (مثل صور للسحب، أو الصخور، أو ازدحام المرور). تُسمى هذه الصور صوراً خارج التوزيع (OOD images).
يسأل الناقد النموذج: "إذا أضفت ذرة صغيرة غير مرئية إلى صورة السحابة هذه، هل يمكنني خداعك لتعتقد أنها 'قطة'؟"
- إذا كان النموذج سليماً: يبذل الناقد جهداً كبيراً لإيجاد تلك الذرة، لكنه يفشل. النموذج يقول ببساطة: "لا، لا تزال سحابة".
- إذا كان النموذج مسموماً: يجد الناقد ذرة محددة وصغيرة تجعل النموذج يصرخ "قطة!" فوراً. النموذج يقول في جوهره: "أوه، أنا أرى تلك الذرة! هذا يعني أنها قطة، مهما كان الشيء الآخر!"
2. "درجة الشذوذ" (العلامة الحمراء)
يكرر الناقد هذه اللعبة لكل فئة ممكنة (كلب، سيارة، شجرة، إلخ).
- بالنسبة للنموذج النظيف: يكون من الصعب خداع الذكاء الاصطناعي. "الجهد" المبذول لإيجاد خدعة ما يكون عالياً، ونسبة النجاح تكون منخفضة.
- بالنسبة للنموذج المسموم: يكون الذكاء الاصطناعي متلهفاً جداً ليتم خداعه لفئة معينة. يجد الناقد الخدعة بسهء، ويقع الذكاء الاصطناعي في الفخ في كل مرة.
تقوم الأداة بحساب "درجة العلامة الحمراء". إذا كانت إحدى الفئات سهلة الخداع بشكل مريب، يتم وضع علامة خطر على النموذج بأكمله.
لماذا يعد هذا أمراً بالغ الأهمية؟
- إنه سريع: يمكن للناقد فحص قائمة الطعام بأكملها في حوالي ساعة واحدة (باستخدام كمبيوتر قوي).
- إنه دقيق: في اختباراتهم، نجحت هذه الطريقة في كشف 94% من النماذج المسمومة، بينما كانت الطرق القديمة (مثل "Neural Cleanse") تعتمد على التخمين تقريباً (تحقق النجاح في أقل من 50% من المرات).
- إنه غير مرئي: "السم" الذي يستخدمه الطهاة السيئون صغير جداً لدرجة لا يمكن للعين البشرية رؤيته، لكن هذه الأداة يمكنها العثور عليه.
"العلاج" (إصلاح الوصفة)
تظهر الورقة أيضاً أنه بمجرد أن يجد الناقد "ذرة السم"، يمكنه استخدامها لـ علاج النموذج.
تخيل أن الناقد يقول: "يا شيف، لقد وجدت هذه الذرة التي تجعلك تسمي القطط 'كلاباً'. دعنا نأخذ بعض صور القطط الحقيقية مع تلك الذرة، ونعلمك مجدداً أن 'قطة + ذرة = قطة'".
من خلال القيام بهذا القدر الضئيل من إعادة التدريب، "ينسى" النموذج الباب الخلفي. يتم تحييد السم، ويصبح النموذج آمناً للتقديم مرة أخرى، دون أن يفقد قدرته على التعرف على القطط بشكل طبيعي.
الملخص
CLIP-Inspector هو حارس أمن لنماذج الذكاء الاصطناعي. إنه يفترض أن النموذج قد يكون كاذباً. يحاول خداع النموذج بصور عشوية وذرات غير مرئية. إذا وقع الذكاء الاصطناعي في الفخ بسهولة شديدة، فإن الحارس يعلم أنه قد تعرض للتخريب ويمكنه حتى المساعدة في إصلاحه قبل أن يُستخدم أبداً في العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.